北国咨观点 | 从“预测下一个词”到“预测下一个物理状态”:世界模型为什么突然火了?
-
首页
-
北京国际工程咨询有限公司
-
2026-08-12
-
点击次数:
-
字号:大中小
-
2026年上半年,全球“世界模型”赛道融资爆发,国内发生46起融资总额超400亿元,33家企业密集抢跑,超10家估值破百亿。6月23日,世界经济论坛发布《2026年度十大新兴技术报告》,将世界模型列为未来三至五年内最有望产生现实影响力的突破性前沿技术。从学术概念到产业风口,世界模型正以惊人的速度成为AI领域最受瞩目的焦点。
一、从“背答案的学霸”说起
有一个学生,把三十套模拟卷的答案全部背下来了,每次考试都能拿高分。但你让他讲一道题的解题思路,他讲不出来——他只记得这道题选C,不记得为什么选C。
在AI圈,这种“背答案”有个专业名字叫“过拟合”。过去几年横扫全球的大语言模型(LLM),某种程度上就是一个“超级背答案选手”——它背下了人类互联网上几乎所有的文本,知道“玻璃杯掉到地上会碎”这句话在无数文章里出现过,所以它知道这个答案。
但它真的理解为什么杯子会碎吗?不知道。它没摔过杯子,没见过玻璃碎片飞溅的画面,没听过那声清脆的碎裂响。它只是在“猜下一个词”。
这就是大语言模型的根本局限:它擅长处理符号,却不理解符号对应的真实物理规则。它知道“水会流”,但不理解水为什么往下流;它知道“车会刹车”,但不理解湿滑路面和干燥路面刹车距离的差别。
二、世界模型:让AI从“背答案”变成“懂物理”
那怎么办?答案就是世界模型。
世界模型要做的,不是“预测下一个词”,而是“预测下一个物理状态”。简单说,就是让AI像人类一样,在看到世界之后,能在脑子里“想象”出接下来会发生什么。
一个小孩看到杯子放在桌边,即使杯子还没掉,他大概知道杯子很可能会掉下来;掉到地上可能会碎;如果里面装着水,水会洒出来。这种“根据当前状态预测未来”的能力,就是人类天生拥有的世界模型。AI目前还做不到这一点。
世界模型的核心目标就是让AI理解真实物理世界的空间、时间、因果关系和物理规律,从“预测下一个词”到“预测下一个物理状态”
三、为什么世界模型2026年突然火了?
世界模型这个概念其实一点也不新。早在1943年,心理学家克雷克就提出:生物体之所以能生存,是因为大脑里构建了物理世界的“工作模型”。1991年,强化学习之父Sutton正式提出了“世界模型”的概念。2018年,Google Brain又发表了一篇论文《World Models》正式把它带到AI圈。
但真正让这个词出圈的,是2024年OpenAI发布Sora——当时OpenAI直接管它叫“世界模拟器”。视频生成模型能生成逼真的画面,一下子让大家觉得:AI好像真的在“模拟世界”了。
进入2026年,事情变得更有意思了。
一方面,大语言模型的天花板越来越明显——再多的数据、再大的算力,它还是不懂物理。另一方面,自动驾驶、人形机器人这些“必须懂物理”的场景爆发了。资本开始疯狂涌入:李飞飞的World Labs融资10亿美元、估值50亿美元;杨立昆离开Meta创办AMI Labs,种子轮就拿了10.3亿美元;国内极佳视界三个月融了35亿元。一夜之间,世界模型成了AI圈最热的关键词。
四、到底什么是世界模型?
做视频的说自己是世界模型,做3D的也说自己是世界模型,做机器人的还说自己是世界模型。李飞飞都忍不住出来“辟谣”了——她说“世界模型”既是当下AI领域最重要的概念,也是被滥用最严重的术语。
那到底怎么区分?李飞飞给出了一个很清晰的分类。她把市面上自称“世界模型”的系统分成了三类:
第一类叫“渲染器”——负责回答“世界长什么样”。今天大家熟悉的AI视频生成模型,比如Sora、Runway、可灵等基本都属于这一类。它们能生成以假乱真的画面,但理解的是“看起来是什么”,不一定是“实际上是什么”。一个AI生成的街景航拍看着无比真实,但如果真让一辆车在里面开,建筑结构可能马上露馅。
第二类叫“模拟器”——负责回答“世界怎么运行”。它输出的不只是画面,而是几何、物理、动力学层面的状态信息。一座桥会不会变形、一辆车在不同天气下会怎么开,模拟器能算出来。李飞飞认为,模拟器才是最接近世界模型本体的那个。
第三类叫“规划器”——负责回答“我们下一步该做什么”。机器人下一步该往前走还是伸手抓?自动驾驶该刹车还是变道?规划器输出的是行动本身。
这三类模型共享同一套底层知识——几何、物理、动力学。而当前最重要的趋势,就是这三者的边界正在不断消融,最终可能走向一个能灵活切换输出形式的大一统世界基础模型。
综合顶尖学者、研究机构及前沿论文的核心观点,我们认为是以“预测物理世界下一状态”为核心目标,深度融合了多模态感知、世界状态表征、物理规律推理与行动规划的系统性技术框架。世界模型具备感知、理解、推理真实世界的时间、空间、物理规律与常识能力,有望成为面向真实物理世界的下一代基座模型,同时具备因果推理、时空一致性、物理规则模拟和执行与实施反馈的能力。
五、各种技术路线,谁更靠谱?
如果细拆一下,目前世界模型主要有五条技术路线在并行推进:
路线一:视频生成路线
以OpenAI Sora为代表,通过预测未来视频帧来“模拟”世界演化。这类路线坚信只要数据量足够大,物理规律就能从像素预测中自然涌现。其优势是能快速复用互联网海量视频数据,但短板同样明显——由于本质上是在“猜像素”,容易出现“左脚踩右脚上天”、杯子碎了又自动愈合等违背物理常识的“穿模幻觉”。智源研究院院长王仲远特别澄清:视频生成模型并不等同于世界模型,其训练目标并非还原真实物理规律,更接近“世界模拟”,并不具备完备的状态预测能力。
路线二:潜空间表征预测路线
以杨立昆倡导的JEPA架构为代表,主张在压缩后的抽象隐空间中预测世界状态的演化。其核心逻辑是抛弃解码器,通过自监督学习在抽象隐空间学习世界结构与因果关系。该路线优势在于计算经济性强、支持长程推演;短板在于可验证性缺失——没有生成式验证的抽象预测,本质上是实现了内部自洽却无法被外部检验是否真正理解了物理世界。
路线三:3D空间生成路线
以李飞飞创立的World Labs为代表,用可微分的三维场景表征来建模世界。承认纯2D像素预测会“穿模”,选择用数据驱动方式让模型自己“长出”对3D空间的认知。该路线优势在于能构建可交互的3D虚拟环境,但运算开销极高,面对衣服褶皱、流体飞溅等非刚体动态时,目前的算力供给仍难以实现高效处理。
路线四:端到端动作控制路线
直接面向机器人落地,可细分为VLA(视觉-语言-动作模型)和WAM(世界动作模型)两大范式。VLA以语言为认知桥梁,代表如谷歌RT系列;WAM则以视频世界模型为预训练基础,代表如英伟达DreamZero。该路线是当前融资最密集的方向,但VLA的根本缺陷在于绝大多数参数服务于语言而非物理知识,WAM则面临表征可解释性较弱的问题。
路线五:隐-显混合架构路线(综合派)
以英伟达Cosmos为代表,放弃单模型包揽一切,将系统拆分为推理器(侧重底层潜空间物理推演)和生成器(侧重视觉渲染)的前后端分离架构。该路线兼具隐空间的推理效率和显空间的直观可信,但架构复杂度高,需要协调多个异构模块的联合训练与推理。
六、小结:还没有一个“标准答案”
五条路线,五套打法,谁对谁错?
答案是:没有标准答案。每条路线都有自己的长板,也有自己的短板。视频生成派数据杠杆最强,潜空间派推理效率最高,3D派空间感最直观,具身派离落地最近,混合派系统最完整。
但它们都还没有任何一个能达到“完美理解物理世界”的理想状态。
正如王仲远所说:“至少未来三到五年,都会是世界模型持续演进迭代的阶段。”这是一场长跑,不是百米冲刺。
作者介绍
梁 雨
咨询师
长期关注人工智能领域产业规划、政策研究和项目咨询,参与编写多项课题、可研等,为政府和企业提供决策支持,具备丰富的项目咨询经验。
编辑:张 华
审核:兰国威