研究实锤:世界模型根本不懂物理定律,属于它的“ChatGPT时刻”还很远

图灵奖得主LeCun炮轰:自回归模型根本不懂物理

自ChatGPT横空出世以来,关于它是否真正理解世界的争论从未停止。图灵奖得主、Meta首席人工智能科学家Yann LeCun多次公开抨击,认为以GPT-4为代表的自回归语言模型“没有前途”。在2023年的一次演讲中,LeCun明确指出,GPT类模型本质上只是对海量文本的统计建模,它们擅长预测下一个词,却对物理世界的因果关系、空间结构和时间演化一无所知。他警告,这种“自回归”技术路线寿命不会超过5年,真正的通用人工智能必须建立在能够理解物理定律的“世界模型”之上。LeCun的看法并非孤例,多位学者在相关研讨会上也指出,大模型在涉及物理常识的推理任务中频频翻车,比如无法准确判断物体在倾斜平面上的运动轨迹,或是因为“一杯水倒扣在桌上是否漏水”这种简单问题而陷入逻辑混乱。

研究实锤:世界模型根本不懂物理定律,属于它的“ChatGPT时刻”还很远

实验实证:代码会写,但“水杯会倒”吗?

除了理论批判,一系列实验研究更直接地揭示了世界模型的“物理盲区”。研究者发现,尽管GPT-4能轻松通过编程考试、甚至帮助用户解决“狗中毒”这种紧急医疗问题(因其能快速检索并整合知识),但在最基本的物理直觉测试中却表现糟糕。例如,北大“韦神”出的一道数学题,ChatGPT仅能给出逻辑看似正确但实际错误的答案;而一项针对语言歧义理解的测试更显示,GPT-4无法完全理解因背景知识缺失导致的歧义句,这正是因为它缺乏对物理世界的具身认知。更直接的证据来自一项针对“世界模型”的专项研究:模型在回答“把一个球放在桌子上,然后推一下,球会怎样?”这类问题时,能正确输出“球会滚动”,但当被追问“如果桌子是倾斜的,球会怎样?”时,它可能仍会回答“球会滚动”,而无法内化“重力方向”这一基本物理定律。这说明,模型学到了“滚动”这个词汇的关联,却没有学到“力”与“运动”的物理本质。

面向物理世界的“智能”为何如此难学?

为什么大模型在物理常识上如此脆弱?核心原因在于其训练范式的根本缺陷。当前的大语言模型主要通过“下一词预测”任务来学习,它们从海量文本中捕捉的是词语之间的统计规律,而非物理世界的运行规律。文本中并不包含真实的物理交互数据,例如“摔倒”这个词在文本中出现的频率很高,但模型从未体验过“摔倒时的加速度、疼痛感、地面反作用力”等物理信号。正因如此,模型无法构建一个能预测物理事件因果链的“世界模型”。正如LeCun所强调,真正的世界模型需要能够对世界进行抽象表示,并基于这个表示进行推理和规划,这与纯粹的文本预测有本质区别。此外,已有研究试图通过“反思”机制(让模型重新审视自己的输出)来提升代码能力(提升了21%),但在物理推理任务上,这种反思带来的提升依然有限,因为模型缺乏物理世界的“真实锚点”来进行自我纠错。

距离“世界模型”的ChatGPT时刻还有多远?

尽管行业对“世界模型”寄予厚望,甚至出现了“Manus”这类工具调用能力被视为“Anthropic的ChatGPT时刻”,但需要清醒认识到,这并非物理世界模型本身的突破。Manus的成功在于将Claude模型的工具使用能力包装成惊艳的产品体验,它本质上仍是语言模型在数字世界中的高效执行。真正的物理世界模型,如NVIDIA的Cosmos(用于物理AI仿真)或Google的Genie,目前仍处于非常早期的研究阶段。它们需要海量的、带物理标签的真实世界数据进行训练,而这比文本数据昂贵得多。更重要的是,物理世界模型的计算复杂度极高,在现有的硬件水平下,要像ChatGPT那样实现“人人可用”的实时推理,几乎不可能。正如NVIDIA黄仁勋所说,从Pascal到Blackwell GPU,八年间性能提升了1000倍才勉强支撑起GPT-4的规模,而物理世界模型对算力的需求可能还要高出几个数量级。因此,当ChatGPT已经被用来写代码、做客服、甚至组织游行时,世界模型还在为“一个杯子掉到地上会碎”这种常识问题苦苦挣扎——属于它的“ChatGPT时刻”确实还很遥远。