世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型

从游戏引擎到真实世界:Matrix-Game的实时交互进化

Matrix-Game选择从游戏切入,因为游戏天然符合“输入状态、输入动作、输出下一帧”的世界模型范式,且游戏引擎可相对可控地产生动作、状态和场景数据。团队将可交互世界模型描述为一种“面对模型而不是面对游戏引擎”的游戏:用户提供第一帧画面,再通过键盘、鼠标、语音或文本操作,模型实时生成后续世界。Matrix-Game 3.0 实现了720P下40fps实时推理,并加入一分钟的记忆;3.5版本则进一步从游戏场景泛化到真实场景,支持真实世界与游戏世界之间的语义转场、动态物体和复杂场景变化。这一进展意味着模型不仅学会了游戏内的物理规律,更开始理解真实世界中的接触与交互,为隐式触觉学习奠定了基础。

隐式动作表征:如何从无标签视频中学习物理后果

简单采集大量游戏视频并不够,因为动作信号稀疏且反写不确定,同样画面变化可能来自鼠标、键盘或二者组合。模型不仅要学动作表征,还要理解动作执行后的物理后果,这正是一种隐式的“触觉”理解——无需真实触觉传感器,仅通过视觉观察物体在受力后的形变、滑动、碰撞等变化,模型就能推断出接触的物理属性。团队建立三条数据管线:在引擎中搭建场景并部署agent自由探索,自动化游戏搭建、探索、录制和标注,以及开放平台收集并标注游戏数据,目前已积累约500万个高质量视频切片、1万多小时有效训练数据和1200多个训练场景。由于人类视频缺少动作标注,团队使用latent action方案:训练VAE形成瓶颈,迫使模型学到动作信息,再用它为人类视频打上latent action标签。适配具体机器人时,只需将第一层MLP重置为目标action space维度并做高效适配。这种隐式动作表征让模型能够从海量视频中“触摸”到物理世界的运行规律。

世界模型有触觉了!50万小时视频,训出首个隐式触觉世界动作模型

DreamZero:统一预测世界状态与机器人动作的World Action Model

DreamZero将世界模型思想推到policy端,提出World Action Model(WAM):基于预训练video diffusion backbone,同时预测未来世界状态和机器人动作。相比传统VLA只做action regression,WAM用视频作为dense supervision,让模型学习物理运动和动作后果,特别是接触丰富的灵巧操作任务(contact-rich, dexterous task)。DreamZero的一个标志性结果是把14B自回归视频扩散模型优化到闭环控制频率,并在新任务、新环境和跨embodiment上显示出比传统VLA更强的泛化。这种统一框架实质上将“触觉”经验内化于模型——模型通过视频隐式理解了手部与物体接触时的力反馈、摩擦和形变,从而在零样本条件下也能生成合理的抓取和操控动作。

视频生成路线与3D生成路线的触觉之争

视频生成路线在过去一两年成为世界模型最引人注目的方向,因为视频数据天然包含物理运动、加速度、重力等物理特征,模型能够直接“看到”真实世界的运作方式。但视频生成的内部对世界的理解是“隐式”的——我们无法直接读取,也无法移植到机器人或者决策系统当中。例如,让Sora生成一辆车行驶的视频,造型和光影可能很逼真,但问“被挡住的轮胎在哪里”它答不上来。而3D生成路线则能生成显式结构,模型知道每个物体的具体位置,确保碰撞、遮挡、施力等表现严格正确,成为“可操作世界模型”的底座。在触觉层面,3D模型天然支持物理模拟,可精确计算接触力与变形;视频模型则通过隐式统计规律捕捉接触的宏观表现。当前,两者正在融合,如Motus提出unified latent action world model,用一个框架同时做video generation、world modeling、inverse dynamics和action prediction,试图在隐式与显式之间搭桥,实现对物理接触的全面理解。

世界模型作为物理AGI的数据引擎与策略环境

朱政将世界模型在具身中的作用概括为三类:数据引擎,可以低成本、高保真生成训练数据;策略环境,即仿真器,可与policy进行状态反馈和交互;策略生成器,不仅输出未来动作,还能输出未来状态甚至奖励,使模型像人一样持续学习和自我进步。团队发布的GigaWorld0主要作为数据生成器,支持视频生成、纹理泛化、视频编辑、视角泛化和跨本体生成;GigaWorld1则希望成为生成式具身仿真环境,服务闭环仿真与强化学习。高深远则提出autonomous large-scale self-improvement loop:agent提出任务和动作proposal,world model模拟后果,agent再基于新状态继续提出下一步,从而降低真实世界执行成本。这些进展表明,世界模型正在从“被动预测”走向“主动模拟”,将隐式触觉知识转化为可操作的策略,为物理AGI铺平道路。