世界模型大混战:55家公司,7个门派,谁在真做世界模型?

9 天前
4 阅读

蚂蚁灵波开源通用世界模型LingBot-World

近日,蚂蚁集团旗下具身智能公司蚂蚁灵波正式开源通用世界模型LingBot-World,全面开放代码与模型权重,且不绑定特定硬件平台,成为国内首个走通开源路径的通用世界模型产品。该模型沿袭DeepMind Genie的生成式技术路线,在交互能力、动态稳定性、时序连贯性及物理一致性上取得显著进展,实现了从“生成”到“模拟”的能力跨越。测试显示,模型可精准还原物理规律,如鸭子蹬水动作与水面的流体力学响应、智能体运动的空间逻辑均符合现实认知,即便在长时间无观察场景下也能维持状态记忆。一段长达9分20秒的无剪辑生成视频验证了其稳定性:从古希腊神庙出发的连贯场景中,物理状态与视觉质量在近十分钟内保持高度一致,生成时长远超Veo 3(8秒)、Sora 2(25秒)等闭源方案,在开源条件下实现了720p分辨率的高动态表现。VBench测试中,该模型全面领先Yume-1.5等开源竞品,证明其不仅是视频生成工具,更是可交互的物理模拟器。
其构建的高保真物理沙盒支持自然语言控制环境风格切换(如“冬季”“像素风”),还能精确生成特定物体(如烟花),可低成本模拟自动驾驶极端场景,为具身智能提供多步骤决策训练环境。结合视觉-语言-动作模型LingBot-VLA后,系统可预演动作轨迹筛选安全路径,甚至能微调出自主智能体,实现环境与动作的双向实时影响,暗示世界模型未来或成为驱动智能体的核心底座。

世界模型大混战:55家公司,7个门派,谁在真做世界模型?

生成式与预测规划两派正面交锋:路线分歧成行业核心争议

当前世界模型领域的技术路线已形成两大核心流派,55家布局玩家也大致归入7个技术门派,核心分歧在于“AI理解世界的方式”。
生成式流派以OpenAI、Runway、Google DeepMind为代表,核心理念是“生成即理解”——主张模型若能高度精准预测视频下一帧、在长时间跨度内保持场景连贯性与物理合理性,便会在神经网络权重中隐式习得重力、碰撞、流体等物理规律。该流派主要依托Transformer或扩散模型的序列建模能力,在大规模视频数据上预训练,通过拟合像素分布实现世界模拟。2025年该流派成果密集:夏季DeepMind推出实时交互模型Genie 3,打破视频生成的线性叙事限制,实现“交互即生成”;秋季OpenAI发布Sora 2,引入音画同步能力,视觉逼真度再上台阶;同期World Labs推出可编辑3D场景模型Marble,将竞争维度从2D拓展至3D空间;年底Runway发布强调导演级控制的Gen-4,中国快手推出融合思维链推理的Kling O1,试图解决物理一致性难题。
然而该流派饱受争议,Meta首席科学家Yann LeCun批评其“在细节中迷失”,认为模型耗费大量算力预测草叶纹理、水波反光等无关细节,并未真正掌握底层因果逻辑,容易产生符合视觉习惯但违背物理定律的“幻觉”。与之对立的预测规划流派以Meta及Yann LeCun的AMI Labs为代表,主张“交互即智能”,认为世界模型无需执着于像素级视觉重建,应在抽象潜在空间中对环境状态变化进行预测,关注车辆位置、速度等影响决策的关键特征,忽略树叶摆动等无关细节。该流派采用联合嵌入预测架构(JEPA)等自监督学习方法,通过遮挡预测任务提取高层语义特征,更侧重服务于机器人决策的抽象推理能力。

头部玩家密集落子:从学术奠基到产业落地全面押注

世界模型赛道的爆发吸引了大量头部玩家入局,目前已形成55家玩家、7个技术门派的竞争格局,头部玩家的布局呈现出学术背景与产业落地并重的特点。
李飞飞创立的World Labs是赛道明星,2026年2月刚完成10亿美元融资,估值达54亿美元,Autodesk注资2亿美元,其产品Marble可从单张图片生成可交互的3D世界,保持空间一致性与物理逻辑,用户可在浏览器中实时漫游。Yann LeCun亲自带队的AMI Labs已融资5亿欧元,估值30亿欧元,LeCun多年来一直宣称“大语言模型永远无法实现通用智能,世界模型才是正途”,此次押注被视为其学术理念的落地实践。Google DeepMind的Genie 3是首个实时交互的通用世界模型,能以24帧每秒的速度生成可导航的3D世界,技术积累深厚。
此外,Runway已融资3.15亿美元全面转向世界模型赛道,NVIDIA推出的Cosmos平台下载量已超200万次;国内银河通用刚拿下25亿元融资刷新具身智能单轮融资金额,前京东副总裁、瑞幸咖啡CTO何刚也创业切入家庭陪伴机器人赛道,周鸿祎、陆奇投资的Loop世界模型论文已登顶Hugging Face榜单,多家央国企也在测试落地因果世界模型。值得一提的是,OpenAI日前关停视频生成应用Sora,宣布将研究团队转向世界模拟领域,瞄准机器人技术赛道,尽管入局较晚,但其在Sora上积累的视频理解能力、顶尖人才储备与资金优势仍使其成为不可忽视的玩家。

落地场景逐步清晰:成为具身智能与自动驾驶的核心底座

当前世界模型的应用价值已在多个产业端得到验证,逐渐从实验室走向落地。具身智能领域,世界模型构建的高保真物理沙盒可低成本模拟各类极端场景,为机器人提供多步骤决策训练环境,避免真实场景测试的高成本与高风险;因果世界模型已在35家大型央国企完成实测,可实现工业场景的因果推演与决策优化。自动驾驶领域,世界模型可模拟暴雨、冰雪等极端驾驶场景,帮助自动驾驶算法完善边缘case应对能力。
近期量子位报道的机器人三视角世界模型评测中,国产适配昇腾算力的世界模型登顶李飞飞团队榜单,代码与权重全开源,进一步降低了行业应用门槛。技术