对话昆仑万维方汉:世界模型“算账逻辑”之下,异构数据才是具身智能的解药
算账逻辑倒逼世界模型路线调整
在AI行业普遍追求大算力、大参数的背景下,昆仑万维方汉团队提出了独特的“算账逻辑”——即每一分投入都必须能测算出明确的商业回报或技术边际收益。短期来看,世界模型研发必须聚焦于仿真训练数据的低成本获取,而非盲目堆砌算力;中长期则需将资源精准投向具身智能、工业AI与智能驾驶等高价值落地场景。这种务实策略意味着,世界模型不再追求“万能模拟”,而是成为特定物理任务的“成本优化器”。
持续学习是通往智能奇点的必经之路
方汉团队推测,AI智能化的时间表遵循明确阶梯:先解决持续学习,让模型能在新环境中自主微调而不遗忘旧知识;再跨越到“智能奇点”,即模型具备自我迭代能力;最后才是具身智能走进现实世界。持续学习能力是当前几乎所有大规模模型的软肋——算力成本高昂使得模型无法频繁更新,而异构数据恰恰能提供多样化的低代价训练信号,让模型在碎片化场景中持续进化。
异构数据如何破解具身智能的“数据饥渴”
具身智能面临的核心矛盾是:真实物理交互数据采集成本极高,而纯仿真数据又存在“Sim-to-Real”鸿沟。方汉认为,异构数据(包括视觉、触觉、力觉、文本、3D点云等不同模态)正是解药——通过将不同结构、不同来源的数据进行对齐与融合,模型能学习到更鲁棒的物理规律。例如,利用思维增强的大模型(如“Thought Is All You Need”方法)检测智能合约漏洞,或者用REEVMBench评估智能体安全性,都体现了多模态异构数据训练的潜力。
从仿真到具身:工业与家庭场景的落地博弈
在“算账逻辑”驱动下,具身智能的落地路径被划分为工业AI(如产线质检、物流分拣)和家庭智能体(如服务机器人、车载边缘计算)两大阵营。前者对数据精度要求高,但回报周期清晰;后者场景更碎片化,需依赖异构数据中的低分辨率信息(如激光雷达、家庭摄像头数据)进行快速部署。方汉团队指出,真正让具身智能“走进现实”的关键,在于建立一套兼容异构数据流的低成本仿真训推平台。
多模态视觉升级:中国AI基础模型的下一站
海外头部厂商(如Claude Fable)已展现出强大的多模态能力,而国内自研模型(如K3)虽尚未摸到该水准,但追赶速度惊人。方汉强调,中国AI基础模型的下一个关键升级方向正是多模态/视觉理解能力的增强——这不仅是技术竞争,更是“算账逻辑”的必然选择:仅靠文本数据训练,边际收益已递减;而异构数据(尤其是视觉与物理交互数据)将为模型打开新的价值空间,直接支撑具身智能、服务机器人、车载边缘计算等下游核心赛道。