比「算力荒」更致命,「数据荒」正在带来灾难?

当我们还在为英伟达H100一卡难求而焦虑时,一个更隐蔽的危机正在AI产业链底层蔓延。算力荒是产能问题,有明确的扩产周期——台积电CoWoS封装月产能从2023年的1.4万片晶圆跃升至2025年的7万片,预计2026年底达到13万片。但具身智能面对的数据荒,是一场真正的“维度灾难”。

算力有摩尔定律,数据却无教科书可爬

大语言模型可以吞噬互联网上人类千年积累的45TB文本资料,但机器人要理解物理世界,没有现成的“教科书”。一个简单的“拧瓶盖”动作,背后是材质、螺纹摩擦力等无数隐藏变量,这些变量从未被互联网这个“大模型粮仓”储存过。更致命的是,数据无法像算力一样迁移复用:一台1.6米高的机器人采集的“弯腰捡拾”数据,对1.8米高的机器人几乎无效。这意味着具身智能的数据被锁在硬件与场景的“孤岛”中,相互隔离、难以复用。

比「算力荒」更致命,「数据荒」正在带来灾难?

三条数据采集路线的突围与妥协

面对数据荒漠,业界探索出真机遥操作、无本体UMI采集、仿真合成数据三条技术路线。真机遥操作精度最高,但每小时只能获取数百条有效动作数据,成本极其高昂;UMI采集通过无本体方式一次性获取多模态信息,但缺少真实物理反馈;仿真合成数据可无限生成,却面临“Sim-to-Real Gap”——虚拟世界的物理规律与真实世界永远存在偏差。这三条路线分别代表了精度、规模与成本的极致权衡,至今没有一条能完美兼顾三者。

万亿算力投入背后,是数据缺口引发的冰火两重天

2025年OpenAI启动“星际之门”项目,计划四年内投资5000亿美元建设AI基础设施;中国也规划五年投入约2万亿元建设全国互联数据中心网络。巨头们押注算力,每年支出的“弹药”高达数千亿美元。然而,训练一个通用泛化的具身模型需要千万甚至亿小时级别的真实操作数据,截至2026年初,全球可用的高质量物理交互数据仅约50万小时,缺口超过99%。算力军备竞赛如火如荼,具身智能的训练数据却几乎原地踏步。

无头交互时代:算力越强,数据断层越致命

当AI智能体开始跨平台、跨应用执行任务时,一个更棘手的数据断层面出现了。智能体在用户后台穿梭时,会因隐私保护切断传统追踪参数、屏蔽设备标识,导致企业增长团队完全无法判断高价值转化来自哪个AI助手、哪次私域分享或哪个广告投放。传统的广告归因体系在“无头交互”时代宣告失效,企业陷入“流量失明”——算力越强大,智能体越活跃,企业对用户行为数据的认知越模糊。这种数据断层,正在从消费互联网向产业互联网蔓延,成为比算力短缺更长期的系统性危机。