李飞飞学生发起国际具身人类数据标准,光轮智能成唯一参与中国企业
李飞飞学生发起全球首个具身人类数据标准
佐治亚理工学院助理教授Danfei Xu,在斯坦福攻读博士期间由李飞飞和Silvio Savarese共同指导,长期致力于让机器人从人类演示中学习并实现跨任务、跨环境、跨本体的迁移。这一研究线最终汇入EgoVerse——一套持续增长的第一视角人类操作数据生态与标准。
EgoVerse的核心目标只有一个:让全球具身数据按照同一套“语言体系”流动。不同团队使用各自的采集设备、坐标体系、动作标签和任务定义,即便两家机构都采集了“把杯子放到碟子上”,两份数据也无法直接合并训练。EgoVerse通过共享协议,让不同实验室在统一框架下重复实验、验证数据迁移效果,从而打破数据孤岛。
1362小时人类演示:EgoVerse数据生态初具规模
EgoVerse当前公开版本包含惊人的数据量:
- 1362小时人类演示视频
- 约8万个episode
- 1965项任务
- 240个场景
- 2087名采集者

数据不仅包含第一视角视频,还提供相机位姿、三维手部信息以及细粒度语言描述。联盟伙伴阵容豪华,包括佐治亚理工、斯坦福、苏黎世联邦理工、UC San Diego等学术机构,以及Meta、Scale AI、光轮智能、Mecka AI、MicroAGI、Trace Labs等企业。佐治亚理工承担组织中枢和研究框架角色,负责代表任务“object-in-container”;斯坦福负责双臂精细操作;UC San Diego和ETH Zurich参与长时序双臂任务验证。
跨越“具身鸿沟”:从人类双手到机器夹爪
人类有柔软灵活的双手,机器人可能只有两指夹爪;人可以依靠触觉、经验和身体协调完成任务,机器人却需要明确的观测和动作表示。人类数据并不会天然变成机器人能力,中间横着一道“具身鸿沟”。
斯坦福REAL Lab(由Shuran Song带领)开创的UMI(Universal Manipulation Interface)是打通这条路径的代表:使用便携式手持夹爪采集真实环境中的操作,再转化为可部署的机器人策略。Meta研发的Project Aria则提供“大规模基础模型”专用数据采集硬件——第一视角RGB相机、SLAM和手部追踪的同步场景相机,将“人看到了什么”升级为“人在三维世界中如何行动”。
光轮智能:唯一中国企业的“数据质量”三把斧
光轮智能作为唯一参与EgoVerse的中国企业,构建了一套贯穿端侧采集、云端处理和仿真验证的高质量数据控制体系。
第一把斧:端侧Agent实时质检
光轮智能的Agent驱动采集体系,围绕设备状态、任务流程、动作完整性和有效视角进行实时检查,发现风险时推动现场纠偏或补采。Agent还能根据已有数据分布,调控下一轮需要采集的人群、场景、任务与动作类型,避免数据规模增长后出现大量重复样本。
第二把斧:跨硬件统一云端处理
与绑定某一款眼镜或采集设备的方案不同,光轮智能的目标是让数据管线兼容不同硬件——无论原始数据来自Aria、iPhone、头戴相机还是其他多模态设备,都可以进入统一云端管线。处理流程包括视觉惯性里程计(VIO)、三维手部与Body标注、V7级动作语义标注,将异构原始数据转化为同一质量标准下的训练资产。
第三把斧:仿真验证闭环
数据完成处理后,光轮智能利用自研物理仿真平台SimFoundry和工业级评测平台RoboFinals,验证动作轨迹、物理关系和任务过程能否被合理还原,判断数据是否真正具有机器人学习价值。评测过程中发现的失败案例,会反馈给采集端,指导下一轮数据采集,形成持续优化的闭环。
从标准使用者到定义者:光轮智能的双重角色
光轮智能不仅参与EgoVerse,还同时进入了另一条重要基础设施——由NVIDIA、Google DeepMind、Disney Research联合发起的物理仿真标准Newton(技术指导委员会包括上述三家及光轮智能、Toyota Research Institute)。光轮智能同时参与EgoVerse与Newton,意味着其建设的已不只是今天的工具链,而是未来全球具身智能产业共同遵循的底层基础设施。这也标志着中国企业开始从标准的使用者,走向全球物理AI基础设施规则的共同定义者。