智元全模态大模型,登顶全球第一!力压谷歌英伟达,跑赢大厂

六项第一碾压群雄,智元大模型登顶权威榜单

7月28日,复旦大学研究团队发布的“每日全模态交互能力评测”(DailyOmni)最新榜单显示,智元硅光动语大模型预览版(WITA-Omni Preview)以85.21分的综合成绩登顶榜首。这一成绩力压千问、谷歌双子座(Gemini)、豆包以及英伟达旗下模型,在八项细分指标中斩获六项第一。DailyOmni是行业公认的检验大模型音视频时序对齐与跨模态联合推理能力的权威第三方榜单,重点考察模型在真实开放环境下的“全模态感知”能力,即机器人能否在复杂物理空间中精准判断“谁在说话”“事件发生的先后顺序”,并做出恰当的交互决策。智元此次登顶,标志着国产大模型在全模态感知领域已具备世界领先水平。

智元全模态大模型,登顶全球第一!力压谷歌英伟达,跑赢大厂

独创“思考—表达—行动”三层架构,攻克机器人交互割裂难题

传统机器人“听、看、说、动”思维割裂,交互生硬。智元硅光动语大模型针对这一痛点,独创了“思考—表达—行动”(Thinker-Talker-Actor)三层端到端架构。在该架构下,机器人依靠视觉来理解物理世界,不再额外需要语音或文字指令,实现了感知、决策与表达的统一驱动。智元技术专家表示,这不仅要求模型“听得懂”,更要求它“会看眼色”。通过这一架构,模型学会了在多人复杂场景中判断“该不该回应、何时回应、回应谁”,从而真正实现拟人化交互。

千万小时级数据训练与三阶段特训,打造“老师+学生”双模型机制

硅光动语大模型在训练过程中采用了千万小时级多模态数据基座,并结合“监督微调—同策略蒸馏—强化学习”三阶段特训。其中,技术专家解释称,智元同时模拟了“老师”和“学生”的角色:“老师”模型在获得额外信息的情况下生成高质量答案,然后将这种能力复制给无额外信息的“学生”模型。同时配备“奖惩机制”,让大模型生成内容保持表达风格统一,并大幅提升复杂音视频上下文中的推理能力。此外,在训练阶段,智元使用了总计千万小时级的开源和自有多模态数据,将强文本、视觉底座进一步升级为能够“听得见、看得懂,并进行音画联合推理”的全模态模型。

国产力量集体崛起,智元加速人形机器人商用落地

在此次榜单前五名中,除了智元,千问、豆包等多款国产大模型亦跻身前列,彰显了中国人工智能在全模态感知领域的技术优势。今年5月,硅光动语大模型通过备案,成为全国首款合规备案的具身智能交互大模型,进入合规商用阶段。据智元官方透露,硅光动语大模型在未来将与负责物理操作的“视觉—语言—动作”(VLA)模型,以及提供虚拟训练环境的世界模型GE-Sim 2.0深度协同,加速人形机器人在商业服务、公共导览等场景的规模化落地。