每小时烧掉三万美元!前DeepSeek大牛罗福莉加盟小米后首度直播大模型训练
9月17日,前DeepSeek核心研究员、现小米MiMo大模型负责人罗福莉在X平台公开了MiMo-V2.6的实时训练页面,这也是外界首次直观看到该代模型强化学习阶段的训练状态,高额训练成本与全公开的直播模式迅速引发AI行业热议。
罗福莉加盟小米后首度公开训练实况,全透明直播模式引行业围观
这是罗福莉去年11月官宣加入小米后的首次公开训练展示。彼时她在朋友圈发文称“智能终将从语言迈向物理世界”,透露正在负责小米首个推理大模型Xiaomi MiMo的研发,致力于推动AGI落地。此次直播训练的消息发布后,大量AI从业者、投资人涌入围观,不少网友调侃“一秒烧10美元,每分钟就是4000多元人民币,这才是真正的烧钱现场”。训练页面实时公开了模型训练进度、Token消耗、训练成本、样本数量、内部指标变化甚至显卡故障等全流程信息,完全透明化的展示方式在行业内极为罕见。
MiMo-V2.6双版本训练成本披露,Pro版每小时烧钱超2万美元
根据罗福莉公开的训练数据,截至发稿时,MiMo-V2.6的两个版本累计训练成本已超135万美元。其中MiMo-V2.6-Pro训练时长为1天21小时,耗费超93万美元,平均每小时花费超2万美元;MiMo-V2.6-Flash训练时长为1天16小时,耗费超42万美元,平均每小时花费超1万美元。综合计算,两个版本训练合计每小时花费约3.1万美元,折合人民币超20万元。
小米明确强化学习Scaling三路径,探索RL能力扩展边界
罗福莉在发文中透露,此次训练的核心目标是研究强化学习(RL)的扩展边界,团队正在从三个方向推进相关工作:
- 算力扩展:每步处理约20亿token,采用1568个提示×16次rollout的完全异步计算模式,最大化算力利用效率;
- 框架扩展:采用多任务代理式RL框架,在一次运行中混合多个测试框架,提升模型的泛化能力;
- 评估扩展:采用代理式组内信用分配机制,结合测试用例和基于量规的奖励计算方式,更精准评估模型表现。
她同时表示,团队未来几周将逐步开源此次训练的详细技术细节。公开训练数据也显示,两款模型在强化学习过程中均已出现明显能力提升:Pro的dynsam/avg@n从初始的约0.565提升至0.614,Flash从约0.514提升至0.603;最新DeepSWE v1.1离线评测中,Pro和Flash分别达到62.24和60.77。
95后AI科学家罗福莉带队,履历覆盖阿里达摩院、DeepSeek核心研发
罗福莉1995年出生于四川宜宾,本科就读于北京师范大学计算机专业,硕士毕业于北京大学计算语言学研究所计算语言学专业。求学期间,她曾在2019年人工智能领域顶级国际会议ACL上发表8篇论文,其中2篇为第一作者。
职业履历上,罗福莉早期任职于阿里巴巴达摩院,主导开发了多语言预训练模型VECO,并推动了AliceMind的开源工作;2022年加入DeepSeek母公司幻方量化从事深度学习相关工作,后担任DeepSeek深度学习研究员,参与研发DeepSeek-V2等知名模型。在今年3月的小米“人车家全生态”合作伙伴大会上,罗福莉完成了加盟小米后的公开首秀,她提出下一代智能体系统的核心将围绕Agent执行与Omni(全能)感知展开,涵盖记忆、推理、自主规划、决策、执行多个维度,大模型的发展方向应当从“回答问题”转向“完成任务”,同时统一多模态感知能力,为理解物理世界打基础。
行业关注高成本技术迭代风险,投资人提示需评估长期竞争力
此次小米公开大模型训练全流程的做法也引发了行业不同讨论。有行业投资人指出,强化学习扩展需要大量算力支撑,当前高额训练成本意味着技术迭代的门槛极高,若无法在成本控制上取得突破,模型能力很容易被其他技术路线或竞品超越。不过也有观点认为,完全公开的训练过程为行业提供了宝贵的参考样本,若小米能在强化学习Scaling上取得实质性突破,将具备极强的技术竞争力。整体来看,小米此次的探索具备创新性,但技术持续性与成本控制能力仍是后续需要关注的核心要点。