小米公开MiMo-V2.6大模型RL训练过程 罗福莉发文确认将开源技术细节

小米MiMo大模型团队负责人、前DeepSeek研究员罗福莉于9月17日凌晨在X平台发文,首次公开旗下最新大模型MiMo-V2.6的强化学习(RL)训练进展,同步上线mimo.xiaomi.com/rl/实时训练页面,开启大模型RL阶段的全程公开直播。作为雷军从DeepSeek引进的“95后”AI科学家,罗福莉曾主导达摩院多语言预训练及DeepSeek-V2研发,于2024年11月正式加盟小米并执掌MiMo大模型团队,其主导的上一代万亿参数模型Mimo-V2-Pro曾登顶Artificial Analysis全球大模型综合智能榜第八位(品牌榜第五位)。

小米公开MiMo-V2.6大模型RL训练过程 罗福莉发文确认将开源技术细节

罗福莉官宣MiMo-V2.6启动RL全流程透明化直播

罗福莉在发文中明确表示,团队过去半年专注于研究强化学习的扩展上限,此次公开的MiMo-V2.6-Pro与MiMo-V2.6-Flash两个版本正在开展大规模多任务智能体(Agent)RL实验,团队的目标是将两个版本的RL训练扩展到当前技术可行性的极限。其强调“RL是通往自我进化最可扩展、最高效的路径”,小米此次是认真要把Agent RL跑通。直播页面实时呈现训练进度、Token消耗与成本指标,相关技术细节将在未来数周内逐步开源。

MiMo-V2.6三大维度升级实现Agentic RL规模化