微软最新模型 MAI-Image-2.5-Pro、MAI-Voice-2-Flash 发布:未蒸馏第三方产品,已落地 Bing 及 PowerPoint 等场景
七大新模型亮相,微软首次公开“零蒸馏”家族
微软在Build 2026上一次性发布七款MAI模型,涵盖推理、编程、图像、语音、转录五大模态。官方强调,这些模型并非基于第三方蒸馏,而是“从零开始、干净数据血统”训练而成,旨在为开发者提供完整的第一方AI技术栈。模型家族包括MAI-Thinking-1(推理)、MAI-Code-1-Flash(编程)、MAI-Image-2.5(图像)、MAI-Transcribe-1.5(转录)和MAI-Voice-2(语音),以及对应的Flash轻量版本。微软AI部门负责人穆斯塔法·苏莱曼表示,这一策略与行业“卷参数、卷蒸馏”的主流路径截然相反,更注重长期竞争力的构建。
MAI-Image-2.5:文本渲染与编辑能力跃升,已嵌入PowerPoint和OneDrive
MAI-Image-2.5在Arena.ai图像生成榜单首发即位列第三,并在文本渲染、风格化插图和商业图像方面取得显著进步。该模型新增了图像到图像编辑功能,提供“保真可控编辑”能力,能够精准保留人脸、Logo和细节。微软还推出了MAI-Image-2.5 Flash,作为更快速、更高效的选项。目前,MAI-Image-2.5已经直接集成到PowerPoint和OneDrive中,用户可无需额外调用API即可生成和编辑图片。定价方面,通过Atlas Cloud等平台,标准版文本生成图像每张低至0.05美元,Flash版每张0.03美元,编辑版相应加价。

MAI-Voice-2与MAI-Transcribe-1.5:多语言音频技术栈,情绪控制与极速转录
MAI-Voice-2支持多语言代码切换(code-switching)和情绪控制,能在长内容中保持说话人身份稳定。MAI-Transcribe-1.5则在43种语言上同时取得准确度和速度第一,处理一小时音频仅需15秒。这两款模型共同构成了微软的多语言音频技术栈,面向语音生成和转录场景,可应用于实时翻译、语音助手和内容创作。
从零构建的专精模型:效率与性能的平衡艺术
微软此次没有采用“一个大模型通吃”的策略,而是为每个任务设计专用模型,并用干净数据训练。MAI-Code-1-Flash在SWE-Bench Verified上达到71.6分,比Claude Haiku 4.5高5分,比Pro版本高16分,同时节省60%的token成本。MAI-Image-2.5在图像编辑排名第二、文本生成图像排名第三。这些模型之间被设计为“无缝协作的家族”,而非各自为战。微软公开了所有技术细节和学习心得,旨在推动行业思考“血统干净”和“任务专精”的价值。
落地场景一览:从Bing到Copilot,开发者即刻可用
尽管微软未直接提及Bing,但MAI-Code-1-Flash已在Copilot中逐步上线,MAI-Image-2.5已嵌入PowerPoint和OneDrive,MAI-Voice-2和MAI-Transcribe-1.5也通过Microsoft Foundry(国际版)提供API。开发者可通过Atlas Cloud等第三方平台按需付费访问MAI-Image-2.5系列,并使用OpenAI兼容的key,实现Day-0接入。这意味着微软最新AI能力已快速进入生产环境,覆盖办公、搜索和开发工具。