谷歌开源26B参数文本扩散MoE模型DiffusionGemma,推理速度最高提升4倍,采用Apache 2.0许可,专为本地低延迟场景设计。
在14项基础测试中,MobileMoE-S/M仅用稠密基线1/2到1/4的计算量即达到持平甚至更高准确率,在iPhone 16 Pro上输入阶段最高提速3.8倍,将MoE高效推理首次带入商用手机。