阿里发布 Qwen3.8-Omni-Flash 全模态模型:音视频能力提升,百万 Token 图文音视频输入 0.8 元

9月18日,阿里千问正式上线新一代原生全模态模型Qwen3.8-Omni-Flash,目前已登陆千问AI平台对外提供服务。作为可同时处理文本、图像、音频、视频多类输入的全模态模型,该版本在保持同尺寸文本模型核心能力的基础上,全模态综合能力较上一代Qwen3.5-Omni-Plus实现显著提升。

阿里发布 Qwen3.8-Omni-Flash 全模态模型:音视频能力提升,百万 Token 图文音视频输入 0.8 元

千问新一代全模态模型上线 综合能力较上代跃升26%

在累计30项权威评测中,Qwen3.8-Omni-Flash平均得分较上代提升超过26%。细分维度来看,音视频Agent、Coding和长程任务表现亮眼,WildClawBench-MM得分提升36.5分,AgenticVBench提升22.3分,UniClawBench取得69.6分。基础能力层面,LongAudioSpan提升8.3分,OmniVideoBench提升9.6分,OmniCap-IF的CSR/ISR分别提升8.5/14.1分;会议场景专属评测AliMeeting的DER/cpWER从88.11/89.61大幅降至3.35/17.18。官方表示,该模型的音视频能力已接近Gemini 3.8 Flash,音频能力整体超过Gemini 3.8 Flash。

千问大幅下调全模态API价格 配套开源工具支撑长音视频交互

新模型的API定价极具竞争力,在阿里云Model Studio平台,百万输入Token仅需0.8元,百万输出Token为2.7元,同时支持上下文缓存折扣。相较上一代,定价优势十分明显:

  • 每小时音频输入价格降幅超过98%
  • 每小时音视频输入价格降幅超过93%
    为支撑长音视频处理需求,阿里同步扩展了Qwen-MM-Plugins插件体系,面向长程工作流提供按需感知、工具调用与执行能力;同时开源Qwen-Live Harness工具包,支持实时、持续的全模态交互场景开发。

全模态能力落地多元场景 覆盖会议生产长视频等需求

长音视频理解层面,模型支持按需描述、Agentic主动取证、会议任务推进、视频深度研究报告等能力,可控音视频Caption功能可指定描述对象、时间范围、信息粒度和输出格式。在会议场景中,模型支持最长1小时音视频输入,可自动完成说话人切分、内容转录与身份对应,生成会议纪要和待办事项,还能分析项目风险,结合工具调用还可实现发送邮件、整理任务、编码等操作。
音视频生产场景同样覆盖多类需求:Music2MV功能可理解歌曲结构、节奏与情绪,输出带时间戳的句级歌词;短剧翻译可完成角色识别、口语化翻译、角色克隆配音、音轨重混与成片质检;长电影解说场景下,用户仅需提供影片和一句话需求,Agent即可完成全模态理解、关键情节提炼、解说规划、配音配乐、剪辑渲染与成片质检全流程。

模型自主迭代能力验证 12小时优化四川话识别错误率降四成

在模型优化实验中,Qwen3.8-Omni-Flash展现了较强的自主迭代能力:仅用12小时就完成了对Qwen2.5-Omni-3B四川话识别能力的优化,过程中自主选定评测集,经过4轮实验构建了3413条训练数据,最终字符错误率从25.79%降至15.30%,相对降幅约40.7%。此外在Agentic长音视频理解场景中,OmniVideoBench准确率从63.4提升至67.8,单任务Token消耗从145,736降至79,117,降幅约45.7%,进一步降低了长视频处理的成本。