千问上线 Qwen3.8-Omni-Flash:1M 上下文,30项评测平均提升超26%
9月18日,千问新一代原生全模态模型Qwen3.8-Omni-Flash正式登陆千问AI平台,面向用户开放体验。该模型支持文本、图像、音频、视频四类输入形式,同时具备1M Token的长上下文处理能力,核心定位是推动全模态模型从“内容理解”向“任务规划、工具调用、创作交付”的全链路能力升级,在延续编程、文本处理、GUI操作等通用Agent能力的基础上,重点拓展了音视频方向的Agentic应用场景。

千问上线新一代原生全模态模型Qwen3.8-Omni-Flash
作为千问全模态模型序列的最新迭代产品,Qwen3.8-Omni-Flash不再采用多模态能力拼接的架构,而是从模型底层实现文本、图像、音频、视频的深度融合,可在理解多模态内容的基础上自主完成复杂任务的规划与执行,目前已在千问AI平台全量开放。
全维度性能提升,30项评测平均涨幅超26%
官方公布的评测数据显示,在累计30项权威测试中,Qwen3.8-Omni-Flash相比上一代Qwen3.5-Omni-Plus平均得分提升超过26%。其中音视频Agent、Coding和长程任务维度表现尤为突出:WildClawBench-MM得分提升36.5分,AgenticVBench提升22.3分,UniClawBench取得69.6分的高分。基础能力层面同样进步明显:长音频理解测试LongAudioSpan提升8.3分,全视频理解测试OmniVideoBench提升9.6分,音视频描述测试OmniCap-IF的CSR、ISR指标分别提升8.5分、14.1分;多说话人识别场景下,AliMeeting的DER、cpWER指标从上一代的88.11/89.61大幅降至3.35/17.18。官方透露,通过扩展数据、上下文与Agentic运行环境,该模型的音视频能力已接近谷歌Gemini 3.8 Flash,音频能力整体更超过Gemini 3.8 Flash。
落地多元音视频场景,覆盖创作到交互全链路
新模型的音视频能力已落地多个生产力场景,核心应用包括:
- 长音视频理解与任务执行:可处理数小时级别的长音视频内容,从用户问题出发自主筛选关注的画面、声音信息,通过多轮取证定位关键内容;结合工具调用能力,可自动提炼会议纪要、待办事项与风险信息,后续还能自主完成发送邮件、编写代码、检索多模态资料生成报告等延伸任务。
- 音视频创作生产:覆盖音乐视频制作、短剧翻译、长电影解说等多个场景。例如在MV创作中可理解歌曲结构、节奏与情绪,输出带时间戳的句级歌词;短剧翻译场景下可完成角色识别、口语化翻译、配音克隆、音轨重混与成片质检;长电影处理则可实现情节提炼、解说规划、配音配乐、剪辑渲染与最终质检全流程自动化。
- 信息资产转化:可将长视频内容自动转化为可复用的知识资产,包括梳理知识点、拆解操作步骤,生成图文对应的PDF笔记,还可进一步转化为经过校验和评测的Agent Skill。
- 实时交互场景:实时版本Qwen3.8-Omni-Flash-Realtime可在音视频流输入过程中同步完成感知与响应,适用于口语陪练、空间音频感知、智能客服等需要即时交互的场景。
此外,模型还展现出自主迭代能力,在12小时的优化实验中,Qwen3.8-Omni-Flash自主选定四川话识别评测集,通过4轮实验构建3413条训练数据,将基线模型的四川话字符错误率从25.79%降至15.30%,相对降幅达40.7%。
配套工具开源加码,API成本最高降幅超98%
为支撑长音视频处理与实时交互需求,官方同步扩展了Qwen-MM-Plugins,新增多项面向音视频理解与创作的能力,同时开源Qwen-Live Harness工具,用于支持持续、实时的音视频交互与任务执行。成本方面,新模型的API定价进一步下探:每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%,大幅降低用户的调用成本。