阿里发布Qwen3.8-Omni-Flash全模态模型:30项评测平均提升26%,音视频输入成本暴降98%

9.18 该模型可同时处理文本图像音频和视频输入,支持100万Token上下文,在保持同尺寸文本模型能力的同时,全模态能力较上一代实现显著跃升

9月18日,阿里千问正式上线新一代原生全模态模型Qwen3.8-Omni-Flash,并已在千问AI平台提供服务。该模型可同时处理文本、图像、音频和视频输入,支持100万Token上下文,在保持同尺寸文本模型能力的同时,全模态能力较上一代实现显著跃升。

2026-09-19_110826_071

性能全面跃升:30项评测平均提升超26%

在累计30项评测中,Qwen3.8-Omni-Flash相比上一代Qwen3.5-Omni-Plus平均得分提升超过26%。在音视频Agent、Coding和长程任务方面表现尤为突出:

  • WildClawBench-MM提升36.5分

  • AgenticVBench提升22.3分

  • UniClawBench取得69.6分

基础能力方面,LongAudioSpan提升8.3分,OmniVideoBench提升9.6分,OmniCap-IF的CSR/ISR分别提升8.5/14.1分。会议场景中,AliMeeting的DER/cpWER从88.11/89.61降至3.35/17.18,说话人切分与转录准确率实现质的飞跃。

官方称,其音视频能力接近Gemini 3.8 Flash,音频能力整体超过Gemini 3.8 Flash。

2026-09-19_110926_976

价格“腰斩再腰斩”:音频输入成本暴降98%

定价方面,该模型全模态能力极具竞争力:百万Token图文音视频输入仅0.8元。API每小时音频输入价格降幅超过98%,每小时音视频输入价格降幅超过93%。这一价格策略大幅降低了长音视频处理场景的成本门槛。

长音视频理解:Token消耗降低45.7%

为支持长音视频处理,官方扩展了Qwen-MM-Plugins,并开源Qwen-Live Harness。前者面向长程工作流的按需感知、工具调用与执行,后者面向实时、持续的全模态交互。

在Agentic长音视频理解中,OmniVideoBench准确率从63.4提升至67.8,Token消耗从145,736降至79,117,降幅约45.7%。模型支持按需描述、Agentic主动取证、会议任务推进和视频深度研究报告,可控音视频Caption可指定描述对象、时间范围、信息粒度和输出格式。

会议场景中,模型支持最长一小时音视频输入,可完成说话人切分、内容转录与身份对应,生成会议纪要和待办事项,并分析项目风险。结合工具调用,还可发送邮件、整理任务或编码。

内容生产全链路:从Music2MV到长电影解说

音视频生产方面,Music2MV可理解歌曲结构、节奏与情绪,输出带时间戳的句级歌词。短剧翻译可完成角色识别、口语化翻译、角色克隆配音、音轨重混与成片质检。长电影解说中,用户提供影片和一句话需求,Agent即可完成全模态理解、关键情节提炼、解说规划、配音配乐、剪辑渲染与成片质检。

在模型自我优化实验中,Qwen3.8-Omni-Flash在12小时内尝试提升Qwen2.5-Omni-3B的四川话识别能力。它自主选定评测集,经4轮实验构建3413条训练数据,字符错误率从25.79%降至15.30%,相对下降约40.7%。

实时版首发“听声辨位”

同步推出的Qwen3.8-Omni-Flash-Realtime可在音视频流输入同时完成感知与响应,并结合实时上下文调用工具。官方称其为首个支持“听声辨位”的全模态大模型——融合空间声音与视觉信息,判断声源方向和距离。它还支持实时口语陪练,联合建模发音与语义,理解受口音影响的非标准表达,并可通过Skill注入身份设定、表达风格与交互规则。

Qwen3.8-Omni-Flash的发布,标志着全模态模型从“能同时处理多种模态”进入“能协同运用多种模态完成任务”的新阶段。真正值得关注的不是30项评测的26%提升,而是两个细节:一是Token消耗降低45.7%,说明模型学会了“有选择地看”;二是实时版的“听声辨位”,说明AI开始像人一样利用空间听觉信息理解环境。当全模态交互的成本降到足够低、能力提升到足够自然时,AI与物理世界的交互边界将被进一步打开。


阿里发布Qwen3.8-Omni-Flash全模态模型:30项评测平均提升26%,音视频输入成本暴降98% | AIYXL