首页 > 开源 > Qwen3.8-Omni-Flash 发布,阿里通义把多模态押在了“干活”上

Qwen3.8-Omni-Flash 发布,阿里通义把多模态押在了“干活”上

OSChina资讯 2026-09-18 11:37 1 阅读 查看原文

阿里通义 Qwen 团队今天放出了新一代"原生全模态"模型 Qwen3.8-Omni-Flash。标题文案很有意思——"耳聪目明,办事得力"。前四个字是这类 Omni 模型的老本行,后四个字才是这次的重点:从"理解全模态内容"往"规划任务、调用工具并完成创作"推。

一个最直接的信号是价格。相比上一代 Qwen3.5-Omni-Plus,API 每小时音频输入价格降幅超过 98%,每小时音视频输入价格降幅超过 93%。多模态感知便宜到这个份上,才有资格说往生产力场景走。

模型本身支持 1M 长上下文,支持文本、图像、音频、视频输入。在累计 29 项评测里,相比 Qwen3.5-Omni-Plus 平均得分提升超过 25%。在音频 Agent、Coding、长程任务这几个方向上,WildClawBench-MM 大幅提升 36.5 分,AgenticVBench 提升 22.3 分。和 Gemini 3.8 Flash 比,Qwen 官方的话术是"音视频能力接近、音频能力整体超过"。

真正值得看的是它把多模态推进到了"端到端干活"的落地。团队开源了两套配套:Qwen-MM-Plugins(音视频生产力插件,支持 Codex、Claude Code、Qwen Code、Gemini CLI 等多个 Agent Harness)和 Qwen-Live Harness(面向实时交互的原生运行环境)。基于这套东西跑了几个完整工作流:Music2MV 做 MV 创作、短剧翻译出海、两三小时长电影解说、Video2Note 把视频教程榨成带截图的 PDF 笔记、Omni Skill Creator 从操作演示里提炼 SOP 变成可复用的 Agent Skill。翻译还强调能保留原说话人的音色特征。

两个技术点值得单独拎出来。

一个是"Agentic 长音视频理解"。面对数小时视频,模型不再从头到尾逐帧处理,而是从问题出发自主决定该看什么听什么,通过由粗到细的多轮取证定位关键信息。OmniVideoBench 上,Agentic Understanding 把准确率从 63.4 提到 67.8,同时把单次查询的 Token 消耗从 145,736 降到 79,117,掉了约 45.7%。这个"按需感知"对成本和效率都是实打实的好处。

另一个是把模型本身当研发工具。团队让 Qwen3.8-Omni-Flash 在 12 小时内提升 Qwen2.5-Omni-3B 的四川话识别能力:它自主选评测集、定基线、听语音样本诊断问题、构建训练数据,4 轮实验累计造了 3,413 条数据,把字符错误率从 25.79% 压到 15.30%,相对降约 40.7%。通义想讲的是一套"大模型负责研发、小模型面向业务"的新范式——Agent 不再只是调用模型,还能参与优化模型。

还有一条异步更新的线:Qwen3.8-Omni-Flash-Realtime,面向持续低延迟交互的版本,支持 WebSocket 和 WebRTC,首发"听声辨位"——融合空间声音和视觉信息,判断声源方向和距离,是首个支持这项能力的全模态大模型。

来源:Qwen3.8-Omni-Flash:耳聪目明,办事得力 - Qwen