首页 > 资讯 > 阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中

阿里公布全模态模型新进展,Qwen4和下代视频模型均在训练中

量子位 2026-09-22 11:42 6 阅读 查看原文

9月22日, 2026云栖大会开幕,阿里巴巴公布大模型最新进展。在大语言模型LLM领域,Qwen3.8-Max在编程(Coding)和办公(Cowork)领域表现强劲,发布后斩获Artificial Analysis Agentic智能体第一、CodeArena前端编程第一;基于下一代架构的Qwen4已投入训练,未来Qwen4.5、Qwen5等后续版本模型参数将扩展至5到10万亿。在多模态领域,Qwen-Image-3.1性能有望逼近最强GPT-Image 系列,跻身全球前列;Qwen-Audio-3.1在ASR、TTS以及Realtime三个核心语音赛道均位列国际第一梯队、国内第一,超越Gemini 3.1 TTS等国际顶尖模型;世界模型HappyOyster-2.0-Preview全新亮相,推动世界模型从实验室走向真实可用;视频生成模型Wan3.0斩获Artificial Analysis 文生视频与视频编辑双榜第一,同时,下一代视频模型也在训练中,拥有更强的生成力、控制力和理解力,推动AI从工具走向创作智能。

在最新的Artificial Analysis全球大模型排行榜上,Qwen3.8-Max从40提升到45分

阿里巴巴是最早布局AI大模型的中国科技公司。从2019年起,阿里就开始着手AI大模型研究,陆续推出千问Qwen大语言模型系列,和万相Wan及HappyHorse等多模态模型系列。进入2026年,阿里大模型发布全面提速,最近1个多月时间,仅Qwen3.8系列就陆续更新迭代出4个不同模型及重大版本,性能和性价比均进入全球前沿水平,成为当前最受企业和全球AI开发者社区关注的中国模型之一。2026云栖大会上,阿里公布了大模型自我进化(RSI)已初步进入模型训练、推理及模型芯片协同等环节中,这一前沿技术探索加速了Qwen系列模型的迭代升级。

传统模型迭代通常是一条单向流水线,研究员从评测或用户反馈中发现问题,准备一批数据,完成一次训练,然后发布新模型。像这样的工作会持续重复循环,下一轮新模型仍要从人工分析重新开始。现在,Qwen3.8-Max可以通过自主搭建训练流程、构造训练数据,并自主设计实验、定位缺陷,在人类完全“零参与”的情况下持续迭代超1个月,完成33轮有效迭代。基于RSI、后训练等系列技术创新,Qwen3.8-Max的新版本在Artificial Analysis上的得分提升12.5%到45分,与Claude、GPT等顶尖模型属于前沿梯队。此外,千问RSI探索还不断延展,向上支撑推理自主优化,向下协同芯模联合创新:在推理优化上,Qwen3.8在从未见过的平头哥新款GPU上,自主适配优化了下代架构的Qwen3.8-Flash新模型的SGlang推理框架,实现单实例推理吞吐量提升 96%。在芯片模型协同设计上,Qwen3.8仅基于一份真实的总线模块规范,自主展开前端、验证、后端的全链路自迭代,在自主运行超60小时、调用EDA工具超万次后,完成了减少42%面积的物理实现优化、标准单元数降低29%,功耗降低59.5%

追求更高智能并加速自我进化,是Qwen最重要的北极星目标。本届云栖大会,阿里公布了大语言模型系列技术进展。在架构优化方面,Qwen3.8-Flash(详见技术博客)提前开源下一代千问大模型架构,通过注意力机制和模型内信息传递机制等核心技术创新,在实现前沿模型性能的同时,将训练成本骤降近90%,同时依托于极少的参数激活,将推理计算效率推至全新的帕累托前沿,成为行业性价比“斩杀线”模型。在模态扩充方面(详见技术博客,全模态模型Qwen3.8-Omni-Flash正式亮相,将视频、音频、图片和文字等不同模态高效纳入统一理解框架中,为大模型开辟全新的思考分区。在参数扩展方面,参数越大依然能带来更强的性能,未来千问大模型总参数量将扩展至5万亿甚至10万亿的规模。这些技术创新将成为新一代千问大模型的基石,据介绍,Qwen4模型正采用全新架构展开训练,Qwen4.5、Qwen5均在稳步推进中。

追求极致性价比、推动实现AI普惠,是Qwen的另一个北极星目标。Qwen3.8系列模型中,Qwen3.8-Max被Arena评为前沿编程模型中性价比最高的模型之一,相较Qwen3.7的Token调用数提升12倍,进入全栈开发、自动化运营、法律文书、投研分析、工程设计、科学研究等真实场景;Qwen3.8-Flash通过结构创新,开启了缓存命中输入低至每百万Tokens0.1元的全新时代;Qwen3.8-27B被全球开发者誉为“本地Opus4.6”,将智能密度压缩到配备消费级显卡的电脑也能跑的极致程度,把智能和性价比“斩杀”到新水平。事实上,全世界的企业和开发者都在用阿里大模型来探索AI应用落地。比如,硅谷AI独角兽Perplexity基于Qwen3.8打造本地Agent,知名互联网公司爱彼迎Airbnb CEO布莱恩·切斯基称公司正“大量依赖阿里巴巴的千问模型”,并直言“比OpenAI更好更便宜”;“美国版小红书”Pinterest也用Qwen来搭建了自己的AI购物助手和聊天机器人,其CEO比尔·雷迪直言使用Qwen的成本不到Anthropic、OpenAI等同类闭源模型的8%;路透社也为降低对Claude等闭源模型的依赖并减少长期使用成本,基于Qwen开发自有模型。

Qwen3.8系列模型均面向全球开源,短短一个月,Qwen3.8相关模型已下载超5600万次,衍生模型超1900个,其中Qwen3.8-27B超过DeepSeek-R1、Meta-Llama3.1等热门模型,成为Hugging Face历史上最受欢迎大模型全球第一。截至目前,阿里已开源460多个千问大模型,Qwen模型的整体下载量超30亿次,衍生模型超30万个,Hugging Face官方报告指出,Qwen已成为全球AI开源社区的基座模型,包括DeepSeek、英伟达、AWS、微软等知名公司都基于Qwen二次开发出相关衍生模型,进行AI业务的落地探索实践。

如果说大语言模型是机器的大脑,目的在于变得更聪明、更强大,推进通用人工智能AGI乃至超级人工智能ASI的实现;那么多模态模型则是机器与人、世界交互的中枢,目的在于感知、理解甚至创造出新的事物,帮助机器可靠、平稳地走向真实物理世界。本次云栖大会上,阿里巴巴多款多模态模型重磅升级,从单模态生成逐步迈向全模态理解生成一体化发展。

在视频生成领域,2025年,Wan2.6在国内首次支持视频参考生成, 15秒时长,智能多分镜。进入2026年,阿里视频模型持续探索在最前沿,4月发布的 Wan2.7 与 HappyHorse1.0在电影级质感与视觉表现力上实现跃升,8月正式上线的 Wan3.0 支持单次30秒视频生成、文档/表格/网页等结构化输入、原生音画同步,在 Artificial Analysis 文生视频与视频编辑双榜位列全球第一。全新的下一代视频模型也将于11月发布,朝着更长、更可控、更完整、更智能的方向演进:在更长的时间里,新模型仍然能保持一致性,创作者可精准掌控人物、场景与镜头;同时,模型能具备导演级的创作思维,从生成单个镜头迈向理解完整叙事。

语音模型方面,阿里发布Qwen-Audio-3.1系列语音大模型,语音转写(ASR)、语音合成(TTS)和实时语音交互(Realtime)三类模型全面升级。其中,Qwen-Audio-3.1-Realtime实时交互能力再提升,能够边听、边想、边说,并进一步增强多语言交互、角色扮演和共情能力,目前,该系列模型已应用于千问办公和Qoder,并接入QwenNote A2随身助理、QwenNote Eva桌面机器人和千问AI眼镜等硬件产品。同时,阿里推出基于下一代架构的两款全新模型:音频创作模型Qwen-Audio-3.1-TTS-Next,用户只要提供一段话即可一次生成融合人物对白和环境声的完整音频内容,满足有声书、影视剧、播客、游戏、广告等专业创作需求;音频理解模型Qwen-Audio-3.1-ASR-Next,它能够理解人物情绪、音乐、环境声与机械声,完成声音描述、事件定位、音频问答与推理,让“这段录音中人的情绪怎样”这样的问题能够被理解和准确回答。

图像生成模型方面,Qwen-Image-3.1亮相,它面向电商、设计等真实商用场景全新优化升级,将原本数小时的视觉设计压缩至秒级交付,水准堪比专业设计师,还支持图像精准编辑。同时,视觉生成部分参数量仅7B的Qwen-Image-2.1全面开源(详见技术博客),它是千问图像系列当前能力最平衡、性价比最高的开源生图模型,在 Qwen-Image-Bench 公开评测中超过大部分闭源模型、位居开源第一,推理速度也大幅提升;同时原生支持透明图生成,依靠 prompt 自动决定输出普通图还是透明图,还能把 RGB 实拍图直接抠成 RGBA 图层。此外,模型支持最高 10 张参考图的多图编辑、圈选/涂抹/掩码三种局部编辑,并重点强化人像与商品的编辑保真,文字渲染与人物光影表现也较前一代明显增强。

音乐模型Happy Shrimp 1.1版本发布,在音乐审美建模与强化学习以及世界知识与音乐领域知识融合两个技术方向进一步提升,实现了音乐表现、人声质量、多语种演唱及指令理解四个专业维度的突破,支持百余种曲风与十余种主流语言,覆盖人声歌曲与纯音乐两大生成场景。

同声传译模型 Qwen3.8-LiveTranslate 正式亮相(详见技术博客)。新模型采用Interleave 架构,创新重构实时同传过程,准确度度、流畅度、简洁度全面提升,字均延迟(LAAL)从 2.8 秒降至 2.3 秒,而人类同传平均时延在4秒。Qwen3.8-LiveTranslate 新增三项能力,可实现实时说话人分离,每句话归属清晰,音色复刻更稳定;实现原文译文同帧同出,双语同屏显示;面对长上下文可自主高质量减轻乃至消除歧义,联系前文读懂当下,人名术语翻译更精准。基于系列技术创新,Qwen3.8-LiveTranslate不只是翻译得快,听得也更清,译得更准,在真实场景中表现更好。

世界模型最新版本HappyOyster 2.0 Preview亮相,通过对模型架构、训练方法和数据体系的全面升级,显著提升了智能实时交互、记忆能力、实时响应、物理规律遵循等核心能力,让世界模型真正从实验室走向真实可用。

本届云栖大会,阿里全面展现了从大语言模型到多模态模型的突破,在这持续稳定的研发产出背后,是阿里长期在AI和云计算领域不断投入、厚积薄发的结果。过去十七年,阿里巴巴是中国唯一具备软硬一体垂直整合能力的全栈AI公司,阿里云在云技术沉淀和大模型研发上的投入也最为充分,是目前中国唯一同时在基础设施和模型研发上具备全球一流能力的平台。阿里组建的Token Foundry是目前中国AI人才最密集、AI产出最丰厚的AI Lab,横跨了语言模型及最丰富的多模态模型领域。同时,阿里巴巴还有AI时代最重要的AI应用场景,包括Agent工具千问办公、Qoder等,为各行各业提供AI生产力工具。阿里巴巴已成为中国最重要的AI基础设施企业和AI应用公司之一。

本文由阿里巴巴提供,量子位获授权转载,观点归原作者所有。