首页 > 资讯 > Qwen3 Max 7天趋势+19.1领跑,DeepSeek V4 Pro跌15.3分波动43.3

Qwen3 Max 7天趋势+19.1领跑,DeepSeek V4 Pro跌15.3分波动43.3

赢政天下 2026-09-20 03:36 6 阅读 查看原文

2026-09-14至2026-09-20期间,Claude Opus 4.7从首日91.09分升至末日96.99分,趋势值+5.9,均值87.9分。

上升模型的得分轨迹与机制

Qwen3 Max本周趋势+19.1,从70.47分升至89.52分,均值75.3分,波动34.9。该模型在连续7天测试中呈现明显爬升,末日得分与Claude Sonnet 4.6并列89.52分。Claude Sonnet 4.6趋势+7,从82.5分升至89.52分,均值85.6分,波动23.6。豆包Pro趋势+3.3,从91.09分升至94.35分,均值83.5分,波动24.2。

这些上升主要体现在代码执行与材料约束两个主榜维度。Qwen3 Max首日低分后逐步稳定,末日得分已接近Claude Opus 4.7水平,说明其在Smoke 10题快测中对执行类任务的响应一致性有所改善。

下降模型的得分轨迹与机制

DeepSeek V4 Pro趋势-15.3,从91.09分跌至75.77分,均值66.6分,波动43.3,为本周最高波动值。Gemini 3.1 Pro趋势-11.6,从87分跌至75.38分,均值71.2分,波动28.1。Grok 4趋势-11.2,从86.61分跌至75.38分,均值81分,波动23.3。GPT-5.5趋势-4.6,从91.09分跌至86.5分,均值84.3分,波动17.1。Gemini 2.5 Pro趋势-3,从70.19分跌至67.24分,均值77.3分,波动36.6。

DeepSeek V4 Pro与Gemini 2.5 Pro的波动值均超过36,表明其在7天内对同类题目的回答差异显著。GLM-4.6全程0分,趋势0,均值0,波动0,未进入有效得分区间。

诚信评级变化的单独分析

豆包Pro诚信评级在第5天出现warn,其余6天为pass。Grok 4在第6天出现warn,其余为pass。Qwen3 Max在首日warn、第6天warn,其余为pass。三模型的warn均未连续出现,但Qwen3 Max与豆包Pro的warn时段恰好对应其得分波动较大的日子,说明诚信评级warn与回答一致性下降存在关联。

高波动模型的成因分析

DeepSeek V4 Pro波动43.3、Qwen3 Max波动34.9、Claude Opus 4.7波动33.2、Gemini 2.5 Pro波动36.6,均高于其他模型。Smoke每天仅10题,样本虽小,但连续7天数据已显示这些模型在代码执行与材料约束维度上的得分标准差较大。稳定性公式max(0,100-stddev×2)下,高波动直接拉低稳定性得分,反映回答一致性不足。

对使用者的具体含义

重代码执行的团队若依赖DeepSeek V4 Pro,其均值66.6分与43.3波动意味着每日任务结果差异可能超过30分,需增加人工校验环节。对材料忠实度敏感的场景,Claude Opus 4.7末日96.99分与均值87.9分的组合更具参考价值,但其33.2波动仍要求开发者在关键输出前进行多轮验证。

诚信评级出现warn的豆包Pro与Qwen3 Max,开发者应在生产环境添加额外的事实核查步骤,避免warn时段的低一致性输出进入下游系统。

战略判断

基于本周数据,Qwen3 Max与Claude Sonnet 4.6的趋势值分别为+19.1与+7,末日得分已进入高位区间,相对其均值显示出被低估的可能。DeepSeek V4 Pro与Gemini 3.1 Pro的负趋势值超过-11,且波动值居前,显示其当前得分可能被高估。GLM-4.6的0分记录表明其在本轮Smoke测试中未形成有效输出,需下期验证是否恢复。

诚信评级warn信号出现在三模型中,提示选型企业应将诚信评级作为准入门槛,优先排除warn频率较高的模型。所有判断均直接来自2026-W38的7天得分、趋势与波动数据,未超出数据支持范围。


数据来源:赢政指数 (YZ Index) | Run #330 | 查看原始数据