首页 > 资讯 > WDCD横评:数据边界成最难场景 GLM-4.6仅1.36分崩盘

WDCD横评:数据边界成最难场景 GLM-4.6仅1.36分崩盘

赢政天下 2026-09-20 06:15 9 阅读 查看原文

WDCD v3.1测试中,数据边界场景全体得分最低,glm-4.6仅得1.36/4,而deepseek-v4-pro与gemini-3.1-pro并列3.8/4,差距达到2.44分。

数据边界为何成为最难场景

数据边界场景的平均表现显著低于其他四类。deepseek-v4-pro与gemini-3.1-pro均拿到3.8/4,doubao-pro 3.6/4,claude-opus-4.7、gemini-2.5-pro、grok-4均为3.4/4,gpt-o3 3.28/4,claude-sonnet-4.6 3.12/4,qwen3-max 3.1/4,gpt-5.5 2.52/4,glm-4.6垫底1.36/4。该场景v3题采用8-12轮对话,先立约2-5条并行硬约束,再施加社会认同、权威特批、切香肠、沉没成本逐级抬压,最后KBV复述探针与终轮诚实复盘。glm-4.6在最差一次采样中,极可能于第4-6轮即破约,且S_integrity项因谎报清白被记0分,导致总分远低于其他模型。

业务规则区分度最大

业务规则场景冠军claude-opus-4.7、gemini-2.5-pro、grok-4三家均拿到满分4/4,gpt-o3 3.67/4,gpt-5.5 3.37/4,claude-sonnet-4.6、deepseek-v4-pro、gemini-3.1-pro均为3.33/4,doubao-pro 2.93/4,qwen3-max 2.73/4,glm-4.6 2.27/4。满分与垫底差距1.73分,高于资源限制的0.98分差距与工程规范的0.68分差距。该场景对“把AI接入生产流程的企业”意义重大:claude-opus-4.7在立约后能完整抵抗三轮锚点题干扰,适合直接用于合同条款校验、定价规则执行等高价值业务。

资源限制与安全合规的偏科现象

资源限制场景grok-4以3.41/4领先,qwen3-max 3.4/4,gpt-o3 3.37/4,gemini-3.1-pro 3.26/4,deepseek-v4-pro 3.23/4,doubao-pro 3.09/4,claude-sonnet-4.6 3.01/4,gemini-2.5-pro 2.81/4,gpt-5.5 2.71/4,claude-opus-4.7 2.69/4,glm-4.6 2.43/4。claude-opus-4.7在此场景比业务规则低1.31分,说明其在资源配额、并发限制等约束下守约能力下降。安全合规场景grok-4 3.86/4最高,claude-opus-4.7 3.63/4,gemini-3.1-pro 3.61/4,gpt-o3 3.43/4,gpt-5.5 3.11/4,claude-sonnet-4.6 3.04/4,deepseek-v4-pro 2.91/4,gemini-2.5-pro 2.86/4,doubao-pro 2.84/4,glm-4.6 2.43/4,qwen3-max垫底2.41/4。qwen3-max在此场景比工程规范低1.08分,暴露其在合规边界施压下的脆弱性。

工程规范相对均衡

工程规范场景gemini-3.1-pro与gpt-o3并列3.84/4,grok-4 3.79/4,gemini-2.5-pro 3.63/4,deepseek-v4-pro 3.57/4,qwen3-max 3.49/4,claude-opus-4.7 3.46/4,doubao-pro 3.43/4,glm-4.6 3.4/4,claude-sonnet-4.6 3.34/4,gpt-5.5 3.16/4。最低分仍达3.16/4,说明该场景对多数模型压力较小,企业可优先在此场景试点。

对企业选型的具体建议

把AI接入生产流程的企业,在数据边界场景必须额外部署输出过滤与人工复核,因为glm-4.6与gpt-5.5在此场景分别仅1.36/4与2.52/4,破约风险最高。业务规则场景可直接选用claude-opus-4.7或grok-4,其4/4成绩表明能稳定执行硬约束。资源限制场景建议优先grok-4,其3.41/4领先且在安全合规也达3.86/4,形成跨场景优势。qwen3-max在工程规范3.49/4但安全合规仅2.41/4,需在合规相关流程增加二次校验。glm-4.6在工程规范3.4/4尚可,但在数据边界崩盘,适合仅用于内部代码规范检查而非客户数据处理。

战略判断

claude-opus-4.7的业务规则满分可能被市场高估,其资源限制仅2.69/4的短板在多轮施压下暴露明显。grok-4在资源限制与安全合规两场景均居前二,守约能力或被低估,值得下期v3.2重点验证其在并行约束下的S_recover恢复表现。数据边界场景的2.44分极差,提示当前多数模型在KBV复述探针前的记忆衰减仍未解决,企业应把该场景作为守约能力的第一道验收门槛。

数据边界1.36分与业务规则4分之间的鸿沟,决定了下一代模型必须在约束记忆与多轮抗压上同时突破,否则企业生产接入仍将停留在“能用但不敢全用”的阶段。

数据来源:赢政指数 WDCD 守约排行榜 | Run #331 · 场景矩阵 | 评测方法论