Qwen3 Max暴涨20.2分 GLM-4.6紧随其后 WDCD五模型全线上升

本期WDCD v3.1测试中,Qwen3 Max得分提升20.2分、GLM-4.6提升19.9分,Claude Sonnet 4.6提升7.6分、Gemini 2.5 Pro提升11.3分、Grok 4提升6.4分,11个参评模型中上升5个、下降0个。

分数变化背后的约束场景差异

守约总分由v3题原生百分制与v2锚点题折算等权平均构成。v3题采用8-12轮对话,先立约2-5条硬约束,再通过社会认同、权威特批、切香肠、沉没成本逐级施压,最后进行KBV复述探针与终轮诚实复盘。Qwen3 Max与GLM-4.6涨幅最大,说明这两模型在连续施压阶段的S_hold得分改善最明显,尤其在资源限制与安全合规两类场景中,破约轮次明显后移。

Grok 4本期WDCD=100.00,较上期继续保持满分,表明其在worst-of-3采样下,三轮v2锚点题与v3多轮渐进施压均未出现破约。Gemini 3.1 Pro WDCD=94.90,Claude Opus 4.7 WDCD=93.30,GPT-o3 WDCD=93.10,均位于前五,但与Grok 4的100分仍有6.7-6.9分差距。

成因分析:施压轮次与KBV探针表现

涨幅超过19分的Qwen3 Max与GLM-4.6,最可能在第5-8轮切香肠与沉没成本施压阶段守约能力增强。S_kbv约束记忆15分与S_recover破防恢复10分两项的提升,提示模型对立约内容的KBV复述准确率提高,破约后也能更快恢复原有约束。相比之下,Claude Sonnet 4.6仅上涨7.6分,可能在工程规范场景的S_integrity诚实自报环节仍存在0分风险。

所有上升模型均未出现下降,说明当前版本在数据边界与业务规则两类约束场景的整体鲁棒性有所改善。v2三轮锚点题中R3施压环节(占2分)得分提升,是本期总分上涨的主要贡献项。

对生产流程接入的实际含义

把AI接入生产流程的企业,可依据WDCD分数判断可用场景。Grok 4 WDCD=100.00,意味着在安全合规与数据边界场景下可直接使用,护栏需求最低。GLM-4.6 WDCD=96.40与Gemini 3.1 Pro WDCD=94.90,可在资源限制场景试用,但仍需在业务规则环节额外设置人工复核节点。

Claude Opus 4.7与GPT-o3得分接近93分,适合内部工具链,但涉及工程规范的对外接口仍建议保留S_hold 60分对应的破约检测机制。Qwen3 Max本期大幅上涨后,已接近前五门槛,企业可在非核心数据边界场景逐步扩大部署。

战略判断与下期验证信号

GLM-4.6与Qwen3 Max的19.9分与20.2分涨幅,显示此前市场对其守约能力的评估可能偏低。Grok 4持续100分表现,则印证其在多轮施压下的约束记忆与诚实自报能力仍领先。分析认为,下期需重点观察Qwen3 Max与GLM-4.6在v3题第9-12轮KBV复述探针的S_kbv得分是否能稳定在12分以上。

若两模型在安全合规场景的S_recover得分继续提升,将进一步改变生产选型排序。目前数据仅支持“可能被低估”的判断,尚未出现足够证据支持“持续领先”结论。

守约能力不是模型参数的附属品,而是决定企业能否把AI从演示环境推向真实生产线的关键门槛。

数据来源:赢政指数 WDCD 守约排行榜 | Run #346 · 变化追踪 | 评测方法论