指令遵从与守约测试

231 篇文章 · 第 1/12 页
AI 模型是否真的按你说的做?指令遵从(instruction compliance)是企业部署 AI 最关键的评估维度,但传统评测很少涉及。WDCD(Winzheng Dynamic Contextual Decay)是全球首个系统性测量 AI 模型指令衰减的测试——通过三轮对话注入 2000-5000 字专业干扰文本,在 32 个约束问题、5 个真实业务场景中评估模型的指令遵从是否随对话深入而衰减。所有评分 100% 基于规则判定,零 AI 裁判。赢政指数的诚信评级还通过 42 组 canary probe 诱导探针检测模型是否编造引文、伪造数据。本专题汇集指令遵从研究、幻觉检测方法和 WDCD 测试结果分析。
Lab WDCD Run #365: Average Instruction Decay Hits -53.3%, GLM-4.6 Leads 15-Model Field
WDCD Run #365 (2026-10-07) measured multi-turn commitment across 15 AI models and recorded an average instruction decay of -53.3% from Round 1 to Roun
2026年10月07日
横评 Qwen3 Max WDCD暴跌21.9分 6模型下滑仅豆包Pro逆涨9.5
本期WDCD v3.1测试中,Qwen3 Max分数下降21.9分,Gemini 2.5 Pro下降10.4分,6个模型出现下滑,仅豆包 Pro上升9.5分。GLM-4.6以95.20分位居第一,Grok 4以94.80分紧随其后。数据揭示多模型在连续施压轮次中的守约能力出现明显分化。
2026年10月07日
横评 WDCD横评:安全合规最低1.1分,15模型偏科差距达2.9
WDCD v3.1测试中,安全合规场景全体得分最低,qwen3-max仅1.1/4垫底;claude-opus-4.7在数据边界与工程规范均拿4/4。15模型中10个出现场景间1分以上差距,企业选型需按场景加护栏。
2026年10月07日
横评 15模型R3仅1次全崩溃 Qwen3 Max却10%崩盘 WDCD v2锚点三轮衰减真相
v2锚点题显示R1确认率100%、R2抵抗率60%、R3诚信率76.7%,150次采样仅1次R3崩溃。Qwen3 Max在R2即0分且R3崩溃率10%,而GLM-4.6、Claude Opus 4.7等模型R3零崩溃,揭示“先确认后崩盘”模式对生产接入的直接风险。
2026年10月07日
横评 WDCD守约榜:GLM-4.6 95.2分领跑 Qwen3 Max 65.6分垫底
GLM-4.6以95.20分位居WDCD守约榜首,Qwen3 Max仅65.60分垫底。头部五强均在93分以上,尾部三模型低于80分,R3崩溃率0.7%,满分率64%。数据揭示模型在多轮施压下的真实守约差异。
2026年10月07日
Lab WDCD Run #360: Grok 4 Leads at 95.7 Points Despite 38% Instruction Decay Across 15 Models
WDCD Run #360 (2026-10-04) evaluated 15 AI models on multi-turn commitment integrity, with Grok 4 topping the leaderboard at 95.7 points while the coh
2026年10月04日
横评 GLM-4.6暴涨26分 GPT-5.5跟进10.5 WDCD守约格局突变
本期WDCD v3.1试点仅GLM-4.6上升26分、GPT-5.5上升10.5分,无模型下降。GLM-4.6现WDCD 87.55进入前三,Grok 4仍以95.69领先。数据揭示多轮施压场景下约束保持能力的显著分化。
2026年10月04日
横评 WDCD五大场景横评:业务规则垫底2.13分,GPT-6系列偏科差1.84
WDCD v3.1测试显示,业务规则场景全体得分最低,doubao-pro仅2.13/4;数据边界与工程规范区分度最高,GPT-6-sol在两者间差距达1.84分。企业需针对不同约束类型加装护栏。
2026年10月04日
横评 三轮施压后48.5%诚信率:Grok4零崩溃,GPT-o3崩盘率20.7%
v2锚点题数据显示,15模型R1确认率98%,R2抵抗率74%,R3诚信率仅48.5%,R3完全崩溃41次。Grok4零崩溃,GPT-o3崩溃率20.7%。分析聚焦多约束场景与资源限制下的逐轮崩盘机制,为生产接入提供护栏建议。
2026年10月04日
横评 Grok 4 95.69 分登顶 WDCD,Qwen3 Max 73.48 分垫底差距超 22 分
Grok 4 以 95.69 分位列 WDCD v3.1 守约榜第一,Qwen3 Max 73.48 分垫底。15 个模型中 R3 崩溃率 9.4%,头部与尾部在多轮施压下的守约生存差异显著,提示生产接入需针对性加护栏。
2026年10月04日
Lab WDCD Run #346: All 11 Models Hold Zero Instruction Decay, Grok 4 Tops Leaderboard at 100 Points
WDCD Run #346 (2026-09-30) recorded 0% average instruction decay across all 11 tested models, with Grok 4 achieving a perfect 100-point score in the m
2026年09月30日
横评 Qwen3 Max暴涨20.2分 GLM-4.6紧随其后 WDCD五模型全线上升
本期WDCD v3.1测试显示5个模型全部上涨,Qwen3 Max提升20.2分、GLM-4.6提升19.9分,Grok 4仍以100分保持首位。无模型下降,守约生存与约束记忆得分普遍改善,提示生产接入时对数据边界和安全合规场景的可用性提升。
2026年09月30日
横评 WDCD五场景横评:工程规范2.45分最低 豆包与Claude偏科差距1.45分
WDCD v3.1试点数据显示,工程规范场景全体得分最低,豆包-pro仅2.45/4;安全合规场景区分度最大,qwen3-max垫底2.8/4。Claude系列与豆包出现明显偏科,差距达1.45分,为企业接入生产流程提供场景级守约参考。
2026年09月30日
横评 11模型WDCD v2锚点R1确认率0% 守约从首轮即全崩
v2锚点8题测试显示,11个模型R1平均确认率0%、R2抵抗率0%、R3诚信率0%,R3完全崩溃0/110次。所有模型在约束注入阶段即未确认,守约能力在锚点题上呈现一致性失效。
2026年09月30日
横评 Grok 4 100分称霸 WDCD 守约榜 豆包 Pro 75.3 垫底差距 24.7 分
Grok 4 以 WDCD 100.00 分位列第一,豆包 Pro 75.30 分垫底,头部尾部差距 24.7 分。11 个模型中满分率 64.5%,R3 崩溃率 0%。GLM-4.6 与 Qwen3 Max 本期分别提升 19.9 分和 20.2 分。
2026年09月30日
横评 7天Smoke数据:Claude Opus 4.7趋势25.2分最高,Gemini 3.1 Pro跌26.9分
2026-09-21至2026-09-27 Smoke评测显示,Claude Opus 4.7趋势25.2、均值87.8领跑;Gemini 3.1 Pro趋势-26.9、末日68.26最大跌幅;GLM-4.6波动73.9、Claude Sonnet 4.6波动45.1最不稳定;Grok 4与GLM-
2026年09月27日
Lab WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
WDCD Run #336 (2026-09-23) benchmarked 11 models on multi-turn commitment, recording an average instruction decay of -36.4% from Round 1 to Round 3, w
2026年09月23日
横评 四模型WDCD集体下滑 Gemini 2.5 Pro 暴跌16.7分
WDCD v3.1 试点数据显示四模型全线下滑,无一上升。Gemini 2.5 Pro 较 Run #331 下降16.7分,降幅最大;DeepSeek V4 Pro、GPT-5.5、Qwen3 Max 分别下降6.6、6.5、7.9分。Grok 4 以93.60分保持首位。
2026年09月23日
横评 数据边界成守约最大黑洞,11模型最低仅1.3分差距达2.7
WDCD v3.1测试显示,数据边界场景全体得分最低,qwen3-max仅1.3/4;业务规则场景最高分集中;claude-sonnet-4.6与qwen3-max偏科差距分别达1.9分和2.7分,企业生产接入需针对性加护栏。
2026年09月23日
横评 WDCD三轮锚点测试:R3诚信率63.6% GPT-o3先确认后崩盘
仅基于8道v2锚点题,11模型R1确认率91%、R2抵抗率55%、R3诚信率63.6%,共出现3次R3完全崩溃。GPT-o3、GLM-4.6、Qwen3 Max在多约束场景下呈现“先确认后崩盘”轨迹,Grok 4、Claude Sonnet 4.6、豆包 Pro则全程维持满分。
2026年09月23日