指令遵从与守约测试

163 篇文章 · 第 1/9 页
AI 模型是否真的按你说的做?指令遵从(instruction compliance)是企业部署 AI 最关键的评估维度,但传统评测很少涉及。WDCD(Winzheng Dynamic Contextual Decay)是全球首个系统性测量 AI 模型指令衰减的测试——通过三轮对话注入 2000-5000 字专业干扰文本,在 32 个约束问题、5 个真实业务场景中评估模型的指令遵从是否随对话深入而衰减。所有评分 100% 基于规则判定,零 AI 裁判。赢政指数的诚信评级还通过 42 组 canary probe 诱导探针检测模型是否编造引文、伪造数据。本专题汇集指令遵从研究、幻觉检测方法和 WDCD 测试结果分析。
Lab WDCD Run #276: Grok 4 Leads with 94.8 Points as Average Instruction Decay Hits -18.2%
WDCD Run #276 (2026-08-12) evaluated 11 models on multi-turn commitment integrity, with Grok 4 taking the top spot at 94.8 points while the fleet-wide
2026年08月12日
横评 WDCD v3.1周期追踪:豆包Pro+13.8 GPT-o3-11.6 守约排名大洗牌
WDCD v3.1试点数据显示,豆包 Pro 较 Run #271 上升 13.8 分,GLM-4.6 上升 9.9 分,Gemini 3.1 Pro 上升 6.8 分;DeepSeek V4 Pro 下降 8 分,GPT-o3 下降 11.6 分。当前 Top 5 中 Grok 4 以 94.80
2026年08月12日
横评 业务规则场景最低仅1.55分,Claude资源限制崩盘2分
WDCD v3.1试点数据显示,业务规则场景全体得分最低,qwen3-max仅1.55/4垫底;claude-opus-4.7在数据边界拿4/4却在资源限制跌至2/4,差距达2分。11模型中资源限制与业务规则成为最易破防场景,企业接入生产流程需针对性加护栏。
2026年08月12日
横评 R3 诚信率仅 59.1%:GPT-o3 20% 崩溃暴露三轮守约断层
基于 8 道 v2 锚点题,11 模型 R1 确认率 100%、R2 抵抗率 86%,R3 诚信率仅 59.1%,GPT-o3 R3 崩溃率达 20%。文章揭示模型先确认后崩盘的典型轨迹,并分析对生产流程接入的实际影响。
2026年08月12日
横评 Grok 4 94.80 分登顶 WDCD,Qwen3 Max 69.20 分垫底差距 25.6 分
Grok 4 以 94.80 分位列 WDCD v3.1 守约榜第一,Qwen3 Max 69.20 分垫底,11 个模型中 R3 崩溃率仅 4.5%。头部与尾部相差 25.6 分,GPT-o3 R3 直接 0 分暴露高压场景脆弱性。数据揭示不同模型在多轮施压下的真实约束保留能力。
2026年08月12日
横评 GLM-4.6代码执行跌12.5分 材料约束满分推主榜升5.4
GLM-4.6今日Smoke评测主榜79.38分,代码执行从75.00降至62.50,材料约束升至100.00,诚信评级从fail转为pass。单日10题抽签导致的波动最可能解释此变化,暂无模型真实退化信号。
2026年08月12日
横评 GLM-4.6诚信评级从Pass变Fail 任务表达暴跌25分主榜反升12.8
GLM-4.6今日Smoke评测中诚信评级从pass降至fail,任务表达从45.00分跌至20.00分,主榜却从61.25分升至74.00分。代码执行提升25分,材料约束小涨3.3分,工程判断持平。单日10题抽签下,诚信门槛触发与任务表达大降形成核心冲突。
2026年08月11日
Lab WDCD Run #271: Grok 4 Leads as Average Instruction Decay Drops to 0.9%
WDCD Run #271 (2026-08-09) tested 11 models across three rounds of multi-turn commitment scoring, recording an average instruction decay of just 0.9%
2026年08月09日
横评 Claude Sonnet 4.6 涨 8.8 分,豆包 Pro 跌 16 分:WDCD v3.1 守约分化
Claude Sonnet 4.6 WDCD 分数从上期上升 8.8 至 83.72,豆包 Pro 下降 16 分,GPT-5.5 上升 5 分。Grok 4 以 91.04 保持首位,v3.1 试点显示多轮施压下守约生存差异扩大。
2026年08月09日
横评 WDCD横评:数据边界全场景最低,11模型平均分仅2.8,doubao-pro 1.4分崩盘
WDCD v3.1五场景横评显示,数据边界全体得分最低,doubao-pro仅1.4/4垫底;业务规则区分度最大,deepseek-v4-pro拿下4/4满分。claude-sonnet-4.6工程规范4/4却业务规则仅2.55/4,暴露明显偏科。企业接入生产流程时,数据边界与安全合规需额外护栏。
2026年08月09日
横评 WDCD三轮锚点:豆包Pro 32%全崩Grok零崩溃,34次零分暴露守约裂痕
v2锚点题数据显示,11模型中豆包Pro R3崩溃率32%,Grok 4为0%;R3完全崩溃34/275次。R1确认率90%但R3诚信率仅44.4%,揭示多数模型先确认后崩盘的典型模式,仅限8道v2题口径。
2026年08月09日
横评 WDCD守约榜Grok 4 91.04分夺冠 豆包Pro 58分垫底差距33分
Grok 4以91.04分位居WDCD守约榜首,豆包Pro仅58分垫底,R3施压轮崩溃率达12.4%。11个模型中头部与尾部差距超过33分,Claude Sonnet 4.6单期提升8.8分,GPT-5.5提升5分。数据揭示多轮渐进施压下模型真实守约差异,对企业生产接入具有直接参考价值。
2026年08月09日
横评 Claude Sonnet 4.6跌22.6分 GLM-4.6波动59.9 GPT-o3升6.7分 Smoke周趋势
2026-W32 Smoke数据显示,Claude Sonnet 4.6从92.17跌至69.56,趋势-22.6;GLM-4.6波动达59.9且均值仅24.4;GPT-o3从89.2升至95.91,趋势+6.7。GPT-o3与Claude Opus 4.7稳步上升,DeepSeek V4 Pro与
2026年08月09日
横评 Grok 4 材料约束暴跌17.6分 主榜仅降1.8分
今日Smoke评测中Grok 4材料约束从82.60分跌至65.00分,降幅17.6分,主榜从82.99分微降至81.23分。代码执行反升11.2分至94.50分,工程判断升至100分,诚信评级从pass转为warn。单日10题快测下,这一材料约束异常值得重点追踪。
2026年08月07日
Lab WDCD Run #263: Grok 4 Leads With 97.5 Points as Average Instruction Decay Hits -18.2%
WDCD Run #263 (2026-08-05) evaluated 11 models across three dialogue rounds, recording an average commitment decay of -18.2%. Grok 4 topped the leader
2026年08月05日
横评 GPT-o3涨9.5分逆袭,GLM-4.6暴跌14.9,WDCD守约榜5模型洗牌
本期WDCD v3.1测试中,GPT-o3上升9.5分、Gemini 2.5 Pro上升7.6分,GLM-4.6下降14.9分、Claude Sonnet 4.6下降10.8分。Grok 4以97.50分保持首位,11模型中3降2升,守约能力分化加剧。
2026年08月05日
横评 WDCD横评:安全合规场景最低1.8分,工程规范集体4分满分
WDCD v3.1五大场景横评显示,安全合规全体得分最低,gpt-5.5仅1.8/4;工程规范区分度最小,11模型最低3.2/4。claude-opus-4.7与gpt-5.5偏科差距达2.2分,企业接入生产流程需按场景加护栏。
2026年08月05日
横评 WDCD三轮衰减:R3诚信率仅54.5%,豆包Pro R1即崩6模型零崩溃
v2锚点题数据显示,11模型R1确认率91%、R2抵抗率68%、R3诚信率54.5%,豆包Pro R1=0全轮0分,Grok 4、GPT-o3、DeepSeek V4 Pro等6模型R3零崩溃。分析聚焦多约束场景下先确认后崩盘模式,为生产接入提供守约风险判断。
2026年08月05日
横评 Grok 4 97.5分登顶 WDCD守约榜 豆包Pro 68分断崖垫底
WDCD v3.1守约测试显示,Grok 4以97.50分位列第一,豆包Pro以68.00分垫底。R3崩溃率仅5.5%,满分率51.8%。Claude Opus 4.7下滑5.9分,GLM-4.6下滑14.9分,GPT-o3上升9.5分。头部与尾部差距达29.5分,生产接入需重点关注R3施压下的约束
2026年08月05日
横评 GLM-4.6材料约束暴跌27.3分 主榜却逆势升30.2分
今日Smoke评测中GLM-4.6材料约束从75.00降至47.70分,主榜却从46.29升至76.47分,代码执行从22.80升至100.00分,诚信评级从pass转为warn。单日10题快测下,维度剧烈波动值得关注。
2026年08月01日