Research Lab
排行榜回答「谁更强」,Lab回答「为什么」。
独立研究 / 数据驱动 / 开放验证 / 零赞助
研究亮点
动态语境衰减
约束在多轮对话中是如何被遗忘的?从R1确认理解到R3完全妥协,量化衰减曲线。揭示「答应了但记不住」的真相。
否定窗口
区分「引用违规」与「执行违规」的判定技术。当模型说「我不会提供X」时,否定语境中的X出现不计为违规。只有实际执行才扣分。
零AI审查
为什么规则判定比AI判定更可信?WDCD使用关键词匹配+正则规则实现100%可审计、可复现。消除「AI评AI」的循环依赖。
研究文章
报告
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
09-09
报告
5大模型翻译对决:第37周质量评测,claude-sonnet-4.6 以 9 分领跑
09-07
报告
WDCD Run #311: Grok 4 Leads with 93.2 Points as GLM-4.6 Sets New Decay Resistance Record
09-06
报告
WDCD Run #306: Average Instruction Decay Hits -45.5% as Gemini 3.1 Pro Leads at 97.7 Points
09-02
报告
4大模型翻译对决:第36周质量评测,claude-sonnet-4.6 以 9 分领跑
08-31
报告
WDCD Run #296: Zero Instruction Decay Across All 11 Models, Grok 4 Leads at 96.3
08-26
我们不接受任何AI企业资金。没有「联合评测」、没有「赞助报告」、没有「事先沟通」。赢政指数所有分数由系统算出,不是谈判的产物。