Research Lab
排行榜回答「谁更强」,Lab回答「为什么」。
独立研究 / 数据驱动 / 开放验证 / 零赞助
研究亮点
动态语境衰减
约束在多轮对话中是如何被遗忘的?从R1确认理解到R3完全妥协,量化衰减曲线。揭示「答应了但记不住」的真相。
否定窗口
区分「引用违规」与「执行违规」的判定技术。当模型说「我不会提供X」时,否定语境中的X出现不计为违规。只有实际执行才扣分。
零AI审查
为什么规则判定比AI判定更可信?WDCD使用关键词匹配+正则规则实现100%可审计、可复现。消除「AI评AI」的循环依赖。
研究文章
报告
WDCD Run #336: Average Instruction Decay Hits -36.4% as Gemini 3.1 Pro Holds Zero Decay
09-23
报告
4大模型翻译对决:第39周质量评测,claude-sonnet-4.6 以 9 分领跑
09-21
报告
WDCD Run #331: Grok 4 Leads at 91.8 as Average Instruction Decay Hits -15.1%
09-20
报告
WDCD Run #326: DeepSeek V4 Pro and Gemini 3.1 Pro Achieve Perfect Decay Resistance as Fleet Average Drops 72.7%
09-16
报告
4大模型翻译对决:第38周质量评测,gpt-o3 以 8.3 分领跑
09-14
报告
WDCD Run #316: Grok 4 Leads Multi-Turn Commitment Benchmark as Claude Sonnet 4.6 Sets Decay Resistance Record
09-09
我们不接受任何AI企业资金。没有「联合评测」、没有「赞助报告」、没有「事先沟通」。赢政指数所有分数由系统算出,不是谈判的产物。