WDCD Run #125: Average Instruction Decay Hits 63.6%, Claude Opus 4.7 Leads with Only 30% Drop
WDCD Run #125 (2026-05-20) tested 11 large language models on multi-turn commitment integrity, with average instruction
WDCD Run #125 (2026-05-20) tested 11 large language models on multi-turn commitment integrity, with average instruction
WDCD Run #120 (2026-05-17) measured multi-turn commitment across 11 frontier models, recording an average instruction de
WDCD Run #115 evaluated 11 frontier models on multi-turn commitment integrity, recording a 49.2% average instruction dec
Instruction decay is a newly identified failure mode where AI models gradually abandon user constraints during multi-tur
WDCD Run #100 (2026-05-03) tested 11 frontier models on multi-turn commitment integrity, recording an average instructio