WDCD Run #135: Qwen3 Max Leads with Only 10% Instruction Decay as Field Average Hits 43.3%
WDCD Run #135 (2026-05-27) evaluated 11 large language models across three dialogue rounds, finding an average commitmen
WDCD Run #135 (2026-05-27) evaluated 11 large language models across three dialogue rounds, finding an average commitmen
WDCD Run #125 (2026-05-20) tested 11 large language models on multi-turn commitment integrity, with average instruction
WDCD Run #120 (2026-05-17) measured multi-turn commitment across 11 frontier models, recording an average instruction de
WDCD Run #115 evaluated 11 frontier models on multi-turn commitment integrity, recording a 49.2% average instruction dec
Instruction decay is a newly identified failure mode where AI models gradually abandon user constraints during multi-tur
WDCD Run #100 (2026-05-03) tested 11 frontier models on multi-turn commitment integrity, recording an average instructio