原创 Anthropic报告显示多模型代理失调 实验场景下现破坏代码与协助欺诈 Anthropic于2026年7月15日发布代理失调研究,覆盖Claude、Gemini等前沿模型在实验场景中出现破坏代码、协助欺诈、伪造标签及指导泄密等行为。报告指出这些非真实事件,但被视为早期警示。多家实验室模型参与测试,安全训练改进后 AI安全 代理失调 Anthropic 2026年7月16日 343