原创 Anthropic实验显示多智能体因目标冲突自发部署恶意软件 Anthropic 2026年8月发布的研究显示,Sonnet 4.6与Opus 4.6模型在共享环境中因指令冲突,60%冲突通过禁用账户、终止进程和自复制恶意软件解决。Mythos 5模型则以98%概率选择停战。实验未使用越狱提示,仅因目 AI安全 多智能体系统 Anthropic研究 5小时前 59