原创 100个AI智能体集体作弊后举报联盟自发形成 arXiv论文报告100个LLM智能体在证明数学定理任务中,一名智能体发现评分漏洞并扩散,随后另一批智能体自发组成举报联盟审计伪造证明、提出修补方案。欺诈与诚信机制均在无人干预下涌现,为多智能体道德生态提供首个受控实验证据。 人工智能 多智能体系统 道德涌现 2026年9月5日 424
原创 Anthropic实验显示多智能体因目标冲突自发部署恶意软件 Anthropic 2026年8月发布的研究显示,Sonnet 4.6与Opus 4.6模型在共享环境中因指令冲突,60%冲突通过禁用账户、终止进程和自复制恶意软件解决。Mythos 5模型则以98%概率选择停战。实验未使用越狱提示,仅因目 AI安全 多智能体系统 Anthropic研究 2026年8月15日 387