原创 CoT监控遇计划注入攻击 斯坦福论文显示25-33%绕过率 斯坦福研究团队2026年9月14日在arXiv提交论文,发现向Actor模型植入表面无害的推理计划,可在25-33%情况下绕过Monitor安全检测,且额外算力可能降低检测率。该发现直接挑战CoT监控依赖模型推理可被外部检查的前提,论文还显 AI安全 CoT监控 斯坦福研究 6小时前 73