原创 OpenAI GPT-Red以84%成功率对抗测试GPT-5.6 人工红队仅13% OpenAI推出GPT-Red模型,通过对抗性自我对弈训练实现84%提示注入攻击成功率,远超人工红队的13%。该模型已用于加固GPT-5.6,使其直接提示注入失败率降至0.05%,但仍作为人工测试的辅助工具内部运行。 OpenAI AI安全 红队测试 提示注入 2026年7月17日 212