原创 OpenAI GPT-Red红队模型提示注入成功率达84% 远超人类红队引发安全争议 OpenAI发布GPT-Red红队攻击模型,通过自博弈强化学习训练,提示注入成功率达84%,远超人类红队的13%。该模型用于强化GPT-5.6 Sol防御,引发AI安全创新与潜在滥用风险的争议。支持者认为可加速安全迭代,反对者担忧制造危险工 AI安全 OpenAI GPT-Red 2026年7月17日 547