SWE-Gate基准:34%通过功能测试的AI修复违反代码审查约束

SWE-Gate新基准揭示AI代码修复34%通过测试却违规审查 swe-gate-benchmark-ai-repairs-fail-review-constraints AI软件工程,代码审查,基准测试 2026年9月3日arXiv发布的SWE-Gate论文构建303个任务新基准,644个功能测试通过的修复中有221个(34%)违反代码审查要求,覆盖75个开源Python仓库,证明现有基准系统性高估Agent能力。

2026年9月3日发布的SWE-Gate论文显示,在644个通过功能测试的AI软件修复中,有221个(34%)违反了代码审查约束。

事实还原

该基准包含303个仓库级修复实例,来自75个开源Python仓库,实验使用4种LLM后端。每个实例同时提供功能测试和从真实PR审查评论中提取的约束测试,并附带合规金牌补丁与不合规补丁。

机制拆解

现有仓库级基准仅检查功能测试通过与否,忽略真实开发中代码审查施加的额外约束。SWE-Gate将审查约束显式转化为可执行测试,从而把“解决问题能力”与“满足完整规范”分开评估,导致221个原本被视为成功的案例被判定不合规。

产业影响

此差距表明,单纯依赖功能正确性的评估会系统性高估软件工程Agent在实际仓库中的可用性,可能影响企业采纳决策和工具迭代方向。

战略判断

【分析】若未来基准普遍加入审查约束,现有仅追求功能通过率的训练与评估流程可能需要调整,以避免资源浪费在无法通过真实审查的方案上。