2026年9月3日发布的SWE-Gate论文显示,在644个通过功能测试的AI软件修复中,有221个(34%)违反了代码审查约束。
事实还原
该基准包含303个仓库级修复实例,来自75个开源Python仓库,实验使用4种LLM后端。每个实例同时提供功能测试和从真实PR审查评论中提取的约束测试,并附带合规金牌补丁与不合规补丁。
机制拆解
现有仓库级基准仅检查功能测试通过与否,忽略真实开发中代码审查施加的额外约束。SWE-Gate将审查约束显式转化为可执行测试,从而把“解决问题能力”与“满足完整规范”分开评估,导致221个原本被视为成功的案例被判定不合规。
产业影响
此差距表明,单纯依赖功能正确性的评估会系统性高估软件工程Agent在实际仓库中的可用性,可能影响企业采纳决策和工具迭代方向。
战略判断
【分析】若未来基准普遍加入审查约束,现有仅追求功能通过率的训练与评估流程可能需要调整,以避免资源浪费在无法通过真实审查的方案上。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接