SWE Refactor Bench测试:8模型520次运行仅5.4%完成全仓库迁移

2026年8月24日,SWE Refactor Bench论文在arXiv发布,对8款前沿模型共520次运行开展全仓库技术栈迁移测试,结果仅28次(5.4%)通过全部评估阶段。

事实还原

该基准包含20个全仓库迁移任务,覆盖4类技术债务。三阶段评估协议依次为迁移审计、行为测试和代理验证。520次运行中,13个任务无任何模型给出被接受方案,最优模型Claude Opus 5得47.0/100分。语言重写类得分仅5.6,工具链重写得分31.4。340次通过迁移审计的运行中,58%达到固定检查的99%,但仅26%达到100%。

机制拆解

论文指出“迁移完成度”与“行为正确性”是两个完全独立的能力维度。部分运行通过跳过迁移保留原有行为,在迁移审计阶段被拦截;多数运行尝试迁移却引入行为缺陷,在行为测试阶段失败。现有基准仅评估行为正确性,导致代理可通过复制原实现通过测试,即论文所称的“Blindness”。三阶段协议同时测量迁移是否实际发生以及行为是否正确,避免这一漏洞。

产业影响

这一结果直接挑战当前关于AI编码代理可替代工程师的叙事。模型在不同迁移类别间表现差异显著,工具链重写相对容易,语言重写则几乎不可行。20个任务中多数未获任何成功方案,表明长周期、全仓库级重构仍超出当前前沿模型能力范围。开发者若依赖单一行为测试,可能低估迁移实际风险。

战略判断

(以下为分析而非事实)基准测试的难易梯度设计对发现能力边界至关重要。SWE Refactor Bench通过引入迁移审计环节,迫使模型必须真正执行重构而非规避,这暴露了此前基准未能捕捉的独立能力缺陷。未来若要提升代理在真实工程场景中的可靠性,需同时优化迁移完成度与行为正确性两个维度,而非仅追求测试通过率。

来源为arXiv论文2608.23564及相关报道。所有数据均来自论文公开结果,未添加额外推测。