原创 SWE-Gate基准:34%通过功能测试的AI修复违反代码审查约束 2026年9月3日arXiv发布的SWE-Gate论文构建303个任务新基准,644个功能测试通过的修复中有221个(34%)违反代码审查要求,覆盖75个开源Python仓库,证明现有基准系统性高估Agent能力。 AI软件工程 代码审查 基准测试 20小时前 41
测评 GPT-4o崩了:工程师最信任的AI判断力跌至0分 GPT-4o在最新评测中遭遇滑铁卢:代码bug检测能力从满分暴跌至0分。面对一段存在明显逻辑错误的代码,GPT-4o竟然回答"代码本身没有明显的bug",暴露出其工程判断力的严重退化。 GPT-4o 编程能力 代码审查 工程实践 2026年3月21日 798