SWE-bench 是什么?
你打开 GitHub,看到一条条 issue:有人报 bug、有人提需求。SWE-bench 要做的,就是把这些真实的 issue 收集起来,配上对应的代码仓库和最终修复,拿来考 AI:给模型一段问题描述,看它能不能自己翻代码、定位问题、改出能通过测试的补丁。它和传统编程题有什么不同?
题目来自真实世界不是人造的算法题,而是 PyTorch、Django 这类真实开源项目里真有人报过的问题。AI 面对的是一整个代码仓库,不是几十行的孤立函数。
判分看测试通过
改出来的补丁不是「看着像」,而是要跑过项目自带的测试才算数。能通过测试,才叫真的修好了。
它怎么考 AI?
输入一条 issue 的描述,加上整个代码仓库。
输出
一份代码改动(补丁)。
评判
把补丁打上去,跑对应的测试;测试通过就算这道题做对。
它为什么重要?
在 SWE-bench 出现之前,「AI 会写代码」这件事很难量化。SWE-bench 给了一个贴近真实工作的标尺——从「能刷算法题」到「能修真实项目」,这是 AI 编码能力的一次跃迁,也是各家大模型竞相刷榜的战场。一句话记住:SWE-bench 就是用真实 GitHub issue 给 AI 出题,让它像工程师一样把 bug 修好、测试通过才算赢。
评论