LuAITools.com
提交工具
🧪AI
Un benchmark hecho de issues reales de GitHub

SWE-bench

SWE-bench toma issues reales de GitHub con sus arreglos y los usa para evaluar a la IA: le das el reporte de un bug y un repositorio, y miras si es capaz de localizar el problema y escribir un parche como un ingeniero.

¿Qué es SWE-bench?

Abre GitHub y verás issue tras issue: alguien reporta un bug, alguien pide una función. SWE-bench recopila esos issues reales, los empareja con su repositorio y su arreglo final, y los usa para evaluar a la IA: le das la descripción del problema al modelo, y miras si es capaz de hurgar en el código, localizar el fallo y producir un parche que pase los tests.

¿En qué se diferencia de los puzzles de código?

Los problemas vienen del mundo real
No son ejercicios de algoritmos inventados: son problemas que la gente reportó de verdad en proyectos open source como PyTorch o Django. La IA se enfrenta a un código entero, no a una función de cuarenta líneas.
Puntuar es pasar tests
Un parche no basta con que «parezca» correcto: tiene que pasar la batería de tests del propio proyecto. Solo entonces el bug está arreglado de verdad.

¿Cómo evalúa a la IA?

Entrada
La descripción de un issue, más el repositorio completo.
Salida
Un cambio de código: un parche.
Veredicto
Se aplica el parche y se ejecutan los tests correspondientes; si pasan, el problema cuenta como resuelto.

Por qué importa

Antes de SWE-bench, «la IA sabe escribir código» era difícil de medir. SWE-bench nos dio una regla que se parece al trabajo real: pasar de «resuelve puzzles de algoritmos» a «arregla proyectos reales». Es un salto en la capacidad de programar de la IA, y el ranking donde ahora pelean todos los grandes modelos.

En resumen: SWE-bench evalúa a la IA con issues reales de GitHub y solo cuenta la victoria cuando el bug queda arreglado y los tests pasan.

Comentarios