SWE-bench Verified Programacion EXTERNO · PROYECTO
SWE-bench (Princeton/Oakland) + OpenAI · Versión: Verified-500 · Métrica: % tareas resueltas
Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor
Qué mide
Mide el porcentaje de issues reales de GitHub (12 repositorios Python) que un sistema de codificacion logra resolver con ejecucion de tests en Docker. Subconjunto de 500 instancias filtradas por humanos.
Dataset: 500 instancias curadas (django, sympy, scikit-learn, sphinx, matplotlib, pytest, xarray, astropy, pylint, requests, seaborn, flask).
Qué NO mide
No mide velocidad, costo, calidad del codigo mas alla de pasar los tests, ni tareas fuera de Python/open-source.
Metodología
Agente (ej. mini-SWE-agent en entorno bash minimo) resuelve el issue; se ejecutan los tests FAIL_TO_PASS y PASS_TO_PASS en Docker.
- Verified-500 · dataset 500-instances · Subconjunto humano de SWE-bench. La vista Bash Only (mini-SWE-agent) permite comparar modelos en igual entorno.
Cómo interpretar el número
Porcentaje de tareas resueltas en esta version y harness. Mayor suele ser mejor dentro de la misma configuracion.
Limitaciones
El harness influye: resultados con distinto agente no son directamente comparables. No representa todo el trabajo de programacion.
Resultados disponibles (4)
Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.
| Modelo | Resultado (% tareas resueltas) | Fecha | Versión / Configuración | Fuente |
|---|---|---|---|---|
| GPT-5 PROVEEDOR | 74,9 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: Verified-500 Herramientas: desconocido · Web: desconocido |
OpenAI (anuncio GPT-5)
Ver fuente Resultado informado por el proveedor. Harness y configuracion no detallados en la fuente consultada. |
| Claude Opus 4 HISTÓRICO · retirado PROVEEDOR | 72,5 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: Verified-500 Herramientas: desconocido · Web: desconocido |
Anthropic (anuncio Claude 4)
Ver fuente Resultado informado por el proveedor. Modelo retirado: se conserva como historico, no se transfiere al sucesor. |
| DeepSeek R1 PROVEEDOR | 49,2 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: Verified-500 Herramientas: desconocido · Web: desconocido |
DeepSeek-R1 paper
Ver fuente Tabla de resultados del paper (configuracion de agente segun paper). Modelo open weights. |
| GPT-4o PROYECTO | 33,2 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: Verified-500 Herramientas: sí · Web: desconocido |
Leaderboard oficial SWE-bench (vista Bash Only)
Ver fuente Mismo entorno mini-SWE-agent para todos los modelos del leaderboard. Valor historico de referencia. |