Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

SWE-bench Verified Programacion EXTERNO · PROYECTO

SWE-bench (Princeton/Oakland) + OpenAI · Versión: Verified-500 · Métrica: % tareas resueltas

Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor

Qué mide

Mide el porcentaje de issues reales de GitHub (12 repositorios Python) que un sistema de codificacion logra resolver con ejecucion de tests en Docker. Subconjunto de 500 instancias filtradas por humanos.

Dataset: 500 instancias curadas (django, sympy, scikit-learn, sphinx, matplotlib, pytest, xarray, astropy, pylint, requests, seaborn, flask).

Qué NO mide

No mide velocidad, costo, calidad del codigo mas alla de pasar los tests, ni tareas fuera de Python/open-source.

Metodología

Agente (ej. mini-SWE-agent en entorno bash minimo) resuelve el issue; se ejecutan los tests FAIL_TO_PASS y PASS_TO_PASS en Docker.

  • Verified-500 · dataset 500-instances · Subconjunto humano de SWE-bench. La vista Bash Only (mini-SWE-agent) permite comparar modelos en igual entorno.

Cómo interpretar el número

Porcentaje de tareas resueltas en esta version y harness. Mayor suele ser mejor dentro de la misma configuracion.

Limitaciones

El harness influye: resultados con distinto agente no son directamente comparables. No representa todo el trabajo de programacion.

Resultados disponibles (4)

Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.

Resultados de SWE-bench Verified por modelo, con fuente y configuración
Modelo Resultado (% tareas resueltas) Fecha Versión / Configuración Fuente
GPT-5 PROVEEDOR 74,9 % Eval.: desconocida
Verif.: 18/09/2026
Versión: Verified-500
Herramientas: desconocido · Web: desconocido
OpenAI (anuncio GPT-5)
Ver fuente
Resultado informado por el proveedor. Harness y configuracion no detallados en la fuente consultada.
Claude Opus 4 HISTÓRICO · retirado PROVEEDOR 72,5 % Eval.: desconocida
Verif.: 18/09/2026
Versión: Verified-500
Herramientas: desconocido · Web: desconocido
Anthropic (anuncio Claude 4)
Ver fuente
Resultado informado por el proveedor. Modelo retirado: se conserva como historico, no se transfiere al sucesor.
DeepSeek R1 PROVEEDOR 49,2 % Eval.: desconocida
Verif.: 18/09/2026
Versión: Verified-500
Herramientas: desconocido · Web: desconocido
DeepSeek-R1 paper
Ver fuente
Tabla de resultados del paper (configuracion de agente segun paper). Modelo open weights.
GPT-4o PROYECTO 33,2 % Eval.: desconocida
Verif.: 18/09/2026
Versión: Verified-500
Herramientas: sí · Web: desconocido
Leaderboard oficial SWE-bench (vista Bash Only)
Ver fuente
Mismo entorno mini-SWE-agent para todos los modelos del leaderboard. Valor historico de referencia.