Evolucion disponible
Version: Verified-500 · Metrica: % tareas resueltas · Unidad: %
Resultado disponible; no hay evolución demostrada.
Mediciones de GPT-4o en SWE-bench Verified
| Fecha de evaluacion/publicacion | Resultado | Fecha de evaluacion | Fecha de publicacion | Fuente |
| No confirmado | 33,2 % | No confirmado | No confirmado | Leaderboard oficial SWE-bench (vista Bash Only) Ver fuente |
Version: v1.0.0 · Metrica: pass@1 · Unidad: %
Resultado disponible; no hay evolución demostrada.
Mediciones de GPT-4o en HumanEval
| Fecha de evaluacion/publicacion | Resultado | Fecha de evaluacion | Fecha de publicacion | Fuente |
| 13/05/2024 | 90,2 % | No confirmado | 13/05/2024 | OpenAI (Hello GPT-4o) Ver fuente |
Version: Verified-500 · Metrica: % tareas resueltas · Unidad: %
Resultado disponible; no hay evolución demostrada.
Mediciones de Claude Opus 4 en SWE-bench Verified
| Fecha de evaluacion/publicacion | Resultado | Fecha de evaluacion | Fecha de publicacion | Fuente |
| 22/05/2025 | 72,5 % | No confirmado | 22/05/2025 | Anthropic (anuncio Claude 4) Ver fuente |
Version: Verified-500 · Metrica: % tareas resueltas · Unidad: %
Resultado disponible; no hay evolución demostrada.
Mediciones de DeepSeek R1 en SWE-bench Verified
| Fecha de evaluacion/publicacion | Resultado | Fecha de evaluacion | Fecha de publicacion | Fuente |
| 22/01/2025 | 49,2 % | No confirmado | 22/01/2025 | DeepSeek-R1 paper Ver fuente |
Version: Verified-500 · Metrica: % tareas resueltas · Unidad: %
Resultado disponible; no hay evolución demostrada.
Mediciones de GPT-5 en SWE-bench Verified
| Fecha de evaluacion/publicacion | Resultado | Fecha de evaluacion | Fecha de publicacion | Fuente |
| 07/08/2025 | 74,9 % | No confirmado | 07/08/2025 | OpenAI (anuncio GPT-5) Ver fuente |
Limitaciones
La ausencia de puntos comparables no significa ausencia de capacidad. Benchmarks, versiones, metricas, unidades, harnesses y condiciones diferentes deben mantenerse separados. Alias, snapshots, modelo logico y familia tampoco se sustituyen entre si.