HumanEval Programacion EXTERNO · PROYECTO SATURADO
OpenAI · Versión: v1.0.0 · Métrica: pass@1
Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor
Qué mide
Mide generacion de codigo Python: 164 problemas con firma, docstring y tests. La solucion pasa los tests o no.
Dataset: 164 problemas Python escritos a mano, con solucion canonica y tests.
Qué NO mide
No mide debugging, refactoring, otros lenguajes, ni uso de herramientas.
Metodología
El modelo genera k soluciones; pass@k estima la probabilidad de que al menos una pase. pass@1 = una sola muestra (greedy o T=0.2).
- v1.0.0 · dataset 164-problems · 164 problemas Python. Registrar pass@k usado: pass@1 y pass@10 no son la misma metrica.
Cómo interpretar el número
Probabilidad estimada de resolver el problema al primer intento. Mayor suele ser mejor.
Limitaciones
No comparar pass@1 con pass@k. Benchmark cercano a saturacion en modelos frontera.
Resultados disponibles (1)
Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.
| Modelo | Resultado (pass@1) | Fecha | Versión / Configuración | Fuente |
|---|---|---|---|---|
| GPT-4o PROVEEDOR | 90,2 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: v1.0.0 Herramientas: desconocido · Web: desconocido Shots: 0 · |
OpenAI (Hello GPT-4o)
Ver fuente Resultado informado por el proveedor (0-shot). No comparar con pass@k distinto. |