Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

HumanEval Programacion EXTERNO · PROYECTO SATURADO

OpenAI · Versión: v1.0.0 · Métrica: pass@1

Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor

Qué mide

Mide generacion de codigo Python: 164 problemas con firma, docstring y tests. La solucion pasa los tests o no.

Dataset: 164 problemas Python escritos a mano, con solucion canonica y tests.

Qué NO mide

No mide debugging, refactoring, otros lenguajes, ni uso de herramientas.

Metodología

El modelo genera k soluciones; pass@k estima la probabilidad de que al menos una pase. pass@1 = una sola muestra (greedy o T=0.2).

  • v1.0.0 · dataset 164-problems · 164 problemas Python. Registrar pass@k usado: pass@1 y pass@10 no son la misma metrica.

Cómo interpretar el número

Probabilidad estimada de resolver el problema al primer intento. Mayor suele ser mejor.

Limitaciones

No comparar pass@1 con pass@k. Benchmark cercano a saturacion en modelos frontera.

Resultados disponibles (1)

Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.

Resultados de HumanEval por modelo, con fuente y configuración
Modelo Resultado (pass@1) Fecha Versión / Configuración Fuente
GPT-4o PROVEEDOR 90,2 % Eval.: desconocida
Verif.: 18/09/2026
Versión: v1.0.0
Herramientas: desconocido · Web: desconocido
Shots: 0 ·
OpenAI (Hello GPT-4o)
Ver fuente
Resultado informado por el proveedor (0-shot). No comparar con pass@k distinto.