Benchmarks de IA
Cada benchmark explica qué mide —y qué no mide—, con su métrica, versión y organización. 12 benchmarks documentados.
GPQA Diamond
Conocimiento EXTERNO
Mide conocimiento cientifico de nivel posgrado: 198 preguntas multiple-choice de biologia, fisica y quimica validadas por expertos.
- Métrica: accuracy
- Versión: diamond-198
- Organización: Rein et al. (NYU/Anthropic)
- 5 modelos · 5 resultados
MMLU
Conocimiento EXTERNO SATURADO
Mide conocimiento multitarea: preguntas multiple-choice de 57 materias (STEM, humanidades, sociales, profesionales).
- Métrica: accuracy
- Versión: original-57
- Organización: CAIS / UC Berkeley (Hendrycks et al.)
- 2 modelos · 2 resultados
RULER
Contexto largo EXTERNO
Mide uso efectivo de contexto largo: recuperacion, rastreo multi-salto, agregacion y QA sobre contextos de hasta cientos de miles de tokens.
- Métrica: accuracy promedio
- Versión: v1
- Organización: NVIDIA et al.
- 0 modelos · 0 resultados
Global-MMLU
Idioma EXTERNO
Mide conocimiento multitarea en 42 idiomas (incluye espanol): traduccion culturalmente adaptada de MMLU con revision humana.
- Métrica: accuracy
- Versión: v1
- Organización: Singh et al.
- 0 modelos · 0 resultados
AIME
Matematica EXTERNO
Mide razonamiento matematico olimpico: problemas del American Invitational Mathematics Examination (respuesta entera 0-999).
- Métrica: accuracy
- Versión: multi-anual
- Organización: MAA (Mathematical Association of America)
- 2 modelos · 2 resultados
GSM8K
Matematica EXTERNO SATURADO
Mide resolucion de problemas matematicos de escuela primaria: 1319 problemas con respuesta numerica exacta.
- Métrica: exact match
- Versión: original-1319
- Organización: OpenAI
- 0 modelos · 0 resultados
MATH
Matematica EXTERNO
Mide resolucion de problemas matematicos de competencia: 5000 problemas en 6 areas con respuesta verificable por reglas.
- Métrica: accuracy
- Versión: full-5000
- Organización: UC Berkeley (Hendrycks et al.)
- 2 modelos · 2 resultados
MMMU
Multimodal EXTERNO
Mide comprension multimodal experta: 11550 preguntas de 30 materias que requieren imagen + texto (diagramas, graficos, partituras).
- Métrica: accuracy
- Versión: val-11550
- Organización: MMMU Team
- 1 modelos · 1 resultados
HumanEval
Programacion EXTERNO SATURADO
Mide generacion de codigo Python: 164 problemas con firma, docstring y tests. La solucion pasa los tests o no.
- Métrica: pass@1
- Versión: v1.0.0
- Organización: OpenAI
- 1 modelos · 1 resultados
SWE-bench Verified
Programacion EXTERNO
Mide el porcentaje de issues reales de GitHub (12 repositorios Python) que un sistema de codificacion logra resolver con ejecucion de tests en Docker. Subconjunto de 500 instancias filtradas por humanos.
- Métrica: % tareas resueltas
- Versión: Verified-500
- Organización: SWE-bench (Princeton/Oakland) + OpenAI
- 4 modelos · 4 resultados
MMLU-Pro
Razonamiento EXTERNO
Mide comprension y razonamiento multidisciplinar exigente: 14 dominios, mas de 12000 preguntas con 10 opciones y enfasis en razonamiento.
- Métrica: accuracy
- Versión: v1
- Organización: TIGER-AI-Lab et al.
- 1 modelos · 1 resultados
Berkeley Function-Calling Leaderboard (BFCL)
Tool Calling EXTERNO
Mide llamada a funciones: seleccion de herramienta, argumentos validos, secuencia y ejecucion en Python/Java/JavaScript y multi-turno.
- Métrica: accuracy
- Versión: v3
- Organización: Berkeley Gorilla / UC Berkeley
- 0 modelos · 0 resultados