Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

Benchmarks de IA

Cada benchmark explica qué mide —y qué no mide—, con su métrica, versión y organización. 12 benchmarks documentados.

Filtrar benchmarks

GPQA Diamond

Conocimiento EXTERNO

Mide conocimiento cientifico de nivel posgrado: 198 preguntas multiple-choice de biologia, fisica y quimica validadas por expertos.

  • Métrica: accuracy
  • Versión: diamond-198
  • Organización: Rein et al. (NYU/Anthropic)
  • 5 modelos · 5 resultados

MMLU

Conocimiento EXTERNO SATURADO

Mide conocimiento multitarea: preguntas multiple-choice de 57 materias (STEM, humanidades, sociales, profesionales).

  • Métrica: accuracy
  • Versión: original-57
  • Organización: CAIS / UC Berkeley (Hendrycks et al.)
  • 2 modelos · 2 resultados

RULER

Contexto largo EXTERNO

Mide uso efectivo de contexto largo: recuperacion, rastreo multi-salto, agregacion y QA sobre contextos de hasta cientos de miles de tokens.

  • Métrica: accuracy promedio
  • Versión: v1
  • Organización: NVIDIA et al.
  • 0 modelos · 0 resultados

Global-MMLU

Idioma EXTERNO

Mide conocimiento multitarea en 42 idiomas (incluye espanol): traduccion culturalmente adaptada de MMLU con revision humana.

  • Métrica: accuracy
  • Versión: v1
  • Organización: Singh et al.
  • 0 modelos · 0 resultados

AIME

Matematica EXTERNO

Mide razonamiento matematico olimpico: problemas del American Invitational Mathematics Examination (respuesta entera 0-999).

  • Métrica: accuracy
  • Versión: multi-anual
  • Organización: MAA (Mathematical Association of America)
  • 2 modelos · 2 resultados

GSM8K

Matematica EXTERNO SATURADO

Mide resolucion de problemas matematicos de escuela primaria: 1319 problemas con respuesta numerica exacta.

  • Métrica: exact match
  • Versión: original-1319
  • Organización: OpenAI
  • 0 modelos · 0 resultados

MATH

Matematica EXTERNO

Mide resolucion de problemas matematicos de competencia: 5000 problemas en 6 areas con respuesta verificable por reglas.

  • Métrica: accuracy
  • Versión: full-5000
  • Organización: UC Berkeley (Hendrycks et al.)
  • 2 modelos · 2 resultados

MMMU

Multimodal EXTERNO

Mide comprension multimodal experta: 11550 preguntas de 30 materias que requieren imagen + texto (diagramas, graficos, partituras).

  • Métrica: accuracy
  • Versión: val-11550
  • Organización: MMMU Team
  • 1 modelos · 1 resultados

HumanEval

Programacion EXTERNO SATURADO

Mide generacion de codigo Python: 164 problemas con firma, docstring y tests. La solucion pasa los tests o no.

  • Métrica: pass@1
  • Versión: v1.0.0
  • Organización: OpenAI
  • 1 modelos · 1 resultados

SWE-bench Verified

Programacion EXTERNO

Mide el porcentaje de issues reales de GitHub (12 repositorios Python) que un sistema de codificacion logra resolver con ejecucion de tests en Docker. Subconjunto de 500 instancias filtradas por humanos.

  • Métrica: % tareas resueltas
  • Versión: Verified-500
  • Organización: SWE-bench (Princeton/Oakland) + OpenAI
  • 4 modelos · 4 resultados

MMLU-Pro

Razonamiento EXTERNO

Mide comprension y razonamiento multidisciplinar exigente: 14 dominios, mas de 12000 preguntas con 10 opciones y enfasis en razonamiento.

  • Métrica: accuracy
  • Versión: v1
  • Organización: TIGER-AI-Lab et al.
  • 1 modelos · 1 resultados

Berkeley Function-Calling Leaderboard (BFCL)

Tool Calling EXTERNO

Mide llamada a funciones: seleccion de herramienta, argumentos validos, secuencia y ejecucion en Python/Java/JavaScript y multi-turno.

  • Métrica: accuracy
  • Versión: v3
  • Organización: Berkeley Gorilla / UC Berkeley
  • 0 modelos · 0 resultados