Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

MMLU-Pro Razonamiento EXTERNO · ACADEMICA

TIGER-AI-Lab et al. · Versión: v1 · Métrica: accuracy

Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor

Qué mide

Mide comprension y razonamiento multidisciplinar exigente: 14 dominios, mas de 12000 preguntas con 10 opciones y enfasis en razonamiento.

Dataset: Mas de 12000 preguntas, 10 opciones, 14 dominios (matematica, fisica, quimica, derecho, ingenieria, psicologia, salud...).

Qué NO mide

No mide generacion abierta ni programacion practica.

Metodología

Accuracy sobre 10 opciones (azar = 10%). Mas estable ante variaciones de prompt que MMLU.

  • v1 · dataset 14-domains · 10 opciones por pregunta (azar 10%).

Cómo interpretar el número

Proporcion de respuestas correctas en preguntas de razonamiento. Mayor suele ser mejor.

Limitaciones

Distinto de MMLU: no comparar accuracy MMLU con accuracy MMLU-Pro.

Resultados disponibles (1)

Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.

Resultados de MMLU-Pro por modelo, con fuente y configuración
Modelo Resultado (accuracy) Fecha Versión / Configuración Fuente
Llama 4 PROVEEDOR 80,5 % Eval.: desconocida
Verif.: 18/09/2026
Versión: v1
Herramientas: desconocido · Web: desconocido
Meta (anuncio Llama 4)
Ver fuente
Variante evaluada: Llama 4 Maverick (ver identificador). No atribuir a todas las variantes Llama 4.