MMLU-Pro Razonamiento EXTERNO · ACADEMICA
TIGER-AI-Lab et al. · Versión: v1 · Métrica: accuracy
Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor
Qué mide
Mide comprension y razonamiento multidisciplinar exigente: 14 dominios, mas de 12000 preguntas con 10 opciones y enfasis en razonamiento.
Dataset: Mas de 12000 preguntas, 10 opciones, 14 dominios (matematica, fisica, quimica, derecho, ingenieria, psicologia, salud...).
Qué NO mide
No mide generacion abierta ni programacion practica.
Metodología
Accuracy sobre 10 opciones (azar = 10%). Mas estable ante variaciones de prompt que MMLU.
- v1 · dataset 14-domains · 10 opciones por pregunta (azar 10%).
Cómo interpretar el número
Proporcion de respuestas correctas en preguntas de razonamiento. Mayor suele ser mejor.
Limitaciones
Distinto de MMLU: no comparar accuracy MMLU con accuracy MMLU-Pro.
Resultados disponibles (1)
Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.
| Modelo | Resultado (accuracy) | Fecha | Versión / Configuración | Fuente |
|---|---|---|---|---|
| Llama 4 PROVEEDOR | 80,5 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: v1 Herramientas: desconocido · Web: desconocido |
Meta (anuncio Llama 4)
Ver fuente Variante evaluada: Llama 4 Maverick (ver identificador). No atribuir a todas las variantes Llama 4. |