Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

MMLU Conocimiento EXTERNO · ACADEMICA SATURADO

CAIS / UC Berkeley (Hendrycks et al.) · Versión: original-57 · Métrica: accuracy

Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor

Qué mide

Mide conocimiento multitarea: preguntas multiple-choice de 57 materias (STEM, humanidades, sociales, profesionales).

Dataset: 57 materias, 4 opciones por pregunta.

Qué NO mide

No mide razonamiento profundo, generacion abierta, ni programacion practica.

Metodología

Accuracy = respuestas correctas / total. Evaluacion 0-shot o few-shot segun protocolo.

  • original-57 · dataset 57-subjects · 57 materias, 4 opciones. Ver MMLU-Redux para errores documentados.

Cómo interpretar el número

Proporcion de respuestas correctas. Mayor suele ser mejor.

Limitaciones

Errores de ground-truth documentados (MMLU-Redux). Saturado en frontera: bajo poder discriminativo actual.

Riesgos documentados

Discusion academica sobre posible contaminacion (dataset publico y antiguo) y errores de etiquetado (ver MMLU-Redux, NAACL 2025). Sin afirmacion de contaminacion de un modelo concreto.

Resultados disponibles (2)

Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.

Resultados de MMLU por modelo, con fuente y configuración
Modelo Resultado (accuracy) Fecha Versión / Configuración Fuente
DeepSeek R1 PROVEEDOR 90,8 % Eval.: desconocida
Verif.: 18/09/2026
Versión: original-57
Herramientas: no · Web: desconocido
DeepSeek-R1 paper
Ver fuente
Tabla de resultados del paper (multiple-choice sin herramientas). Modelo open weights.
GPT-4o PROVEEDOR 88,7 % Eval.: desconocida
Verif.: 18/09/2026
Versión: original-57
Herramientas: desconocido · Web: desconocido
OpenAI (Hello GPT-4o)
Ver fuente
Resultado informado por el proveedor.