MMLU Conocimiento EXTERNO · ACADEMICA SATURADO
CAIS / UC Berkeley (Hendrycks et al.) · Versión: original-57 · Métrica: accuracy
Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor
Qué mide
Mide conocimiento multitarea: preguntas multiple-choice de 57 materias (STEM, humanidades, sociales, profesionales).
Dataset: 57 materias, 4 opciones por pregunta.
Qué NO mide
No mide razonamiento profundo, generacion abierta, ni programacion practica.
Metodología
Accuracy = respuestas correctas / total. Evaluacion 0-shot o few-shot segun protocolo.
- original-57 · dataset 57-subjects · 57 materias, 4 opciones. Ver MMLU-Redux para errores documentados.
Cómo interpretar el número
Proporcion de respuestas correctas. Mayor suele ser mejor.
Limitaciones
Errores de ground-truth documentados (MMLU-Redux). Saturado en frontera: bajo poder discriminativo actual.
Riesgos documentados
Discusion academica sobre posible contaminacion (dataset publico y antiguo) y errores de etiquetado (ver MMLU-Redux, NAACL 2025). Sin afirmacion de contaminacion de un modelo concreto.
Resultados disponibles (2)
Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.
| Modelo | Resultado (accuracy) | Fecha | Versión / Configuración | Fuente |
|---|---|---|---|---|
| DeepSeek R1 PROVEEDOR | 90,8 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: original-57 Herramientas: no · Web: desconocido |
DeepSeek-R1 paper
Ver fuente Tabla de resultados del paper (multiple-choice sin herramientas). Modelo open weights. |
| GPT-4o PROVEEDOR | 88,7 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: original-57 Herramientas: desconocido · Web: desconocido |
OpenAI (Hello GPT-4o)
Ver fuente Resultado informado por el proveedor. |