MMMU Multimodal EXTERNO · ACADEMICA
MMMU Team · Versión: val-11550 · Métrica: accuracy
Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor
Qué mide
Mide comprension multimodal experta: 11550 preguntas de 30 materias que requieren imagen + texto (diagramas, graficos, partituras).
Dataset: Conjunto de validacion: 11550 items multimodales.
Qué NO mide
No mide generacion de imagenes, audio ni video. Solo comprension.
Metodología
Accuracy multiple-choice / respuesta corta con insumo visual obligatorio.
- val-11550 · dataset validation · Conjunto de validacion.
Cómo interpretar el número
Proporcion de respuestas correctas con insumo visual. Mayor suele ser mejor.
Limitaciones
Separar vision-comprension de generacion de imagenes: no usar multimodal como capacidad unica.
Resultados disponibles (1)
Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.
| Modelo | Resultado (accuracy) | Fecha | Versión / Configuración | Fuente |
|---|---|---|---|---|
| GPT-4o PROVEEDOR | 69,1 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: val-11550 Herramientas: desconocido · Web: desconocido |
OpenAI (Hello GPT-4o)
Ver fuente Comprension multimodal (imagen+texto). No incluye generacion de imagenes. |