Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

MMMU Multimodal EXTERNO · ACADEMICA

MMMU Team · Versión: val-11550 · Métrica: accuracy

Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor

Qué mide

Mide comprension multimodal experta: 11550 preguntas de 30 materias que requieren imagen + texto (diagramas, graficos, partituras).

Dataset: Conjunto de validacion: 11550 items multimodales.

Qué NO mide

No mide generacion de imagenes, audio ni video. Solo comprension.

Metodología

Accuracy multiple-choice / respuesta corta con insumo visual obligatorio.

  • val-11550 · dataset validation · Conjunto de validacion.

Cómo interpretar el número

Proporcion de respuestas correctas con insumo visual. Mayor suele ser mejor.

Limitaciones

Separar vision-comprension de generacion de imagenes: no usar multimodal como capacidad unica.

Resultados disponibles (1)

Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.

Resultados de MMMU por modelo, con fuente y configuración
Modelo Resultado (accuracy) Fecha Versión / Configuración Fuente
GPT-4o PROVEEDOR 69,1 % Eval.: desconocida
Verif.: 18/09/2026
Versión: val-11550
Herramientas: desconocido · Web: desconocido
OpenAI (Hello GPT-4o)
Ver fuente
Comprension multimodal (imagen+texto). No incluye generacion de imagenes.