Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

Observatorio de Multimodal

Resultados verificados relacionados con esta tarea o capacidad evaluada.

Los resultados corresponden a evaluaciones especificas. Diferentes benchmarks, versiones o metodologias pueden no ser directamente comparables.

Filtros de benchmark, modelo y periodo
Limpiar

Benchmarks relacionados

MMMU
Metrica: accuracy · Unidad: %

Evolucion disponible

GPT-4o · MMMU

Version: val-11550 · Metrica: accuracy · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de GPT-4o en MMMU
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
13/05/202469,1 %No confirmado13/05/2024OpenAI (Hello GPT-4o) Ver fuente

Limitaciones

La ausencia de puntos comparables no significa ausencia de capacidad. Benchmarks, versiones, metricas, unidades, harnesses y condiciones diferentes deben mantenerse separados. Alias, snapshots, modelo logico y familia tampoco se sustituyen entre si.