Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

Observatorio de Conocimiento

Resultados verificados relacionados con esta tarea o capacidad evaluada.

Los resultados corresponden a evaluaciones especificas. Diferentes benchmarks, versiones o metodologias pueden no ser directamente comparables.

Filtros de benchmark, modelo y periodo
Limpiar

Benchmarks relacionados

GPQA Diamond
Metrica: accuracy · Unidad: %
MMLU
Metrica: accuracy · Unidad: %

Evolucion disponible

GPT-4o · MMLU

Version: original-57 · Metrica: accuracy · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de GPT-4o en MMLU
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
13/05/202488,7 %No confirmado13/05/2024OpenAI (Hello GPT-4o) Ver fuente

GPT-4o · GPQA Diamond

Version: diamond-198 · Metrica: accuracy · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de GPT-4o en GPQA Diamond
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
13/05/202453,6 %No confirmado13/05/2024OpenAI (Hello GPT-4o) Ver fuente

Claude Opus 4 · GPQA Diamond

Version: diamond-198 · Metrica: accuracy · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de Claude Opus 4 en GPQA Diamond
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
22/05/202583,3 %No confirmado22/05/2025Anthropic (anuncio Claude 4) Ver fuente

Gemini 2.5 Pro · GPQA Diamond

Version: diamond-198 · Metrica: accuracy · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de Gemini 2.5 Pro en GPQA Diamond
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
25/03/202584,0 %No confirmado25/03/2025Google (anuncio Gemini 2.5 Pro) Ver fuente

DeepSeek R1 · MMLU

Version: original-57 · Metrica: accuracy · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de DeepSeek R1 en MMLU
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
22/01/202590,8 %No confirmado22/01/2025DeepSeek-R1 paper Ver fuente

DeepSeek R1 · GPQA Diamond

Version: diamond-198 · Metrica: accuracy · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de DeepSeek R1 en GPQA Diamond
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
22/01/202571,5 %No confirmado22/01/2025DeepSeek-R1 paper Ver fuente

GPT-5 · GPQA Diamond

Version: diamond-198 · Metrica: accuracy · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de GPT-5 en GPQA Diamond
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
07/08/202588,4 %No confirmado07/08/2025OpenAI (anuncio GPT-5) Ver fuente

Limitaciones

La ausencia de puntos comparables no significa ausencia de capacidad. Benchmarks, versiones, metricas, unidades, harnesses y condiciones diferentes deben mantenerse separados. Alias, snapshots, modelo logico y familia tampoco se sustituyen entre si.