Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

Observatorio de Matematica

Resultados verificados relacionados con esta tarea o capacidad evaluada.

Los resultados corresponden a evaluaciones especificas. Diferentes benchmarks, versiones o metodologias pueden no ser directamente comparables.

Filtros de benchmark, modelo y periodo
Limpiar

Benchmarks relacionados

AIME
Metrica: accuracy · Unidad: %
MATH
Metrica: accuracy · Unidad: %

Evolucion disponible

GPT-4o · MATH

Version: full-5000 · Metrica: accuracy · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de GPT-4o en MATH
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
13/05/202476,6 %No confirmado13/05/2024OpenAI (Hello GPT-4o) Ver fuente

DeepSeek R1 · MATH

Version: test-500 · Metrica: accuracy · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de DeepSeek R1 en MATH
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
22/01/202597,3 %No confirmado22/01/2025DeepSeek-R1 paper Ver fuente

DeepSeek R1 · AIME

Version: 2024 · Metrica: accuracy · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de DeepSeek R1 en AIME
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
22/01/202579,8 %No confirmado22/01/2025DeepSeek-R1 paper Ver fuente

GPT-5 · AIME

Version: 2025 · Metrica: accuracy · Unidad: %

Resultado disponible; no hay evolución demostrada.

Mediciones de GPT-5 en AIME
Fecha de evaluacion/publicacionResultadoFecha de evaluacionFecha de publicacionFuente
07/08/202594,6 %No confirmado07/08/2025OpenAI (anuncio GPT-5) Ver fuente

Limitaciones

La ausencia de puntos comparables no significa ausencia de capacidad. Benchmarks, versiones, metricas, unidades, harnesses y condiciones diferentes deben mantenerse separados. Alias, snapshots, modelo logico y familia tampoco se sustituyen entre si.