Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

Observatorio evolutivo por tarea

Evidencia temporal y comparable de evaluaciones concretas. No es una clasificacion general de modelos.

Los resultados corresponden a evaluaciones especificas. Diferentes benchmarks, versiones o metodologias pueden no ser directamente comparables.

Cobertura disponible

8benchmarks con evidencia verificada
5tareas con resultados
6modelos con evidencia
18resultados verificados disponibles

Periodo de evaluacion/publicacion mostrado: 13/05/2024 a 07/08/2025. La fecha de verificacion se conserva separada y no se usa para inventar una medicion.

Explorar evidencia

Filtros de tarea, benchmark, modelo y periodo

Tareas con evidencia

Conocimiento

7 resultados verificados en 2 benchmarks y 5 modelos.

13/05/2024 a 07/08/2025

Matematica

4 resultados verificados en 2 benchmarks y 3 modelos.

13/05/2024 a 07/08/2025

Multimodal

1 resultados verificados en 1 benchmarks y 1 modelos.

13/05/2024 a 13/05/2024

Programacion

5 resultados verificados en 2 benchmarks y 4 modelos.

13/05/2024 a 07/08/2025

Razonamiento

1 resultados verificados en 1 benchmarks y 1 modelos.

05/04/2025 a 05/04/2025

Resultados disponibles

Resultados verificados, sin mezclar benchmarks ni metricas
Tarea / benchmarkModeloResultadoVersion y fechasFuente
Conocimiento
GPQA Diamond
Claude Opus 4 83,3 %
accuracy · unidad %
Benchmark: diamond-198
Evaluacion: no confirmada
Publicacion: 22/05/2025
Verificacion: 18/09/2026
Anthropic (anuncio Claude 4) Ver fuente
Conocimiento
GPQA Diamond
DeepSeek R1 71,5 %
accuracy · unidad %
Benchmark: diamond-198
Evaluacion: no confirmada
Publicacion: 22/01/2025
Verificacion: 18/09/2026
DeepSeek-R1 paper Ver fuente
Conocimiento
GPQA Diamond
Gemini 2.5 Pro 84,0 %
accuracy · unidad %
Benchmark: diamond-198
Evaluacion: no confirmada
Publicacion: 25/03/2025
Verificacion: 18/09/2026
Google (anuncio Gemini 2.5 Pro) Ver fuente
Conocimiento
GPQA Diamond
GPT-4o 53,6 %
accuracy · unidad %
Benchmark: diamond-198
Evaluacion: no confirmada
Publicacion: 13/05/2024
Verificacion: 18/09/2026
OpenAI (Hello GPT-4o) Ver fuente
Conocimiento
GPQA Diamond
GPT-5 88,4 %
accuracy · unidad %
Benchmark: diamond-198
Evaluacion: no confirmada
Publicacion: 07/08/2025
Verificacion: 18/09/2026
OpenAI (anuncio GPT-5) Ver fuente
Conocimiento
MMLU
DeepSeek R1 90,8 %
accuracy · unidad %
Benchmark: original-57
Evaluacion: no confirmada
Publicacion: 22/01/2025
Verificacion: 18/09/2026
DeepSeek-R1 paper Ver fuente
Conocimiento
MMLU
GPT-4o 88,7 %
accuracy · unidad %
Benchmark: original-57
Evaluacion: no confirmada
Publicacion: 13/05/2024
Verificacion: 18/09/2026
OpenAI (Hello GPT-4o) Ver fuente
Matematica
AIME
DeepSeek R1 79,8 %
accuracy · unidad %
Benchmark: 2024
Evaluacion: no confirmada
Publicacion: 22/01/2025
Verificacion: 18/09/2026
DeepSeek-R1 paper Ver fuente
Matematica
AIME
GPT-5 94,6 %
accuracy · unidad %
Benchmark: 2025
Evaluacion: no confirmada
Publicacion: 07/08/2025
Verificacion: 18/09/2026
OpenAI (anuncio GPT-5) Ver fuente
Matematica
MATH
DeepSeek R1 97,3 %
accuracy · unidad %
Benchmark: test-500
Evaluacion: no confirmada
Publicacion: 22/01/2025
Verificacion: 18/09/2026
DeepSeek-R1 paper Ver fuente
Matematica
MATH
GPT-4o 76,6 %
accuracy · unidad %
Benchmark: full-5000
Evaluacion: no confirmada
Publicacion: 13/05/2024
Verificacion: 18/09/2026
OpenAI (Hello GPT-4o) Ver fuente
Multimodal
MMMU
GPT-4o 69,1 %
accuracy · unidad %
Benchmark: val-11550
Evaluacion: no confirmada
Publicacion: 13/05/2024
Verificacion: 18/09/2026
OpenAI (Hello GPT-4o) Ver fuente
Programacion
HumanEval
GPT-4o 90,2 %
pass@1 · unidad %
Benchmark: v1.0.0
Evaluacion: no confirmada
Publicacion: 13/05/2024
Verificacion: 18/09/2026
OpenAI (Hello GPT-4o) Ver fuente
Programacion
SWE-bench Verified
Claude Opus 4 72,5 %
% tareas resueltas · unidad %
Benchmark: Verified-500
Evaluacion: no confirmada
Publicacion: 22/05/2025
Verificacion: 18/09/2026
Anthropic (anuncio Claude 4) Ver fuente
Programacion
SWE-bench Verified
DeepSeek R1 49,2 %
% tareas resueltas · unidad %
Benchmark: Verified-500
Evaluacion: no confirmada
Publicacion: 22/01/2025
Verificacion: 18/09/2026
DeepSeek-R1 paper Ver fuente
Programacion
SWE-bench Verified
GPT-4o 33,2 %
% tareas resueltas · unidad %
Benchmark: Verified-500
Evaluacion: no confirmada
Publicacion: no confirmada
Verificacion: 18/09/2026
Leaderboard oficial SWE-bench (vista Bash Only) Ver fuente
Programacion
SWE-bench Verified
GPT-5 74,9 %
% tareas resueltas · unidad %
Benchmark: Verified-500
Evaluacion: no confirmada
Publicacion: 07/08/2025
Verificacion: 18/09/2026
OpenAI (anuncio GPT-5) Ver fuente
Razonamiento
MMLU-Pro
Llama 4 80,5 %
accuracy · unidad %
Benchmark: v1
Evaluacion: no confirmada
Publicacion: 05/04/2025
Verificacion: 18/09/2026
Meta (anuncio Llama 4) Ver fuente
Que puede y que no puede concluirse

Una medicion aislada es un resultado disponible. Dos mediciones comparables muestran un cambio observado, no una tendencia sostenida. Solo tres o mas puntos comparables habilitan una serie temporal. Un cambio de catalogo o una noticia son contexto separado y no prueban una mejora.