Observatorio evolutivo por tarea
Evidencia temporal y comparable de evaluaciones concretas. No es una clasificacion general de modelos.
Los resultados corresponden a evaluaciones especificas. Diferentes benchmarks, versiones o metodologias pueden no ser directamente comparables.
Cobertura disponible
8benchmarks con evidencia verificada
5tareas con resultados
6modelos con evidencia
18resultados verificados disponibles
Periodo de evaluacion/publicacion mostrado: 13/05/2024 a 07/08/2025. La fecha de verificacion se conserva separada y no se usa para inventar una medicion.
Explorar evidencia
Tareas con evidencia
Resultados disponibles
| Tarea / benchmark | Modelo | Resultado | Version y fechas | Fuente |
|---|---|---|---|---|
| Conocimiento GPQA Diamond |
Claude Opus 4 | 83,3 % accuracy · unidad % |
Benchmark: diamond-198 Evaluacion: no confirmada Publicacion: 22/05/2025 Verificacion: 18/09/2026 |
Anthropic (anuncio Claude 4) Ver fuente |
| Conocimiento GPQA Diamond |
DeepSeek R1 | 71,5 % accuracy · unidad % |
Benchmark: diamond-198 Evaluacion: no confirmada Publicacion: 22/01/2025 Verificacion: 18/09/2026 |
DeepSeek-R1 paper Ver fuente |
| Conocimiento GPQA Diamond |
Gemini 2.5 Pro | 84,0 % accuracy · unidad % |
Benchmark: diamond-198 Evaluacion: no confirmada Publicacion: 25/03/2025 Verificacion: 18/09/2026 |
Google (anuncio Gemini 2.5 Pro) Ver fuente |
| Conocimiento GPQA Diamond |
GPT-4o | 53,6 % accuracy · unidad % |
Benchmark: diamond-198 Evaluacion: no confirmada Publicacion: 13/05/2024 Verificacion: 18/09/2026 |
OpenAI (Hello GPT-4o) Ver fuente |
| Conocimiento GPQA Diamond |
GPT-5 | 88,4 % accuracy · unidad % |
Benchmark: diamond-198 Evaluacion: no confirmada Publicacion: 07/08/2025 Verificacion: 18/09/2026 |
OpenAI (anuncio GPT-5) Ver fuente |
| Conocimiento MMLU |
DeepSeek R1 | 90,8 % accuracy · unidad % |
Benchmark: original-57 Evaluacion: no confirmada Publicacion: 22/01/2025 Verificacion: 18/09/2026 |
DeepSeek-R1 paper Ver fuente |
| Conocimiento MMLU |
GPT-4o | 88,7 % accuracy · unidad % |
Benchmark: original-57 Evaluacion: no confirmada Publicacion: 13/05/2024 Verificacion: 18/09/2026 |
OpenAI (Hello GPT-4o) Ver fuente |
| Matematica AIME |
DeepSeek R1 | 79,8 % accuracy · unidad % |
Benchmark: 2024 Evaluacion: no confirmada Publicacion: 22/01/2025 Verificacion: 18/09/2026 |
DeepSeek-R1 paper Ver fuente |
| Matematica AIME |
GPT-5 | 94,6 % accuracy · unidad % |
Benchmark: 2025 Evaluacion: no confirmada Publicacion: 07/08/2025 Verificacion: 18/09/2026 |
OpenAI (anuncio GPT-5) Ver fuente |
| Matematica MATH |
DeepSeek R1 | 97,3 % accuracy · unidad % |
Benchmark: test-500 Evaluacion: no confirmada Publicacion: 22/01/2025 Verificacion: 18/09/2026 |
DeepSeek-R1 paper Ver fuente |
| Matematica MATH |
GPT-4o | 76,6 % accuracy · unidad % |
Benchmark: full-5000 Evaluacion: no confirmada Publicacion: 13/05/2024 Verificacion: 18/09/2026 |
OpenAI (Hello GPT-4o) Ver fuente |
| Multimodal MMMU |
GPT-4o | 69,1 % accuracy · unidad % |
Benchmark: val-11550 Evaluacion: no confirmada Publicacion: 13/05/2024 Verificacion: 18/09/2026 |
OpenAI (Hello GPT-4o) Ver fuente |
| Programacion HumanEval |
GPT-4o | 90,2 % pass@1 · unidad % |
Benchmark: v1.0.0 Evaluacion: no confirmada Publicacion: 13/05/2024 Verificacion: 18/09/2026 |
OpenAI (Hello GPT-4o) Ver fuente |
| Programacion SWE-bench Verified |
Claude Opus 4 | 72,5 % % tareas resueltas · unidad % |
Benchmark: Verified-500 Evaluacion: no confirmada Publicacion: 22/05/2025 Verificacion: 18/09/2026 |
Anthropic (anuncio Claude 4) Ver fuente |
| Programacion SWE-bench Verified |
DeepSeek R1 | 49,2 % % tareas resueltas · unidad % |
Benchmark: Verified-500 Evaluacion: no confirmada Publicacion: 22/01/2025 Verificacion: 18/09/2026 |
DeepSeek-R1 paper Ver fuente |
| Programacion SWE-bench Verified |
GPT-4o | 33,2 % % tareas resueltas · unidad % |
Benchmark: Verified-500 Evaluacion: no confirmada Publicacion: no confirmada Verificacion: 18/09/2026 |
Leaderboard oficial SWE-bench (vista Bash Only) Ver fuente |
| Programacion SWE-bench Verified |
GPT-5 | 74,9 % % tareas resueltas · unidad % |
Benchmark: Verified-500 Evaluacion: no confirmada Publicacion: 07/08/2025 Verificacion: 18/09/2026 |
OpenAI (anuncio GPT-5) Ver fuente |
| Razonamiento MMLU-Pro |
Llama 4 | 80,5 % accuracy · unidad % |
Benchmark: v1 Evaluacion: no confirmada Publicacion: 05/04/2025 Verificacion: 18/09/2026 |
Meta (anuncio Llama 4) Ver fuente |
Que puede y que no puede concluirse
Una medicion aislada es un resultado disponible. Dos mediciones comparables muestran un cambio observado, no una tendencia sostenida. Solo tres o mas puntos comparables habilitan una serie temporal. Un cambio de catalogo o una noticia son contexto separado y no prueban una mejora.