Evolucion disponible
Version: original-57 · Metrica: accuracy · Unidad: %
Resultado disponible; no hay evolución demostrada.
Mediciones de GPT-4o en MMLU
| Fecha de evaluacion/publicacion | Resultado | Fecha de evaluacion | Fecha de publicacion | Fuente |
| 13/05/2024 | 88,7 % | No confirmado | 13/05/2024 | OpenAI (Hello GPT-4o) Ver fuente |
Version: diamond-198 · Metrica: accuracy · Unidad: %
Resultado disponible; no hay evolución demostrada.
Mediciones de GPT-4o en GPQA Diamond
| Fecha de evaluacion/publicacion | Resultado | Fecha de evaluacion | Fecha de publicacion | Fuente |
| 13/05/2024 | 53,6 % | No confirmado | 13/05/2024 | OpenAI (Hello GPT-4o) Ver fuente |
Version: diamond-198 · Metrica: accuracy · Unidad: %
Resultado disponible; no hay evolución demostrada.
Mediciones de Claude Opus 4 en GPQA Diamond
| Fecha de evaluacion/publicacion | Resultado | Fecha de evaluacion | Fecha de publicacion | Fuente |
| 22/05/2025 | 83,3 % | No confirmado | 22/05/2025 | Anthropic (anuncio Claude 4) Ver fuente |
Version: diamond-198 · Metrica: accuracy · Unidad: %
Resultado disponible; no hay evolución demostrada.
Mediciones de Gemini 2.5 Pro en GPQA Diamond
| Fecha de evaluacion/publicacion | Resultado | Fecha de evaluacion | Fecha de publicacion | Fuente |
| 25/03/2025 | 84,0 % | No confirmado | 25/03/2025 | Google (anuncio Gemini 2.5 Pro) Ver fuente |
Version: original-57 · Metrica: accuracy · Unidad: %
Resultado disponible; no hay evolución demostrada.
Mediciones de DeepSeek R1 en MMLU
| Fecha de evaluacion/publicacion | Resultado | Fecha de evaluacion | Fecha de publicacion | Fuente |
| 22/01/2025 | 90,8 % | No confirmado | 22/01/2025 | DeepSeek-R1 paper Ver fuente |
Version: diamond-198 · Metrica: accuracy · Unidad: %
Resultado disponible; no hay evolución demostrada.
Mediciones de DeepSeek R1 en GPQA Diamond
| Fecha de evaluacion/publicacion | Resultado | Fecha de evaluacion | Fecha de publicacion | Fuente |
| 22/01/2025 | 71,5 % | No confirmado | 22/01/2025 | DeepSeek-R1 paper Ver fuente |
Version: diamond-198 · Metrica: accuracy · Unidad: %
Resultado disponible; no hay evolución demostrada.
Mediciones de GPT-5 en GPQA Diamond
| Fecha de evaluacion/publicacion | Resultado | Fecha de evaluacion | Fecha de publicacion | Fuente |
| 07/08/2025 | 88,4 % | No confirmado | 07/08/2025 | OpenAI (anuncio GPT-5) Ver fuente |
Limitaciones
La ausencia de puntos comparables no significa ausencia de capacidad. Benchmarks, versiones, metricas, unidades, harnesses y condiciones diferentes deben mantenerse separados. Alias, snapshots, modelo logico y familia tampoco se sustituyen entre si.