Evaluaciones y Benchmarks IA
Observatorio de rendimiento de modelos de Inteligencia Artificial: qué mide cada prueba, qué modelos tienen resultados verificados, con qué metodología y cuándo. Evidencia + metodología + contexto + trazabilidad. No publicamos puntajes generales ni rankings definitivos.
Metodología
Cómo recopilamos resultados, qué significa que dos resultados sean comparables y cómo tratamos datos faltantes, modelos retirados y resultados del proveedor.
Pruebas SitioDeRubros
Evaluaciones reproducibles propias, versionadas. Sin la autoridad de un benchmark académico; sin resultados inventados.
Benchmarks documentados
GPQA Diamond
ConocimientoMide conocimiento cientifico de nivel posgrado: 198 preguntas multiple-choice de biologia, fisica y quimica validadas por expertos.
Métrica: accuracy · Versión: diamond-198 · Rein et al. (NYU/Anthropic)
MMLU
ConocimientoMide conocimiento multitarea: preguntas multiple-choice de 57 materias (STEM, humanidades, sociales, profesionales).
Métrica: accuracy · Versión: original-57 · CAIS / UC Berkeley (Hendrycks et al.)
RULER
Contexto largoMide uso efectivo de contexto largo: recuperacion, rastreo multi-salto, agregacion y QA sobre contextos de hasta cientos de miles de tokens.
Métrica: accuracy promedio · Versión: v1 · NVIDIA et al.
Global-MMLU
IdiomaMide conocimiento multitarea en 42 idiomas (incluye espanol): traduccion culturalmente adaptada de MMLU con revision humana.
Métrica: accuracy · Versión: v1 · Singh et al.
AIME
MatematicaMide razonamiento matematico olimpico: problemas del American Invitational Mathematics Examination (respuesta entera 0-999).
Métrica: accuracy · Versión: multi-anual · MAA (Mathematical Association of America)
GSM8K
MatematicaMide resolucion de problemas matematicos de escuela primaria: 1319 problemas con respuesta numerica exacta.
Métrica: exact match · Versión: original-1319 · OpenAI
Resultados verificados recientemente
| Benchmark | Modelo | Resultado | Verificado |
|---|---|---|---|
| MMMU | GPT-4o | 69,1 % | 18/09/2026 |
| GPQA Diamond | GPT-5 | 88,4 % | 18/09/2026 |
| GPQA Diamond | Claude Opus 4 | 83,3 % | 18/09/2026 |
| GPQA Diamond | Gemini 2.5 Pro | 84,0 % | 18/09/2026 |
| GPQA Diamond | DeepSeek R1 | 71,5 % | 18/09/2026 |
Qué no vas a encontrar aquí
No hay "AI Score", ni "mejor IA", ni top 10 definitivo. Cada tabla se ordena por una medición específica compatible (mismo benchmark, versión y métrica) y el encabezado explica qué se mide. El costo y la velocidad son dimensiones separadas, no parte de un puntaje.