Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

Evaluaciones y Benchmarks IA

Observatorio de rendimiento de modelos de Inteligencia Artificial: qué mide cada prueba, qué modelos tienen resultados verificados, con qué metodología y cuándo. Evidencia + metodología + contexto + trazabilidad. No publicamos puntajes generales ni rankings definitivos.

12

benchmarks documentados

Explorar benchmarks

6

modelos con resultados registrados

Explorar modelos evaluados

18

resultados con fuente y verificación

Comparar resultados

Metodología

Cómo recopilamos resultados, qué significa que dos resultados sean comparables y cómo tratamos datos faltantes, modelos retirados y resultados del proveedor.

Leer metodología

Pruebas SitioDeRubros

Evaluaciones reproducibles propias, versionadas. Sin la autoridad de un benchmark académico; sin resultados inventados.

Ver pruebas propias

Benchmarks documentados

GPQA Diamond

Conocimiento

Mide conocimiento cientifico de nivel posgrado: 198 preguntas multiple-choice de biologia, fisica y quimica validadas por expertos.

Métrica: accuracy · Versión: diamond-198 · Rein et al. (NYU/Anthropic)

MMLU

Conocimiento

Mide conocimiento multitarea: preguntas multiple-choice de 57 materias (STEM, humanidades, sociales, profesionales).

Métrica: accuracy · Versión: original-57 · CAIS / UC Berkeley (Hendrycks et al.)

RULER

Contexto largo

Mide uso efectivo de contexto largo: recuperacion, rastreo multi-salto, agregacion y QA sobre contextos de hasta cientos de miles de tokens.

Métrica: accuracy promedio · Versión: v1 · NVIDIA et al.

Global-MMLU

Idioma

Mide conocimiento multitarea en 42 idiomas (incluye espanol): traduccion culturalmente adaptada de MMLU con revision humana.

Métrica: accuracy · Versión: v1 · Singh et al.

AIME

Matematica

Mide razonamiento matematico olimpico: problemas del American Invitational Mathematics Examination (respuesta entera 0-999).

Métrica: accuracy · Versión: multi-anual · MAA (Mathematical Association of America)

GSM8K

Matematica

Mide resolucion de problemas matematicos de escuela primaria: 1319 problemas con respuesta numerica exacta.

Métrica: exact match · Versión: original-1319 · OpenAI

Resultados verificados recientemente

Resultados verificados recientemente, por benchmark y modelo
BenchmarkModeloResultadoVerificado
MMMU GPT-4o 69,1 % 18/09/2026
GPQA Diamond GPT-5 88,4 % 18/09/2026
GPQA Diamond Claude Opus 4 83,3 % 18/09/2026
GPQA Diamond Gemini 2.5 Pro 84,0 % 18/09/2026
GPQA Diamond DeepSeek R1 71,5 % 18/09/2026
Qué no vas a encontrar aquí

No hay "AI Score", ni "mejor IA", ni top 10 definitivo. Cada tabla se ordena por una medición específica compatible (mismo benchmark, versión y métrica) y el encabezado explica qué se mide. El costo y la velocidad son dimensiones separadas, no parte de un puntaje.

Pruebas SitioDeRubros