Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

MATH Matematica EXTERNO · ACADEMICA

UC Berkeley (Hendrycks et al.) · Versión: full-5000 · Métrica: accuracy

Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor

Qué mide

Mide resolucion de problemas matematicos de competencia: 5000 problemas en 6 areas con respuesta verificable por reglas.

Dataset: 5000 problemas (entrenamiento/test); el subconjunto MATH-500 se usa para evaluacion rapida.

Qué NO mide

No mide demostraciones formales ni investigacion matematica.

Metodología

Accuracy de respuesta final con verificacion por reglas. MATH-500 es subconjunto: no mezclar con el full sin indicarlo.

  • full-5000 · dataset full · Conjunto completo.
  • test-500 · dataset MATH-500 · Subconjunto de 500 para evaluacion rapida (ej. DeepSeek-R1). No mezclar con full.

Cómo interpretar el número

Proporcion de respuestas correctas. Mayor suele ser mejor.

Limitaciones

Distinguir full vs MATH-500 al comparar.

Resultados disponibles (2)

Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.

Resultados de MATH por modelo, con fuente y configuración
Modelo Resultado (accuracy) Fecha Versión / Configuración Fuente
DeepSeek R1 PROVEEDOR 97,3 % Eval.: desconocida
Verif.: 18/09/2026
Versión: test-500
Herramientas: desconocido · Web: desconocido
DeepSeek-R1 paper
Ver fuente
Subconjunto MATH-500: no comparable directamente con resultados sobre el conjunto completo.
GPT-4o PROVEEDOR 76,6 % Eval.: desconocida
Verif.: 18/09/2026
Versión: full-5000
Herramientas: desconocido · Web: desconocido
OpenAI (Hello GPT-4o)
Ver fuente
Resultado informado por el proveedor sobre el conjunto completo.