MATH Matematica EXTERNO · ACADEMICA
UC Berkeley (Hendrycks et al.) · Versión: full-5000 · Métrica: accuracy
Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor
Qué mide
Mide resolucion de problemas matematicos de competencia: 5000 problemas en 6 areas con respuesta verificable por reglas.
Dataset: 5000 problemas (entrenamiento/test); el subconjunto MATH-500 se usa para evaluacion rapida.
Qué NO mide
No mide demostraciones formales ni investigacion matematica.
Metodología
Accuracy de respuesta final con verificacion por reglas. MATH-500 es subconjunto: no mezclar con el full sin indicarlo.
- full-5000 · dataset full · Conjunto completo.
- test-500 · dataset MATH-500 · Subconjunto de 500 para evaluacion rapida (ej. DeepSeek-R1). No mezclar con full.
Cómo interpretar el número
Proporcion de respuestas correctas. Mayor suele ser mejor.
Limitaciones
Distinguir full vs MATH-500 al comparar.
Resultados disponibles (2)
Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.
| Modelo | Resultado (accuracy) | Fecha | Versión / Configuración | Fuente |
|---|---|---|---|---|
| DeepSeek R1 PROVEEDOR | 97,3 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: test-500 Herramientas: desconocido · Web: desconocido |
DeepSeek-R1 paper
Ver fuente Subconjunto MATH-500: no comparable directamente con resultados sobre el conjunto completo. |
| GPT-4o PROVEEDOR | 76,6 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: full-5000 Herramientas: desconocido · Web: desconocido |
OpenAI (Hello GPT-4o)
Ver fuente Resultado informado por el proveedor sobre el conjunto completo. |