AIME Matematica EXTERNO · OTRA
MAA (Mathematical Association of America) · Versión: multi-anual · Métrica: accuracy
Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor
Qué mide
Mide razonamiento matematico olimpico: problemas del American Invitational Mathematics Examination (respuesta entera 0-999).
Dataset: 30 problemas por edicion anual.
Qué NO mide
No mide demostraciones ni matematica universitaria general. Solo 30 problemas por anio: alta varianza.
Metodología
Accuracy sobre 30 problemas. Cada edicion anual es un dataset distinto: AIME 2024 vs AIME 2025 no son directamente comparables.
- 2024 · dataset AIME-2024-30 · Edicion 2024: 30 problemas. Dataset distinto al de 2025.
- 2025 · dataset AIME-2025-30 · Edicion 2025: 30 problemas. Dataset distinto al de 2024.
Cómo interpretar el número
Proporcion de problemas resueltos de la edicion. Mayor suele ser mejor dentro de la misma edicion.
Limitaciones
Muestra pequena (30): una diferencia de 1 problema son 3.3 puntos. Posible contaminacion en ediciones antiguas (ver MathArena, NeurIPS 2025).
Resultados disponibles (2)
Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.
| Modelo | Resultado (accuracy) | Fecha | Versión / Configuración | Fuente |
|---|---|---|---|---|
| GPT-5 PROVEEDOR | 94,6 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: 2025 Herramientas: desconocido · Web: desconocido |
OpenAI (anuncio GPT-5)
Ver fuente Edicion AIME 2025 (30 problemas, sin herramientas). No comparable directamente con AIME 2024: distinto dataset. |
| DeepSeek R1 PROVEEDOR | 79,8 % | Eval.: desconocida Verif.: 18/09/2026 |
Versión: 2024 Herramientas: desconocido · Web: desconocido |
DeepSeek-R1 paper
Ver fuente Edicion AIME 2024 (30 problemas). Muestra pequena: alta varianza. |