Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

Global-MMLU Idioma EXTERNO · ACADEMICA

Singh et al. · Versión: v1 · Métrica: accuracy

Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor

Qué mide

Mide conocimiento multitarea en 42 idiomas (incluye espanol): traduccion culturalmente adaptada de MMLU con revision humana.

Dataset: Subconjuntos por idioma (entre ellos espanol) con adaptacion cultural.

Qué NO mide

No equivale a evaluar redaccion, regionalismos o instrucciones en espanol: es conocimiento multiple-choice traducido.

Metodología

Accuracy por idioma. No asumir equivalencia entre idiomas: comparar solo dentro del mismo subconjunto.

  • v1 · dataset 42-languages · Sin resultados cargados todavia: comparar solo dentro del mismo idioma.

Cómo interpretar el número

Proporcion de respuestas correctas en cada idioma. Mayor suele ser mejor dentro del mismo idioma.

Limitaciones

Traducir un benchmark ingles no equivale a una prueba disenada en espanol.

Resultados disponibles (0)

Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.

Benchmark documentado, resultados pendientes de carga verificada. La ausencia de resultados es preferible a resultados sin trazabilidad.