RULER Contexto largo EXTERNO · ACADEMICA
NVIDIA et al. · Versión: v1 · Métrica: accuracy promedio
Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor
Qué mide
Mide uso efectivo de contexto largo: recuperacion, rastreo multi-salto, agregacion y QA sobre contextos de hasta cientos de miles de tokens.
Dataset: 13 tareas sinteticas y reales a 8 longitudes (4K-128K+).
Qué NO mide
No mide solo si el texto entra en la ventana: separa capacidad de recuperacion/comprension.
Metodología
Promedio ponderado por longitud. Comparar solo a igual longitud: el rendimiento cae con el contexto.
- v1 · dataset 13-tasks · Sin resultados cargados todavia: comparar solo a igual longitud.
Cómo interpretar el número
Rendimiento promedio usando contexto largo. Mayor suele ser mejor a igual longitud.
Limitaciones
Sintetico en parte: needle-in-haystack no equivale a uso real de documentos largos.
Resultados disponibles (0)
Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.
Benchmark documentado, resultados pendientes de carga verificada. La ausencia de resultados es preferible a resultados sin trazabilidad.