Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

RULER Contexto largo EXTERNO · ACADEMICA

NVIDIA et al. · Versión: v1 · Métrica: accuracy promedio

Última verificación: 18/09/2026 · Dirección: mayor suele ser mejor

Qué mide

Mide uso efectivo de contexto largo: recuperacion, rastreo multi-salto, agregacion y QA sobre contextos de hasta cientos de miles de tokens.

Dataset: 13 tareas sinteticas y reales a 8 longitudes (4K-128K+).

Qué NO mide

No mide solo si el texto entra en la ventana: separa capacidad de recuperacion/comprension.

Metodología

Promedio ponderado por longitud. Comparar solo a igual longitud: el rendimiento cae con el contexto.

  • v1 · dataset 13-tasks · Sin resultados cargados todavia: comparar solo a igual longitud.

Cómo interpretar el número

Rendimiento promedio usando contexto largo. Mayor suele ser mejor a igual longitud.

Limitaciones

Sintetico en parte: needle-in-haystack no equivale a uso real de documentos largos.

Resultados disponibles (0)

Ordenado de mayor a menor: en esta métrica, mayor suele ser mejor. Esto ordena por esta medición específica; no es un ranking general del modelo.

Benchmark documentado, resultados pendientes de carga verificada. La ausencia de resultados es preferible a resultados sin trazabilidad.