Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

Metodología del observatorio

Cómo recopilamos resultados, qué significa "comparable" y cómo tratamos lo que no sabemos. Si un dato no puede responderse, se muestra como desconocido: nunca se inventa.

Cómo recopilamos resultados

Partimos del sitio o repositorio oficial del benchmark, su paper original o su leaderboard oficial. En segundo lugar, documentación técnica del proveedor u organización responsable. Las fuentes secundarias solo se usan cuando son necesarias y se documentan como tales.

Cómo verificamos versiones

Cada resultado registra benchmark, versión del benchmark/dataset, métrica, unidad y fecha de verificación. Los benchmarks cambian (ej. distintas versiones de un harness): dos resultados con versiones distintas no se presentan como comparación directa.

Qué significa comparable

Cuando dos resultados no son comparables, la página explica por qué (versión diferente, few-shot diferente, herramientas, documentación insuficiente).

Cómo tratamos datos faltantes

Los campos desconocidos (temperature, herramientas, reasoning effort) se muestran como "desconocido". Un resultado parcial sigue siendo válido, pero puede afectar su comparabilidad. La ausencia de un resultado es preferible a un resultado incorrectamente atribuido.

Cómo tratamos modelos retirados

Los resultados históricos no se eliminan: se etiquetan como históricos y conservan su trazabilidad. Los resultados nunca se transfieren automáticamente a un modelo sucesor.

Cómo tratamos resultados del proveedor

Un proveedor puede publicar resultados legítimos sobre su propio modelo: no se descartan, pero se etiquetan como "informados por el proveedor". Cuando existe un resultado independiente comparable, se muestra por separado. Proveedor no significa incorrecto; independiente no significa correcto.

Cómo se realizan pruebas propias

Las pruebas SitioDeRubros son evaluaciones reproducibles versionadas (ej. SDR-CODE-001 v1). Un cambio de prompt, dataset o criterio que afecte la comparabilidad genera una nueva versión. No tienen la autoridad de un benchmark académico. Solo se publican resultados de ejecuciones reales documentadas.

Frescura y correcciones

Cada resultado muestra su fecha de verificación. Estados editoriales: Actual (verificación reciente), Revisar (conviene revisar la fuente) y Antiguo (consultar la fuente original). Los errores se corrigen documentando la corrección, sin borrar silenciosamente el valor anterior.