Metodología del observatorio
Cómo recopilamos resultados, qué significa "comparable" y cómo tratamos lo que no sabemos. Si un dato no puede responderse, se muestra como desconocido: nunca se inventa.
Cómo recopilamos resultados
Partimos del sitio o repositorio oficial del benchmark, su paper original o su leaderboard oficial. En segundo lugar, documentación técnica del proveedor u organización responsable. Las fuentes secundarias solo se usan cuando son necesarias y se documentan como tales.
Cómo verificamos versiones
Cada resultado registra benchmark, versión del benchmark/dataset, métrica, unidad y fecha de verificación. Los benchmarks cambian (ej. distintas versiones de un harness): dos resultados con versiones distintas no se presentan como comparación directa.
Qué significa comparable
- ✓ Comparable: mismo benchmark, versión, dataset, métrica, unidad y modalidad relevante.
- ! Comparable con advertencias: coinciden en lo esencial pero hay diferencias parciales (ej. configuración few-shot distinta o herramientas desconocidas).
- ✕ No comparable: distinta versión, métrica, unidad o modalidad de herramientas explícitamente distinta (incluye pass@1 vs pass@10).
- ? Información insuficiente: faltan metadatos para decidir.
Cuando dos resultados no son comparables, la página explica por qué (versión diferente, few-shot diferente, herramientas, documentación insuficiente).
Cómo tratamos datos faltantes
Los campos desconocidos (temperature, herramientas, reasoning effort) se muestran como "desconocido". Un resultado parcial sigue siendo válido, pero puede afectar su comparabilidad. La ausencia de un resultado es preferible a un resultado incorrectamente atribuido.
Cómo tratamos modelos retirados
Los resultados históricos no se eliminan: se etiquetan como históricos y conservan su trazabilidad. Los resultados nunca se transfieren automáticamente a un modelo sucesor.
Cómo tratamos resultados del proveedor
Un proveedor puede publicar resultados legítimos sobre su propio modelo: no se descartan, pero se etiquetan como "informados por el proveedor". Cuando existe un resultado independiente comparable, se muestra por separado. Proveedor no significa incorrecto; independiente no significa correcto.
Cómo se realizan pruebas propias
Las pruebas SitioDeRubros son evaluaciones reproducibles versionadas (ej. SDR-CODE-001 v1). Un cambio de prompt, dataset o criterio que afecte la comparabilidad genera una nueva versión. No tienen la autoridad de un benchmark académico. Solo se publican resultados de ejecuciones reales documentadas.
Frescura y correcciones
Cada resultado muestra su fecha de verificación. Estados editoriales: Actual (verificación reciente), Revisar (conviene revisar la fuente) y Antiguo (consultar la fuente original). Los errores se corrigen documentando la corrección, sin borrar silenciosamente el valor anterior.