Actualidad: ver ahora
Cotizaciones: dolar oficial / blue

Cómo realizar una prueba de IA

Una ejecución reproducible permite entender qué se probó, con qué entrada, bajo qué condiciones, qué se esperaba y cómo se evaluó.

Preparación

Elegí una metodología y una versión. No mezcles casos, prompts, datasets, métricas o unidades de versiones diferentes.

Modelo y herramienta

Registrá proveedor, modelo, API model ID, snapshot y versión cuando estén disponibles. Indicá si usaste API, interfaz web, CLI o un modelo local. Para modelos locales anotá cuantización, runtime, versión y hardware relevante.

Configuración y ejecución

Congelá los casos y usá los prompts definidos. Registrá temperatura y demás parámetros sin imponer valores universales. Para respuestas aisladas, empezá una sesión nueva por caso cuando la metodología lo indique. Fijá o aleatorizá de forma reproducible el orden si puede influir.

Evidencia y evaluación

Conservá la salida original, no sólo la puntuación. Aplicá la rúbrica definida antes de mirar los resultados y documentá la revisión humana cuando la evaluación sea subjetiva.

Resultado y comparabilidad

Registrá métricas, unidad, fecha, entorno y limitaciones. Si cambió la metodología, versión, prompt, dataset, métrica o unidad, no presentes automáticamente la ejecución como la misma serie.

Ejemplo ficticio: una prueba de clasificación de 20 textos usa el mismo prompt y dataset para cada modelo, temperatura 0 cuando el proveedor la admite, una rúbrica fijada previamente y conserva la respuesta completa junto con el modelo exacto y la fecha.

Volver al Laboratorio