Parámetros de generación
Qué controla cada parámetro y cuándo puede aplicar. No todos los proveedores exponen los mismos; los modelos de razonamiento pueden tener controles distintos.
temperature — más determinismo ↔ más variabilidad
Controla el azar del muestreo. Valores bajos concentran la probabilidad (respuestas más estables); altos la dispersan (más variabilidad).
Valor conceptual: 0.70 → equilibrio a evaluar por tarea
top_p
Muestreo por nĂşcleo: considera el conjunto mĂnimo de tokens que acumula probabilidad P. Recorta la "cola larga" sin fijar un top-K rĂgido. Algunos proveedores lo exponen; otros lo restringen o lo ignoran segĂşn el modelo.
top_k
Limita el muestreo a los K tokens más probables. Útil en runtimes locales (llama.cpp/Ollama); muchas APIs comerciales no lo exponen.
max output
Tope de tokens de respuesta. Reservarlo en el presupuesto de contexto evita truncados. No todos los modelos respetan lĂmites finos.
seed
Semilla para reproducibilidad aproximada. No garantiza respuestas idénticas entre versiones del modelo o hardware.
repeat penalty
Penaliza repeticiones (runtimes locales). En APIs suele aparecer como frequency/presence penalty con otra escala. Ajustarlo sin medir puede degradar listas y cĂłdigo legĂtimamente repetitivo.