Medir, no adivinar.
Cada cambio de modelo pasa por un banco de evaluación. Dos modelos responden las mismas conversaciones, un juez LLM elige la mejor respuesta con el orden invertido para anular su sesgo, y un candidato solo sale a producción si supera los umbrales de tasa de victorias y de formato. Cada corrida reporta cuánto costó.
Elegí un banco de evaluación en vez de ajustar prompts a ojo