01
Por que o eval manual não escala
O eval manual tem três problemas que só aparecem quando o bot já está em produção. Primeiro, ele não é reproduzível: duas pessoas avaliam a mesma resposta de formas diferentes, e a mesma pessoa avalia diferente em dias diferentes. Segundo, ele não cobre regressão: você testa as perguntas que lembrou na hora, nunca as cem que já funcionavam e podem ter quebrado. Terceiro, ele não tem gate: a mudança sobe porque pareceu boa, não porque passou num critério.
O objetivo do eval contínuo não é eliminar o julgamento humano, é ancorá-lo. Você escreve o critério uma vez, na forma de casos e rubrica, e a partir daí a máquina aplica esse mesmo critério em toda mudança. O humano volta a entrar só quando o resultado é ambíguo ou quando o dataset precisa crescer. É a diferença entre "achei que ficou bom" e "passou em 94 dos 100 casos, contra 96 na versão anterior, então a mudança regrediu".