01
Deriva não é queda: por que o painel verde engana
A observabilidade tradicional foi construída para detectar indisponibilidade e erro, e faz isso bem. Latência, taxa de erro HTTP, throughput e saturação capturam qualquer coisa que quebre de forma binária. O problema é que qualidade de resposta não é binária e não gera exceção. Um bot que passou a responder de forma vaga, que parou de citar a fonte, que ficou mais propenso a inventar um prazo de entrega ou que começou a escalar para humano casos que resolvia sozinho não produz um único erro. Ele produz respostas duzentas, bem formadas, dentro do tempo, e piores. Nenhum dos quatro sinais clássicos se move, e é por isso que a operação inteira pode degradar por semanas com o painel intacto.
Vale separar três causas que produzem o mesmo sintoma, porque a resposta a cada uma é diferente. A primeira é deriva do modelo: o provedor atualizou o ponto de acesso, ou você trocou de versão, e o comportamento mudou nas bordas que o seu prompt nunca especificou. A segunda é deriva do conhecimento: a base de RAG envelheceu, a política mudou e o documento não, e o bot passou a responder com confiança algo que deixou de ser verdade. A terceira é deriva de entrada: o perfil das perguntas mudou porque entrou uma campanha nova, um canal novo ou uma safra de clientes com outro vocabulário, e o sistema continua igual enquanto o mundo ao redor mudou. Confundir as três leva a ajustar o prompt quando o problema estava na base, que é o retrabalho mais comum nesse tipo de investigação.
| Causa da deriva | Sinal que se move primeiro | O que corrige |
|---|---|---|
| Modelo mudou de versão ou comportamento | Distribuição de formato e tamanho da resposta | Gate de paridade e ajuste cirúrgico do prompt |
| Base de conhecimento envelheceu | Queda na taxa de resposta com citação válida | Reindexação e curadoria do corpus, não o prompt |
| Perfil das perguntas mudou | Aumento de intenções fora do catálogo conhecido | Ampliar cobertura, criar intenção nova ou rota de escalonamento |
| Prompt alterado sem avaliação | Ruptura brusca no dia exato da alteração | Rollback da versão e gate de eval antes do rollout |
| Contexto recuperado piorou | Queda de relevância no top-k antes da queda de resposta | Ajuste de retrieval e reranking, sem tocar no modelo |