RAG em produção: 5 erros que custam caro
RAG funciona bem em demo e falha em produção por motivos previsíveis. Cinco erros que aparecem repetidamente:
1. Chunking sem contexto
Cortar documentos em pedaços fixos de 500 tokens ignora limites semânticos — um chunk pode começar no meio de uma tabela e perder o cabeçalho que dava sentido a ela.
2. Sem reranking
Buscar por similaridade de embedding e enviar os top-k direto pro modelo, sem um passo de reranking, deixa passar resultados relevantes só porque não são os mais parecidos textualmente.
3. Índice nunca reavaliado
Documentos mudam; o índice vetorial raramente é invalidado quando isso acontece, servindo respostas desatualizadas com confiança.
4. Sem monitoramento de recall
Sem medir se o contexto recuperado realmente contém a resposta, degradação de qualidade passa despercebida até o usuário reclamar.
5. Prompt genérico demais
Um prompt de sistema que não instrui o modelo a admitir quando o contexto não tem a resposta gera alucinação disfarçada de resposta segura.