wlls / ia / rag-em-producao
ia

RAG em produção: 5 erros que custam caro

wander·14 de set.·1 min de leitura

RAG funciona bem em demo e falha em produção por motivos previsíveis. Cinco erros que aparecem repetidamente:

1. Chunking sem contexto

Cortar documentos em pedaços fixos de 500 tokens ignora limites semânticos — um chunk pode começar no meio de uma tabela e perder o cabeçalho que dava sentido a ela.

2. Sem reranking

Buscar por similaridade de embedding e enviar os top-k direto pro modelo, sem um passo de reranking, deixa passar resultados relevantes só porque não são os mais parecidos textualmente.

3. Índice nunca reavaliado

Documentos mudam; o índice vetorial raramente é invalidado quando isso acontece, servindo respostas desatualizadas com confiança.

4. Sem monitoramento de recall

Sem medir se o contexto recuperado realmente contém a resposta, degradação de qualidade passa despercebida até o usuário reclamar.

5. Prompt genérico demais

Um prompt de sistema que não instrui o modelo a admitir quando o contexto não tem a resposta gera alucinação disfarçada de resposta segura.

#rag#llm#vector-db