Segurança em RAG: Protegendo Dados Privados na Base de Conhecimento com IA
Como construir uma arquitetura RAG corporativa com controle de acesso, dados privados e boas práticas de segurança que ajudam a apoiar a conformidade com a LGPD, sem expor informações sensíveis a terceiros.
Construir uma base de conhecimento com RAG é a parte técnica mais simples do projeto. A parte complexa, onde muitos projetos falham, é reduzir ao máximo o risco de dados sensíveis da empresa vazarem para terceiros, manter o acesso auditável e alinhar a arquitetura com os requisitos da LGPD.
Os três vetores de risco numa implementação RAG
1. Armazenamento do banco vetorial na nuvem pública
Serviços SaaS de RAG convenientes (como alguns oferecidos diretamente pelas provedoras de LLM, as empresas que desenvolvem os modelos de IA) armazenam os vetores e, em alguns casos, os documentos originais nos servidores delas. Isso significa que contratos, manuais e dados financeiros da empresa ficam fora do seu controle. Podem ser usados para treinar modelos futuros conforme os termos de serviço.
2. Ausência de controle de acesso na consulta
Uma base RAG sem controle de acesso granular permite que qualquer usuário recupere qualquer documento, incluindo informações confidenciais de RH, dados de clientes ou contratos sigilosos. O controle de acesso precisa estar implementado tanto no nível de indexação quanto no nível de consulta.
3. Logs de consulta não auditados
Sem rastreabilidade das consultas, é impossível saber quem perguntou o quê, qual documento foi recuperado e qual resposta foi gerada. Em caso de vazamento ou uso indevido, a investigação não tem dados para trabalhar.
Arquitetura RAG privada e segura: os componentes essenciais
- Banco vetorial privado (pgvector, Weaviate ou Pinecone em ambiente dedicado), sem armazenamento em SaaS compartilhado
- Controle de acesso baseado em papéis (RBAC): cada usuário acessa apenas os documentos autorizados
- Criptografia em repouso e em trânsito para todos os vetores e documentos
- Logs imutáveis de cada consulta, documento recuperado e resposta gerada
- Política de retenção de dados definida: documentos desatualizados são removidos do índice
- Auditoria periódica de acesso, como parte do alinhamento com a LGPD
LGPD e RAG: dados pessoais indexados (cadastros de clientes, dados de colaboradores) são tratados como dados pessoais pela LGPD mesmo em formato vetorial. É necessário mapear onde esses dados estão, documentar a base legal do tratamento e garantir o direito de exclusão dos titulares — o ideal é fazer esse mapeamento com apoio jurídico, não só técnico.
Proteções técnicas da camada web
A interface web que os colaboradores usam para consultar a base RAG também precisa de proteções sérias: políticas que limitam de onde o navegador pode carregar conteúdo (Content Security Policy), conexão sempre criptografada e forçada (HSTS), autenticação em duas etapas (MFA) e sessões que expiram sozinhas depois de um tempo sem uso. São as mesmas práticas usadas no site institucional da NerdPraJá, avaliado com nota A+ no SecurityHeaders.
Conclusão
RAG mais seguro não é apenas indexar documentos numa base vetorial. É projetar cada camada da arquitetura pensando em segurança, privacidade e auditabilidade desde o início, não como algo adicionado depois. Ainda assim, nenhuma arquitetura garante conformidade com a LGPD por si só — ela reduz riscos técnicos, mas precisa vir acompanhada de processos internos e, quando o caso exigir, orientação jurídica.
Se a sua empresa está avaliando construir uma base de conhecimento com dados internos, vale conversar sobre os requisitos de segurança do seu caso específico. Conheça a frente de Sistemas e IA da NerdPraJá.
