AI Solutions · Aprofundamento
Base de conhecimento RAG: respostas ancoradas nas fontes, nunca inventadas
Construímos bases de conhecimento que respondem apenas a partir de fontes verificadas: recuperação híbrida, ancoragem nos documentos, citações rastreáveis, controlo de alucinações e avaliação contínua da qualidade das respostas. Quando a fonte não basta, o sistema declara-o em vez de inventar.
BASE DE CONHECIMENTO · RECUPERAÇÃO FUNDAMENTADA
Entra · Pergunta do utilizador
Sai · Resposta citada e verificável
Ingestão da fonte de verdade e chunking
Normaliza os documentos de origem e divide-os em fragmentos coerentes dimensionados por tipo de conteúdo, anexando a cada um metadados de origem — título, secção, data, permissões — que se tornam a base das citações e do controlo de acesso: sem uma ingestão limpa, tudo o que se segue cita o vazio.
Recuperação híbrida (palavra-chave + semântica)
Combina uma pesquisa por palavras-chave (BM25) que capta códigos de produto, nomes próprios e termos raros exatos com uma pesquisa semântica vetorial que capta reformulações e conceitos, fundindo os dois conjuntos de resultados por classificação (RRF) para recuperar o que nenhum dos dois encontraria sozinho.
Reranking sobre uma lista curta
Um reordenador cross-encoder reordena apenas a lista restrita estreita dos melhores candidatos avaliando pergunta e passagem em conjunto em vez de em separado, acrescentando uma etapa de precisão que se mantém precisa justamente porque trabalha sobre poucos fragmentos e não sobre o índice inteiro.
Geração fundamentada com citações
O modelo responde unicamente a partir do topo da lista restrita e cita a fonte de cada afirmação, para que cada frase fique rastreável até um documento, uma versão e uma secção em vez de afundar na memória de treino.
Verificação de fundamento e relevância / abstenção
Antes da entrega, um controlo de ancoragem e relevância compara a resposta com as passagens recuperadas: abaixo do limiar o sistema abstém-se, volta a recuperar ou passa a vez a uma pessoa, porque um honesto «não está nas fontes» vale mais do que uma invenção plausível.
Avaliação da qualidade da resposta e atualidade
Fidelidade, relevância do contexto, relevância da resposta, exatidão das citações e freshness do índice são medidas em contínuo, porque uma única pontuação esconde onde está o problema e uma base fiável tem de ser mantida honesta à medida que documentos e permissões mudam.
Os sinais de uma base de conhecimento que inventa
Um assistente que responde com segurança não vale nada se essa segurança não estiver ancorada a uma fonte. Estes são os sintomas que vemos antes de intervir.
- Seguro mas errado. O sistema afirma, em tom autoritário, coisas que não constam de nenhum documento interno: isso é ancoragem em falta, não uma gralha.
- Sem citações verificáveis. O utilizador não consegue rastrear uma frase até à sua fonte, por isso não pode confiar nela nem corrigi-la; cada resposta é uma caixa preta.
- Conteúdo obsoleto apresentado como atual. Uma política atualizada na semana passada ainda não está no índice, e o sistema continua a citar a versão antiga com a mesma segurança.
- Fugas de perímetro. Um utilizador recebe fragmentos de documentos que não teria o direito de ver no sistema de origem.
- Perguntas fora de âmbito sem travão. Quando as fontes não chegam, o modelo preenche o vazio inventando em vez de declarar que não sabe.
Para equipas que gerem documentação crítica, suporte, conformidade ou conhecimento interno e não podem dar-se ao luxo de uma resposta inventada perante um cliente ou um auditor.
Recuperar primeiro, gerar depois
Um modelo generativo deixado a si próprio prevê texto plausível. Uma base de conhecimento RAG inverte a ordem: recupera primeiro a evidência das suas fontes e depois obriga o modelo a responder apenas dentro dessa evidência.
Retrieval-Augmented Generation
Antes de responder, o sistema procura nos documentos as passagens relevantes e entrega-as ao modelo como contexto, com a instrução de responder apenas a partir daí. O modelo deixa de recorrer à memória de treino e recorre à sua fonte de referência.
Ancoragem ≠ correção
A ancoragem verifica que a resposta é fiel ao texto recuperado, não que é verdadeira em absoluto. Se a recuperação trouxer o fragmento errado, uma pontuação de ancoragem alta significa apenas que o modelo repetiu fielmente o errado — por isso recuperação e avaliação têm de ser tratadas como dois problemas distintos.
Fonte de verdade, não uma cópia
O índice não substitui os seus sistemas de origem; reflete-os. Quando um documento muda na origem, o índice tem de mudar com ele, ou a base de conhecimento mente com segurança sobre o que é verdade hoje.
Abster-se é uma funcionalidade, não um defeito
Uma base de conhecimento fiável sabe dizer «isto não está nas fontes». Uma abstenção honesta supera uma resposta inventada: o valor para a empresa está em não errar, não em responder sempre.
Da fonte à resposta citada
Cada camada restringe o que o modelo pode dizer. O pipeline não é um único modelo: é uma cadeia de controlos, cada um com uma tarefa mensurável.
Os documentos são normalizados e divididos em fragmentos coerentes, dimensionados por tipo de conteúdo: uma política segmenta-se de forma diferente de uma ficha técnica. Cada fragmento carrega metadados de origem — título, secção, data, permissões — que se tornam a base das citações e do controlo de acesso.
Uma pesquisa por palavras-chave (BM25) capta códigos de produto, nomes próprios e termos raros exatos; uma pesquisa semântica vetorial capta reformulações e conceitos. Os dois conjuntos de resultados são fundidos por classificação (RRF), recuperando o que nenhum dos dois encontraria sozinho.
Um reordenador cross-encoder ordena os poucos melhores candidatos avaliando pergunta e passagem em conjunto, não em separado. É uma segunda etapa de precisão que opera sobre uma lista restrita, não sobre o índice inteiro — por isso é preciso sem ser lento.
O modelo responde apenas a partir do topo da lista restrita e cita a fonte de cada afirmação. Antes da entrega, um controlo de ancoragem e relevância compara a resposta com as passagens: abaixo do limiar, o sistema abstém-se ou volta a recuperar em vez de publicar.
Da fonte à resposta citada em milissegundos, com cada afirmação rastreável até uma passagem.
As métricas que separam uma base fiável de uma plausível
Uma base de conhecimento avalia-se por dimensões separadas, porque uma única pontuação esconde onde está o problema. Estas são as alavancas que monitorizamos em contínuo.
| Dimensão | O que verifica | Porque importa |
|---|---|---|
| Faithfulness (fidelidade) | Cada afirmação da resposta é sustentada pelas passagens recuperadas | O travão direto às alucinações: sem fonte, sem afirmação |
| Relevância do contexto | As passagens recuperadas são efetivamente pertinentes à pergunta | Mede a recuperação: se for fraca, até uma resposta fiel é fiel ao errado |
| Relevância da resposta | A resposta aborda de facto a pergunta colocada, sem divagar | Distingue o pertinente do genericamente correto mas inútil |
| Exatidão das citações | Cada citação aponta para a passagem que de facto sustenta a frase | Torna a resposta verificável: o utilizador remonta à fonte e confere |
| Freshness | O índice reflete o estado atual dos documentos de origem | Um índice obsoleto produz respostas seguras mas erradas hoje |
Os controlos que mantemos ativos em produção
Construir o pipeline é metade do trabalho. A outra metade é mantê-lo honesto ao longo do tempo, à medida que documentos, permissões e perguntas mudam.
Controlo de acesso na recuperação
As permissões são um filtro sobre os metadados no momento da pesquisa: um documento que um utilizador não pode ver na origem nunca aparece nos resultados. O perímetro de segurança viaja com o dado.
Indexação incremental
Quando uma fonte muda, só se reprocessa o que mudou e o índice é atualizado com identificadores estáveis. Sem reconstruções totais, sem janelas em que a base responde a partir de versões antigas.
Limiares de abstenção
Abaixo do limiar de ancoragem ou de relevância, a resposta não sai: o sistema declara que não sabe, volta a recuperar ou passa a vez a uma pessoa. A regra de âmbito é explícita, não deixada ao acaso.
Proveniência e fonte de verdade
Cada resposta leva consigo a origem das suas afirmações — que documento, que versão, que secção — no espírito dos padrões abertos de proveniência de conteúdos como o C2PA: a história de uma afirmação é verificável.
Uma base de conhecimento fiável não é a que responde sempre — é a que não responde quando não deve.
O que as equipas nos perguntam antes de começar
O RAG elimina por completo as alucinações?
Não, e desconfie de quem o prometa. Reduz-nas substancialmente ancorando cada resposta a fontes reais, e os controlos de ancoragem mais os limiares de abstenção travam as respostas não sustentadas antes de saírem. O objetivo é uma resposta verificável, não um ato de fé.
O que acontece quando a resposta não está nos documentos?
O sistema declara-o. Definimos consigo a regra de âmbito: abstenção explícita, nova recuperação ou escalonamento para uma pessoa. Um honesto «não está nas fontes» supera uma invenção plausível.
Como é que as respostas se mantêm atuais?
Através de indexação incremental: quando um documento muda na origem, o índice atualiza-se apenas para a parte alterada, sem reconstrução completa. A freshness é uma métrica que monitorizamos, não um evento esporádico.
Casos
Do problema ao resultado — anônimos.
Apólices citadas, não imaginadas
Problema O assistente de suporte respondia com segurança sobre cláusulas e limites de cobertura recorrendo a versões de apólice ultrapassadas, sem forma de o agente rastrear uma frase até à sua fonte.
Método Ingestão fonte de verdade com metadados de versão e secção, recuperação híbrida sobre as condições do contrato, geração ancorada que cita cada cláusula e limiar de abstenção quando a passagem não sustenta a resposta.
Resultado Cada resposta leva consigo o seu documento, versão e secção; quando a informação não está nas fontes o sistema declara-o em vez de inventar, e o agente pode verificar antes de falar com o cliente.
Fichas técnicas sem fugas de perímetro
Problema A base de conhecimento interna devolvia, a técnicos de departamentos diferentes, fragmentos de documentação restrita que não teriam o direito de ver no sistema de origem.
Método Controlo de acesso como filtro sobre os metadados no momento da recuperação — o perímetro de segurança viaja com o dado — mais fragmentação por tipo de conteúdo que segmenta uma ficha técnica de forma diferente de um procedimento.
Resultado Um documento que um utilizador não pode ver na origem nunca aparece nos resultados; as respostas mantêm-se citadas e verificáveis sem expor material fora de perímetro.
Procedimentos atuais à semana certa
Problema Os procedimentos clínicos mudavam frequentemente, mas um índice reconstruído por calendário deixava janelas em que o sistema citava a versão antiga com a mesma segurança que a atual.
Método Indexação incremental com identificadores estáveis que reprocessa apenas o que muda na origem, mais a freshness tratada como métrica monitorizada em contínuo a par da fidelidade e da exatidão das citações.
Resultado Sem reconstruções totais e sem janelas de desfasamento: o índice reflete o estado atual dos documentos e as respostas deixam de ser seguras mas erradas hoje.
Aprofunde mais
Do índice a um produto em produção→
A recuperação ancorada é uma camada — as outras cinco que sobrevivem ao tráfego real.
Governar a adoção, não apenas o pipeline→
Quem pode pedir o quê, com que permissões e que regras de âmbito explícitas.
Proveniência verificável das afirmações→
Rastrear a origem de um output no espírito dos padrões abertos como o C2PA.