Saltar para o conteúdo

AI Solutions · Aprofundamento

Base de conhecimento RAG: respostas ancoradas nas fontes, nunca inventadas

Construímos bases de conhecimento que respondem apenas a partir de fontes verificadas: recuperação híbrida, ancoragem nos documentos, citações rastreáveis, controlo de alucinações e avaliação contínua da qualidade das respostas. Quando a fonte não basta, o sistema declara-o em vez de inventar.

AI e Vokira — parole dentro, lavoro fuori

BASE DE CONHECIMENTO · RECUPERAÇÃO FUNDAMENTADA

Entra · Pergunta do utilizador

Sai · Resposta citada e verificável

01

Ingestão da fonte de verdade e chunking

Normaliza os documentos de origem e divide-os em fragmentos coerentes dimensionados por tipo de conteúdo, anexando a cada um metadados de origem — título, secção, data, permissões — que se tornam a base das citações e do controlo de acesso: sem uma ingestão limpa, tudo o que se segue cita o vazio.

02

Recuperação híbrida (palavra-chave + semântica)

Combina uma pesquisa por palavras-chave (BM25) que capta códigos de produto, nomes próprios e termos raros exatos com uma pesquisa semântica vetorial que capta reformulações e conceitos, fundindo os dois conjuntos de resultados por classificação (RRF) para recuperar o que nenhum dos dois encontraria sozinho.

03

Reranking sobre uma lista curta

Um reordenador cross-encoder reordena apenas a lista restrita estreita dos melhores candidatos avaliando pergunta e passagem em conjunto em vez de em separado, acrescentando uma etapa de precisão que se mantém precisa justamente porque trabalha sobre poucos fragmentos e não sobre o índice inteiro.

04

Geração fundamentada com citações

O modelo responde unicamente a partir do topo da lista restrita e cita a fonte de cada afirmação, para que cada frase fique rastreável até um documento, uma versão e uma secção em vez de afundar na memória de treino.

05

Verificação de fundamento e relevância / abstenção

Antes da entrega, um controlo de ancoragem e relevância compara a resposta com as passagens recuperadas: abaixo do limiar o sistema abstém-se, volta a recuperar ou passa a vez a uma pessoa, porque um honesto «não está nas fontes» vale mais do que uma invenção plausível.

06

Avaliação da qualidade da resposta e atualidade

Fidelidade, relevância do contexto, relevância da resposta, exatidão das citações e freshness do índice são medidas em contínuo, porque uma única pontuação esconde onde está o problema e uma base fiável tem de ser mantida honesta à medida que documentos e permissões mudam.

Quando precisa disto

Os sinais de uma base de conhecimento que inventa

Um assistente que responde com segurança não vale nada se essa segurança não estiver ancorada a uma fonte. Estes são os sintomas que vemos antes de intervir.

  • Seguro mas errado. O sistema afirma, em tom autoritário, coisas que não constam de nenhum documento interno: isso é ancoragem em falta, não uma gralha.
  • Sem citações verificáveis. O utilizador não consegue rastrear uma frase até à sua fonte, por isso não pode confiar nela nem corrigi-la; cada resposta é uma caixa preta.
  • Conteúdo obsoleto apresentado como atual. Uma política atualizada na semana passada ainda não está no índice, e o sistema continua a citar a versão antiga com a mesma segurança.
  • Fugas de perímetro. Um utilizador recebe fragmentos de documentos que não teria o direito de ver no sistema de origem.
  • Perguntas fora de âmbito sem travão. Quando as fontes não chegam, o modelo preenche o vazio inventando em vez de declarar que não sabe.

Para equipas que gerem documentação crítica, suporte, conformidade ou conhecimento interno e não podem dar-se ao luxo de uma resposta inventada perante um cliente ou um auditor.

O princípio

Recuperar primeiro, gerar depois

Um modelo generativo deixado a si próprio prevê texto plausível. Uma base de conhecimento RAG inverte a ordem: recupera primeiro a evidência das suas fontes e depois obriga o modelo a responder apenas dentro dessa evidência.

Retrieval-Augmented Generation

Antes de responder, o sistema procura nos documentos as passagens relevantes e entrega-as ao modelo como contexto, com a instrução de responder apenas a partir daí. O modelo deixa de recorrer à memória de treino e recorre à sua fonte de referência.

Ancoragem ≠ correção

A ancoragem verifica que a resposta é fiel ao texto recuperado, não que é verdadeira em absoluto. Se a recuperação trouxer o fragmento errado, uma pontuação de ancoragem alta significa apenas que o modelo repetiu fielmente o errado — por isso recuperação e avaliação têm de ser tratadas como dois problemas distintos.

Fonte de verdade, não uma cópia

O índice não substitui os seus sistemas de origem; reflete-os. Quando um documento muda na origem, o índice tem de mudar com ele, ou a base de conhecimento mente com segurança sobre o que é verdade hoje.

Abster-se é uma funcionalidade, não um defeito

Uma base de conhecimento fiável sabe dizer «isto não está nas fontes». Uma abstenção honesta supera uma resposta inventada: o valor para a empresa está em não errar, não em responder sempre.

Como se constrói

Da fonte à resposta citada

Cada camada restringe o que o modelo pode dizer. O pipeline não é um único modelo: é uma cadeia de controlos, cada um com uma tarefa mensurável.

1
Ingestão e fragmentação

Os documentos são normalizados e divididos em fragmentos coerentes, dimensionados por tipo de conteúdo: uma política segmenta-se de forma diferente de uma ficha técnica. Cada fragmento carrega metadados de origem — título, secção, data, permissões — que se tornam a base das citações e do controlo de acesso.

2
Recuperação híbrida

Uma pesquisa por palavras-chave (BM25) capta códigos de produto, nomes próprios e termos raros exatos; uma pesquisa semântica vetorial capta reformulações e conceitos. Os dois conjuntos de resultados são fundidos por classificação (RRF), recuperando o que nenhum dos dois encontraria sozinho.

3
Reordenação da lista restrita

Um reordenador cross-encoder ordena os poucos melhores candidatos avaliando pergunta e passagem em conjunto, não em separado. É uma segunda etapa de precisão que opera sobre uma lista restrita, não sobre o índice inteiro — por isso é preciso sem ser lento.

4
Geração ancorada com citações

O modelo responde apenas a partir do topo da lista restrita e cita a fonte de cada afirmação. Antes da entrega, um controlo de ancoragem e relevância compara a resposta com as passagens: abaixo do limiar, o sistema abstém-se ou volta a recuperar em vez de publicar.

Da fonte à resposta citada em milissegundos, com cada afirmação rastreável até uma passagem.

O que medimos

As métricas que separam uma base fiável de uma plausível

Uma base de conhecimento avalia-se por dimensões separadas, porque uma única pontuação esconde onde está o problema. Estas são as alavancas que monitorizamos em contínuo.

DimensãoO que verificaPorque importa
Faithfulness (fidelidade)Cada afirmação da resposta é sustentada pelas passagens recuperadasO travão direto às alucinações: sem fonte, sem afirmação
Relevância do contextoAs passagens recuperadas são efetivamente pertinentes à perguntaMede a recuperação: se for fraca, até uma resposta fiel é fiel ao errado
Relevância da respostaA resposta aborda de facto a pergunta colocada, sem divagarDistingue o pertinente do genericamente correto mas inútil
Exatidão das citaçõesCada citação aponta para a passagem que de facto sustenta a fraseTorna a resposta verificável: o utilizador remonta à fonte e confere
FreshnessO índice reflete o estado atual dos documentos de origemUm índice obsoleto produz respostas seguras mas erradas hoje
Garantias operacionais

Os controlos que mantemos ativos em produção

Construir o pipeline é metade do trabalho. A outra metade é mantê-lo honesto ao longo do tempo, à medida que documentos, permissões e perguntas mudam.

01

Controlo de acesso na recuperação

As permissões são um filtro sobre os metadados no momento da pesquisa: um documento que um utilizador não pode ver na origem nunca aparece nos resultados. O perímetro de segurança viaja com o dado.

02

Indexação incremental

Quando uma fonte muda, só se reprocessa o que mudou e o índice é atualizado com identificadores estáveis. Sem reconstruções totais, sem janelas em que a base responde a partir de versões antigas.

03

Limiares de abstenção

Abaixo do limiar de ancoragem ou de relevância, a resposta não sai: o sistema declara que não sabe, volta a recuperar ou passa a vez a uma pessoa. A regra de âmbito é explícita, não deixada ao acaso.

04

Proveniência e fonte de verdade

Cada resposta leva consigo a origem das suas afirmações — que documento, que versão, que secção — no espírito dos padrões abertos de proveniência de conteúdos como o C2PA: a história de uma afirmação é verificável.

Uma base de conhecimento fiável não é a que responde sempre — é a que não responde quando não deve.

Respostas diretas

O que as equipas nos perguntam antes de começar

O RAG elimina por completo as alucinações?

Não, e desconfie de quem o prometa. Reduz-nas substancialmente ancorando cada resposta a fontes reais, e os controlos de ancoragem mais os limiares de abstenção travam as respostas não sustentadas antes de saírem. O objetivo é uma resposta verificável, não um ato de fé.

O que acontece quando a resposta não está nos documentos?

O sistema declara-o. Definimos consigo a regra de âmbito: abstenção explícita, nova recuperação ou escalonamento para uma pessoa. Um honesto «não está nas fontes» supera uma invenção plausível.

Como é que as respostas se mantêm atuais?

Através de indexação incremental: quando um documento muda na origem, o índice atualiza-se apenas para a parte alterada, sem reconstrução completa. A freshness é uma métrica que monitorizamos, não um evento esporádico.

Casos

Do problema ao resultado — anônimos.

Seguros · anonimizado

Apólices citadas, não imaginadas

Problema O assistente de suporte respondia com segurança sobre cláusulas e limites de cobertura recorrendo a versões de apólice ultrapassadas, sem forma de o agente rastrear uma frase até à sua fonte.

Método Ingestão fonte de verdade com metadados de versão e secção, recuperação híbrida sobre as condições do contrato, geração ancorada que cita cada cláusula e limiar de abstenção quando a passagem não sustenta a resposta.

Resultado Cada resposta leva consigo o seu documento, versão e secção; quando a informação não está nas fontes o sistema declara-o em vez de inventar, e o agente pode verificar antes de falar com o cliente.

Indústria · anonimizado

Fichas técnicas sem fugas de perímetro

Problema A base de conhecimento interna devolvia, a técnicos de departamentos diferentes, fragmentos de documentação restrita que não teriam o direito de ver no sistema de origem.

Método Controlo de acesso como filtro sobre os metadados no momento da recuperação — o perímetro de segurança viaja com o dado — mais fragmentação por tipo de conteúdo que segmenta uma ficha técnica de forma diferente de um procedimento.

Resultado Um documento que um utilizador não pode ver na origem nunca aparece nos resultados; as respostas mantêm-se citadas e verificáveis sem expor material fora de perímetro.

Saúde · anonimizado

Procedimentos atuais à semana certa

Problema Os procedimentos clínicos mudavam frequentemente, mas um índice reconstruído por calendário deixava janelas em que o sistema citava a versão antiga com a mesma segurança que a atual.

Método Indexação incremental com identificadores estáveis que reprocessa apenas o que muda na origem, mais a freshness tratada como métrica monitorizada em contínuo a par da fidelidade e da exatidão das citações.

Resultado Sem reconstruções totais e sem janelas de desfasamento: o índice reflete o estado atual dos documentos e as respostas deixam de ser seguras mas erradas hoje.

Aprofunde mais

Vamos levá-lo ao seu stack.