Aller au contenu

AI Solutions · Analyse approfondie

Base de connaissances RAG : des réponses ancrées dans les sources, jamais inventées

Nous construisons des bases de connaissances qui ne répondent qu'à partir de sources vérifiées : recherche hybride, ancrage sur les documents, citations traçables, contrôle des hallucinations et évaluation continue de la qualité des réponses. Quand la source ne suffit pas, le système le déclare au lieu d'inventer.

AI e Vokira — parole dentro, lavoro fuori

BASE DE CONNAISSANCES · RÉCUPÉRATION ANCRÉE

Entrée · Question de l'utilisateur

Sortie · Réponse citée et vérifiable

01

Ingestion de la source de vérité & découpage

Normalise les documents sources et les découpe en fragments cohérents dimensionnés par type de contenu, en attachant à chacun des métadonnées de source — titre, section, date, permissions — qui deviennent la base des citations et du contrôle d'accès : sans une ingestion propre, tout ce qui suit cite du vide.

02

Récupération hybride (mots-clés + sémantique)

Combine une recherche par mots-clés (BM25) qui capte codes produits, noms propres et termes rares exacts avec une recherche sémantique vectorielle qui capte reformulations et concepts, fusionnant les deux ensembles de résultats par rang (RRF) pour récupérer ce qu'aucun des deux ne trouverait seul.

03

Reranking sur une liste restreinte

Un reclasseur cross-encodeur réordonne uniquement la présélection étroite des meilleurs candidats en évaluant question et passage ensemble plutôt que séparément, ajoutant un étage de précision qui reste juste précisément parce qu'il travaille sur quelques fragments et non sur l'index entier.

04

Génération ancrée avec citations

Le modèle ne répond qu'à partir du haut de la présélection et cite la source de chaque affirmation, de sorte que chaque phrase reste traçable jusqu'à un document, une version et une section au lieu de sombrer dans la mémoire d'entraînement.

05

Contrôle d'ancrage & de pertinence / abstention

Avant la livraison, un contrôle d'ancrage et de pertinence compare la réponse aux passages récupérés : sous le seuil, le système s'abstient, relance la recherche ou passe la main à une personne, car un honnête « ce n'est pas dans les sources » vaut plus qu'une invention plausible.

06

Évaluation de la qualité des réponses & fraîcheur

Fidélité, pertinence du contexte, pertinence de la réponse, exactitude des citations et freshness de l'index sont mesurées en continu, car un score unique cache où réside le problème et une base fiable doit être tenue honnête à mesure que documents et permissions changent.

Quand cela vous sert

Les signes d'une base de connaissances qui invente

Un assistant qui répond avec assurance ne vaut rien si cette assurance n'est pas ancrée à une source. Voici les symptômes que nous observons avant d'intervenir.

  • Sûr de lui mais faux. Le système affirme, sur un ton autoritaire, des choses qui n'apparaissent dans aucun document interne : c'est un ancrage manquant, pas une faute de frappe.
  • Aucune citation vérifiable. L'utilisateur ne peut pas remonter à la source d'une phrase, il ne peut donc ni s'y fier ni la corriger ; chaque réponse est une boîte noire.
  • Du contenu obsolète présenté comme actuel. Une politique mise à jour la semaine dernière n'est pas encore dans l'index, et le système continue de citer l'ancienne version avec la même assurance.
  • Fuites de périmètre. Un utilisateur reçoit des fragments de documents qu'il n'aurait aucun droit de voir dans le système source.
  • Questions hors périmètre sans frein. Quand les sources sont insuffisantes, le modèle comble le vide en inventant au lieu de déclarer qu'il ne sait pas.

Pour les équipes qui gèrent de la documentation critique, du support, de la conformité ou des connaissances internes et ne peuvent pas se permettre une réponse inventée face à un client ou un auditeur.

Le principe

Récupérer d'abord, générer ensuite

Un modèle génératif livré à lui-même prédit un texte plausible. Une base de connaissances RAG inverse l'ordre : elle récupère d'abord les preuves dans vos sources, puis force le modèle à ne répondre que dans le cadre de ces preuves.

Retrieval-Augmented Generation

Avant de répondre, le système cherche dans les documents les passages pertinents et les transmet au modèle comme contexte, avec l'instruction de ne répondre qu'à partir de là. Le modèle cesse de puiser dans sa mémoire d'entraînement et puise dans votre source de référence.

Ancrage ≠ exactitude

L'ancrage vérifie que la réponse est fidèle au texte récupéré, pas qu'elle est vraie dans l'absolu. Si la recherche remonte le mauvais fragment, un score d'ancrage élevé signifie seulement que le modèle a fidèlement répété la mauvaise chose — c'est pourquoi recherche et évaluation doivent être traitées comme deux problèmes distincts.

Source de vérité, pas une copie

L'index ne remplace pas vos systèmes sources ; il les reflète. Quand un document change à l'origine, l'index doit changer avec lui, sinon la base de connaissances ment avec assurance sur ce qui est vrai aujourd'hui.

S'abstenir est une fonctionnalité, pas un défaut

Une base de connaissances fiable sait dire « ceci n'est pas dans les sources ». Une abstention honnête vaut mieux qu'une réponse inventée : la valeur pour l'entreprise est de ne pas se tromper, pas de toujours répondre.

Comment c'est construit

De la source à la réponse citée

Chaque couche restreint ce que le modèle a le droit de dire. Le pipeline n'est pas un modèle unique : c'est une chaîne de contrôles, chacun avec une tâche mesurable.

1
Ingestion et découpage

Les documents sont normalisés et découpés en fragments cohérents, dimensionnés par type de contenu : une politique se segmente différemment d'une fiche technique. Chaque fragment porte des métadonnées de source — titre, section, date, permissions — qui deviennent la base des citations et du contrôle d'accès.

2
Recherche hybride

Une recherche par mots-clés (BM25) capte codes produits, noms propres et termes rares exacts ; une recherche sémantique vectorielle capte les reformulations et les concepts. Les deux ensembles de résultats sont fusionnés par rang (RRF), récupérant ce qu'aucun des deux ne trouverait seul.

3
Reclassement de la présélection

Un reclasseur cross-encodeur ordonne les quelques meilleurs candidats en évaluant question et passage ensemble, pas séparément. C'est un second étage de précision opérant sur une présélection, pas sur l'index entier — d'où sa justesse sans lenteur.

4
Génération ancrée avec citations

Le modèle ne répond qu'à partir du haut de la présélection et cite la source de chaque affirmation. Avant la livraison, un contrôle d'ancrage et de pertinence compare la réponse aux passages : sous le seuil, le système s'abstient ou relance la recherche au lieu de publier.

De la source à la réponse citée en millisecondes, avec chaque affirmation traçable jusqu'à un passage.

Ce que nous mesurons

Les métriques qui séparent une base fiable d'une base plausible

Une base de connaissances se juge sur des dimensions distinctes, car un score unique cache où réside le problème. Voici les leviers que nous surveillons en continu.

DimensionCe qu'elle vérifiePourquoi elle compte
Faithfulness (fidélité)Chaque affirmation de la réponse est soutenue par les passages récupérésLe frein direct aux hallucinations : pas de source, pas d'affirmation
Pertinence du contexteLes passages récupérés sont effectivement pertinents pour la questionMesure la recherche : si elle est faible, même une réponse fidèle est fidèle à la mauvaise chose
Pertinence de la réponseLa réponse traite vraiment la question posée, sans s'égarerDistingue le pertinent du génériquement correct mais inutile
Exactitude des citationsChaque citation pointe vers le passage qui soutient vraiment la phraseRend la réponse vérifiable : l'utilisateur remonte à la source et contrôle
FreshnessL'index reflète l'état actuel des documents sourcesUn index périmé produit des réponses sûres mais fausses aujourd'hui
Garanties opérationnelles

Les contrôles que nous gardons actifs en production

Construire le pipeline est la moitié du travail. L'autre moitié consiste à le garder honnête dans le temps, à mesure que documents, permissions et questions changent.

01

Contrôle d'accès dans la recherche

Les permissions sont un filtre sur les métadonnées au moment de la recherche : un document qu'un utilisateur ne peut pas voir à l'origine n'apparaît jamais dans les résultats. Le périmètre de sécurité voyage avec la donnée.

02

Indexation incrémentale

Quand une source change, on ne retraite que ce qui a changé et l'index est mis à jour avec des identifiants stables. Pas de reconstruction totale, pas de fenêtres où la base répond sur d'anciennes versions.

03

Seuils d'abstention

Sous le seuil d'ancrage ou de pertinence, la réponse ne part pas : le système déclare qu'il ne sait pas, relance la recherche ou passe la main à une personne. La règle de périmètre est explicite, pas laissée au hasard.

04

Provenance et source de vérité

Chaque réponse porte avec elle l'origine de ses affirmations — quel document, quelle version, quelle section — dans l'esprit des standards ouverts de provenance des contenus comme C2PA : l'historique d'une affirmation est vérifiable.

Une base de connaissances fiable n'est pas celle qui répond toujours — c'est celle qui ne répond pas quand elle ne le devrait pas.

Réponses directes

Ce que les équipes nous demandent avant de démarrer

Le RAG élimine-t-il totalement les hallucinations ?

Non, et méfiez-vous de quiconque le promet. Il les réduit substantiellement en ancrant chaque réponse à des sources réelles, et les contrôles d'ancrage plus les seuils d'abstention arrêtent les réponses non étayées avant qu'elles ne sortent. L'objectif est une réponse vérifiable, pas un acte de foi.

Que se passe-t-il quand la réponse n'est pas dans les documents ?

Le système le déclare. Nous définissons avec vous la règle de périmètre : abstention explicite, relance de la recherche ou escalade vers une personne. Un honnête « ce n'est pas dans les sources » vaut mieux qu'une invention plausible.

Comment les réponses restent-elles à jour ?

Par indexation incrémentale : quand un document change à l'origine, l'index se met à jour seulement pour la partie modifiée, sans reconstruction complète. La freshness est une métrique que nous surveillons, pas un événement occasionnel.

Cas

Du problème au résultat — anonymisés.

Assurance · anonymisé

Des polices citées, non imaginées

Problème L'assistant de support répondait avec assurance sur les clauses et plafonds de garantie en puisant dans des versions de police périmées, sans moyen pour l'agent de remonter à la source d'une phrase.

Méthode Ingestion source de vérité avec métadonnées de version et de section, recherche hybride sur les conditions du contrat, génération ancrée qui cite chaque clause et seuil d'abstention quand le passage ne soutient pas la réponse.

Résultat Chaque réponse porte avec elle son document, sa version et sa section ; quand l'information n'est pas dans les sources, le système le déclare au lieu d'inventer, et l'agent peut vérifier avant de parler au client.

Industrie · anonymisé

Des fiches techniques sans fuites de périmètre

Problème La base de connaissances interne restituait, à des techniciens de différents services, des fragments de documentation confidentielle qu'ils n'auraient eu aucun droit de voir dans le système source.

Méthode Contrôle d'accès comme filtre sur les métadonnées au moment de la recherche — le périmètre de sécurité voyage avec la donnée — plus un découpage par type de contenu qui segmente une fiche technique différemment d'une procédure.

Résultat Un document qu'un utilisateur ne peut pas voir à l'origine n'apparaît jamais dans les résultats ; les réponses restent citées et vérifiables sans exposer de matériel hors périmètre.

Santé · anonymisé

Des procédures à jour à la bonne semaine

Problème Les procédures cliniques changeaient souvent, mais un index reconstruit selon un calendrier laissait des fenêtres où le système citait l'ancienne version avec la même assurance que la version actuelle.

Méthode Indexation incrémentale avec identifiants stables qui ne retraite que ce qui change à l'origine, plus la freshness traitée comme une métrique surveillée en continu aux côtés de la fidélité et de l'exactitude des citations.

Résultat Pas de reconstructions totales et pas de fenêtres de décalage : l'index reflète l'état actuel des documents et les réponses cessent d'être sûres mais fausses aujourd'hui.

Aller plus loin

Apportons-le à votre stack.