AI Solutions · Analyse approfondie
Base de connaissances RAG : des réponses ancrées dans les sources, jamais inventées
Nous construisons des bases de connaissances qui ne répondent qu'à partir de sources vérifiées : recherche hybride, ancrage sur les documents, citations traçables, contrôle des hallucinations et évaluation continue de la qualité des réponses. Quand la source ne suffit pas, le système le déclare au lieu d'inventer.
BASE DE CONNAISSANCES · RÉCUPÉRATION ANCRÉE
Entrée · Question de l'utilisateur
Sortie · Réponse citée et vérifiable
Ingestion de la source de vérité & découpage
Normalise les documents sources et les découpe en fragments cohérents dimensionnés par type de contenu, en attachant à chacun des métadonnées de source — titre, section, date, permissions — qui deviennent la base des citations et du contrôle d'accès : sans une ingestion propre, tout ce qui suit cite du vide.
Récupération hybride (mots-clés + sémantique)
Combine une recherche par mots-clés (BM25) qui capte codes produits, noms propres et termes rares exacts avec une recherche sémantique vectorielle qui capte reformulations et concepts, fusionnant les deux ensembles de résultats par rang (RRF) pour récupérer ce qu'aucun des deux ne trouverait seul.
Reranking sur une liste restreinte
Un reclasseur cross-encodeur réordonne uniquement la présélection étroite des meilleurs candidats en évaluant question et passage ensemble plutôt que séparément, ajoutant un étage de précision qui reste juste précisément parce qu'il travaille sur quelques fragments et non sur l'index entier.
Génération ancrée avec citations
Le modèle ne répond qu'à partir du haut de la présélection et cite la source de chaque affirmation, de sorte que chaque phrase reste traçable jusqu'à un document, une version et une section au lieu de sombrer dans la mémoire d'entraînement.
Contrôle d'ancrage & de pertinence / abstention
Avant la livraison, un contrôle d'ancrage et de pertinence compare la réponse aux passages récupérés : sous le seuil, le système s'abstient, relance la recherche ou passe la main à une personne, car un honnête « ce n'est pas dans les sources » vaut plus qu'une invention plausible.
Évaluation de la qualité des réponses & fraîcheur
Fidélité, pertinence du contexte, pertinence de la réponse, exactitude des citations et freshness de l'index sont mesurées en continu, car un score unique cache où réside le problème et une base fiable doit être tenue honnête à mesure que documents et permissions changent.
Les signes d'une base de connaissances qui invente
Un assistant qui répond avec assurance ne vaut rien si cette assurance n'est pas ancrée à une source. Voici les symptômes que nous observons avant d'intervenir.
- Sûr de lui mais faux. Le système affirme, sur un ton autoritaire, des choses qui n'apparaissent dans aucun document interne : c'est un ancrage manquant, pas une faute de frappe.
- Aucune citation vérifiable. L'utilisateur ne peut pas remonter à la source d'une phrase, il ne peut donc ni s'y fier ni la corriger ; chaque réponse est une boîte noire.
- Du contenu obsolète présenté comme actuel. Une politique mise à jour la semaine dernière n'est pas encore dans l'index, et le système continue de citer l'ancienne version avec la même assurance.
- Fuites de périmètre. Un utilisateur reçoit des fragments de documents qu'il n'aurait aucun droit de voir dans le système source.
- Questions hors périmètre sans frein. Quand les sources sont insuffisantes, le modèle comble le vide en inventant au lieu de déclarer qu'il ne sait pas.
Pour les équipes qui gèrent de la documentation critique, du support, de la conformité ou des connaissances internes et ne peuvent pas se permettre une réponse inventée face à un client ou un auditeur.
Récupérer d'abord, générer ensuite
Un modèle génératif livré à lui-même prédit un texte plausible. Une base de connaissances RAG inverse l'ordre : elle récupère d'abord les preuves dans vos sources, puis force le modèle à ne répondre que dans le cadre de ces preuves.
Retrieval-Augmented Generation
Avant de répondre, le système cherche dans les documents les passages pertinents et les transmet au modèle comme contexte, avec l'instruction de ne répondre qu'à partir de là. Le modèle cesse de puiser dans sa mémoire d'entraînement et puise dans votre source de référence.
Ancrage ≠ exactitude
L'ancrage vérifie que la réponse est fidèle au texte récupéré, pas qu'elle est vraie dans l'absolu. Si la recherche remonte le mauvais fragment, un score d'ancrage élevé signifie seulement que le modèle a fidèlement répété la mauvaise chose — c'est pourquoi recherche et évaluation doivent être traitées comme deux problèmes distincts.
Source de vérité, pas une copie
L'index ne remplace pas vos systèmes sources ; il les reflète. Quand un document change à l'origine, l'index doit changer avec lui, sinon la base de connaissances ment avec assurance sur ce qui est vrai aujourd'hui.
S'abstenir est une fonctionnalité, pas un défaut
Une base de connaissances fiable sait dire « ceci n'est pas dans les sources ». Une abstention honnête vaut mieux qu'une réponse inventée : la valeur pour l'entreprise est de ne pas se tromper, pas de toujours répondre.
De la source à la réponse citée
Chaque couche restreint ce que le modèle a le droit de dire. Le pipeline n'est pas un modèle unique : c'est une chaîne de contrôles, chacun avec une tâche mesurable.
Les documents sont normalisés et découpés en fragments cohérents, dimensionnés par type de contenu : une politique se segmente différemment d'une fiche technique. Chaque fragment porte des métadonnées de source — titre, section, date, permissions — qui deviennent la base des citations et du contrôle d'accès.
Une recherche par mots-clés (BM25) capte codes produits, noms propres et termes rares exacts ; une recherche sémantique vectorielle capte les reformulations et les concepts. Les deux ensembles de résultats sont fusionnés par rang (RRF), récupérant ce qu'aucun des deux ne trouverait seul.
Un reclasseur cross-encodeur ordonne les quelques meilleurs candidats en évaluant question et passage ensemble, pas séparément. C'est un second étage de précision opérant sur une présélection, pas sur l'index entier — d'où sa justesse sans lenteur.
Le modèle ne répond qu'à partir du haut de la présélection et cite la source de chaque affirmation. Avant la livraison, un contrôle d'ancrage et de pertinence compare la réponse aux passages : sous le seuil, le système s'abstient ou relance la recherche au lieu de publier.
De la source à la réponse citée en millisecondes, avec chaque affirmation traçable jusqu'à un passage.
Les métriques qui séparent une base fiable d'une base plausible
Une base de connaissances se juge sur des dimensions distinctes, car un score unique cache où réside le problème. Voici les leviers que nous surveillons en continu.
| Dimension | Ce qu'elle vérifie | Pourquoi elle compte |
|---|---|---|
| Faithfulness (fidélité) | Chaque affirmation de la réponse est soutenue par les passages récupérés | Le frein direct aux hallucinations : pas de source, pas d'affirmation |
| Pertinence du contexte | Les passages récupérés sont effectivement pertinents pour la question | Mesure la recherche : si elle est faible, même une réponse fidèle est fidèle à la mauvaise chose |
| Pertinence de la réponse | La réponse traite vraiment la question posée, sans s'égarer | Distingue le pertinent du génériquement correct mais inutile |
| Exactitude des citations | Chaque citation pointe vers le passage qui soutient vraiment la phrase | Rend la réponse vérifiable : l'utilisateur remonte à la source et contrôle |
| Freshness | L'index reflète l'état actuel des documents sources | Un index périmé produit des réponses sûres mais fausses aujourd'hui |
Les contrôles que nous gardons actifs en production
Construire le pipeline est la moitié du travail. L'autre moitié consiste à le garder honnête dans le temps, à mesure que documents, permissions et questions changent.
Contrôle d'accès dans la recherche
Les permissions sont un filtre sur les métadonnées au moment de la recherche : un document qu'un utilisateur ne peut pas voir à l'origine n'apparaît jamais dans les résultats. Le périmètre de sécurité voyage avec la donnée.
Indexation incrémentale
Quand une source change, on ne retraite que ce qui a changé et l'index est mis à jour avec des identifiants stables. Pas de reconstruction totale, pas de fenêtres où la base répond sur d'anciennes versions.
Seuils d'abstention
Sous le seuil d'ancrage ou de pertinence, la réponse ne part pas : le système déclare qu'il ne sait pas, relance la recherche ou passe la main à une personne. La règle de périmètre est explicite, pas laissée au hasard.
Provenance et source de vérité
Chaque réponse porte avec elle l'origine de ses affirmations — quel document, quelle version, quelle section — dans l'esprit des standards ouverts de provenance des contenus comme C2PA : l'historique d'une affirmation est vérifiable.
Une base de connaissances fiable n'est pas celle qui répond toujours — c'est celle qui ne répond pas quand elle ne le devrait pas.
Ce que les équipes nous demandent avant de démarrer
Le RAG élimine-t-il totalement les hallucinations ?
Non, et méfiez-vous de quiconque le promet. Il les réduit substantiellement en ancrant chaque réponse à des sources réelles, et les contrôles d'ancrage plus les seuils d'abstention arrêtent les réponses non étayées avant qu'elles ne sortent. L'objectif est une réponse vérifiable, pas un acte de foi.
Que se passe-t-il quand la réponse n'est pas dans les documents ?
Le système le déclare. Nous définissons avec vous la règle de périmètre : abstention explicite, relance de la recherche ou escalade vers une personne. Un honnête « ce n'est pas dans les sources » vaut mieux qu'une invention plausible.
Comment les réponses restent-elles à jour ?
Par indexation incrémentale : quand un document change à l'origine, l'index se met à jour seulement pour la partie modifiée, sans reconstruction complète. La freshness est une métrique que nous surveillons, pas un événement occasionnel.
Cas
Du problème au résultat — anonymisés.
Des polices citées, non imaginées
Problème L'assistant de support répondait avec assurance sur les clauses et plafonds de garantie en puisant dans des versions de police périmées, sans moyen pour l'agent de remonter à la source d'une phrase.
Méthode Ingestion source de vérité avec métadonnées de version et de section, recherche hybride sur les conditions du contrat, génération ancrée qui cite chaque clause et seuil d'abstention quand le passage ne soutient pas la réponse.
Résultat Chaque réponse porte avec elle son document, sa version et sa section ; quand l'information n'est pas dans les sources, le système le déclare au lieu d'inventer, et l'agent peut vérifier avant de parler au client.
Des fiches techniques sans fuites de périmètre
Problème La base de connaissances interne restituait, à des techniciens de différents services, des fragments de documentation confidentielle qu'ils n'auraient eu aucun droit de voir dans le système source.
Méthode Contrôle d'accès comme filtre sur les métadonnées au moment de la recherche — le périmètre de sécurité voyage avec la donnée — plus un découpage par type de contenu qui segmente une fiche technique différemment d'une procédure.
Résultat Un document qu'un utilisateur ne peut pas voir à l'origine n'apparaît jamais dans les résultats ; les réponses restent citées et vérifiables sans exposer de matériel hors périmètre.
Des procédures à jour à la bonne semaine
Problème Les procédures cliniques changeaient souvent, mais un index reconstruit selon un calendrier laissait des fenêtres où le système citait l'ancienne version avec la même assurance que la version actuelle.
Méthode Indexation incrémentale avec identifiants stables qui ne retraite que ce qui change à l'origine, plus la freshness traitée comme une métrique surveillée en continu aux côtés de la fidélité et de l'exactitude des citations.
Résultat Pas de reconstructions totales et pas de fenêtres de décalage : l'index reflète l'état actuel des documents et les réponses cessent d'être sûres mais fausses aujourd'hui.
Aller plus loin
De l'index à un produit en production→
La recherche ancrée est une couche — les cinq autres qui survivent au trafic réel.
Gouverner l'adoption, pas seulement le pipeline→
Qui peut demander quoi, avec quelles permissions et quelles règles de périmètre explicites.
Provenance vérifiable des affirmations→
Tracer l'origine d'un output dans l'esprit des standards ouverts comme C2PA.