Aller au contenu

AI Products · Analyse approfondie

Architecture d'un produit IA en production : des données aux garde-fous

Les six couches qui transforment un prototype en un produit IA fiable : ingestion gouvernée, retrieval mesurable, orchestration déterministe, évals en CI, garde-fous de bout en bout et maîtrise des coûts et de la latence.

Software house — su misura, costruito da noi

PRODUIT IA · ARCHITECTURE DE PRODUCTION

Entrée · Requête brute + sources

Sortie · Une réponse livrable, traçable et fiable

01

Données & ingestion (lignage, anonymisation des PII)

Chaque document entre via un parsing structuré, une classification de sensibilité et une rédaction déterministe des PII avant d'atteindre le modèle, et chaque chunk conserve son lien avec le fichier source, la version de politique et la run qui l'a produit : sans cette couche, aucune réponse ne résiste à un audit.

02

Récupération (recherche hybride + reranking)

Le retrieval fusionne recherche sémantique à vecteurs et recherche lexicale BM25 via Reciprocal Rank Fusion, puis un reranker cross-encoder réordonne les candidats pour faire remonter les passages réellement pertinents : c'est là que la fidélité de la réponse se gagne ou se perd.

03

Orchestration (agent borné, appels d'outils)

Un workflow déterministe décide où vous en êtes dans le processus tandis que le modèle choisit quoi faire au sein d'un ensemble d'actions contraint, avec des appels d'outils via des protocoles standards, une exécution durable et du human-in-the-loop sur les actions à fort impact : l'agent reste prévisible même sous charge.

04

Évaluation & observabilité (evals en CI, traçage)

Un jeu de données golden bâti à partir des échecs réels, des évaluateurs calibrés sur des relecteurs humains et un gate en CI bloquent les régressions avant la mise en production, avec des traces suivant des conventions sémantiques ouvertes (OpenTelemetry GenAI) pour rester interopérables et investigables.

05

Garde-fous & sécurité (entrées/sorties, injection)

Les garde-fous valident l'entrée, le contexte récupéré et la sortie de bout en bout contre l'injection de prompt — la vulnérabilité la plus exploitée — en classant le contexte intermédiaire non fiable et en évaluant chaque action par rapport à l'intention initiale de l'utilisateur.

06

Coût & latence (routage, cache, TTFT)

Le routage par complexité, le cache sémantique et les budgets de tokens maîtrisent coûts et time-to-first-token, avec du streaming pour la latence perçue, de sorte que la facture n'explose pas et que la qualité ne se dégrade pas quand le trafic croît.

L'essentiel

La démo convainc, le produit s'effondre

Un prototype IA fonctionne parce qu'il tourne sur des entrées connues, en single-tenant, sans trafic adverse. La production réécrit toutes les règles.

  • Des réponses assurées mais fausses. Le modèle cite les mauvais documents d'un ton autoritaire : le goulot d'étranglement est le retrieval, pas la génération.
  • Un comportement non reproductible. La même entrée donne des résultats différents et personne ne sait pourquoi, car il n'existe ni traces ni jeu de données de régression.
  • Des coûts et une latence hors de contrôle. Des prompts verbeux, aucun cache, aucun routage selon la complexité : la facture grimpe et le time-to-first-token se dégrade sous charge.
  • Une surface d'attaque ouverte. Des instructions hostiles cachées dans un document ou une sortie d'outil détournent l'agent : l'injection de prompt est la vulnérabilité la plus exploitée.
  • Aucune traçabilité. Quand un utilisateur signale une erreur, on ne peut pas remonter au document source, au chunk et à la run qui l'ont produite.

Pour les équipes qui font passer une IA du proof-of-concept à un système en production, avec audits, SLA et plafonds de coût.

Les six couches

Ce qui fait d'un prototype un vrai produit

Un produit IA en production est un système distribué dans lequel le modèle n'est que le planificateur. Six couches le soutiennent.

Données et ingestion

Les documents entrent via un parsing structuré, une classification de sensibilité et une rédaction déterministe des PII avant d'atteindre le modèle. Chaque sortie remonte au fichier source, à la version de politique et à la run qui l'a produite.

Retrieval

La récupération combine recherche sémantique (vecteurs) et recherche lexicale (BM25), fusionnées via Reciprocal Rank Fusion, puis un reranker cross-encoder réordonne les candidats. C'est là que la fidélité de la réponse se gagne ou se perd.

Orchestration et agents

Un workflow déterministe décide où vous en êtes dans le processus ; le modèle décide quoi faire au sein d'un ensemble d'actions contraint. Les appels d'outils passent par des protocoles standards, avec exécution durable et human-in-the-loop sur les actions à fort impact.

Évaluation et observabilité

Un jeu de données golden bâti à partir des échecs réels, des évaluateurs calibrés sur des relecteurs humains et un gate en CI qui bloque les régressions avant la mise en production. Les traces suivent des conventions sémantiques ouvertes (OpenTelemetry GenAI) pour rester interopérables.

Garde-fous et coûts

Les garde-fous valident l'entrée, le contexte récupéré et la sortie de bout en bout contre l'injection de prompt ; le routage par complexité, le cache sémantique et les budgets de tokens maîtrisent coûts et latence sans dégrader la qualité.

De la donnée à la réponse

Le parcours d'une seule requête

Ce qu'une requête traverse lorsque l'architecture est complète, de la couche de données au retour de la réponse.

1
Ingestion gouvernée

Le document est parsé, classé par sensibilité, débarrassé des PII et indexé avec des tags de finalité ; chaque chunk conserve son lien avec la source.

2
Retrieval et rerank

Recherche hybride vecteur + mot-clé, fusion des rangs, puis reranking cross-encoder pour faire remonter les passages réellement pertinents.

3
Orchestration contrainte

L'orchestrateur achemine la requête, appelle les outils nécessaires et met l'agent en pause aux points de décision critiques ; chaque invocation est journalisée.

4
Garde-fous, éval et retour

Sortie validée contre la politique et les signaux d'injection, évaluée sur des traces échantillonnées, puis renvoyée avec cache et streaming pour la latence perçue.

Six couches traversées par requête, chacune mesurable et traçable indépendamment.

Prototype vs produit

Là où tout change

Même modèle, autre monde. L'écart n'est pas dans le prompt : il est dans les couches qui l'entourent.

DimensionPrototypeProduit en production
DonnéesFichiers téléversés à la mainIngestion gouvernée, PII rédigées, lineage traçable
RetrievalRecherche vectorielle seuleHybride + reranking, fidélité mesurée
ContrôleAgent en roue libreWorkflow déterministe, outils contraints, human-in-the-loop
QualitéTestée à la mainÉvals en CI sur un jeu de données golden, gate de régression
Sécurité et coûtsAucun garde-fouDéfense en profondeur, routage, cache, budgets de tokens
Ce que vous obtenez

La valeur des six couches

Ce n'est pas de la théorie d'architecture : c'est ce qui vous permet d'apposer votre nom sur une réponse devant un client ou un audit.

01

Des réponses qui résistent à un audit

Chaque sortie remonte au document, au chunk et à la version de politique : explicable, reproductible, défendable.

02

Fiabilité sous trafic réel

Orchestration déterministe et garde-fous de bout en bout maintiennent le comportement prévisible même avec des entrées adverses et multi-tenant.

03

Une qualité qui ne régresse pas

Les évals en CI bloquent les dégradations avant la mise en production, pas après la plainte d'un utilisateur.

04

Coûts et latence gouvernés

Le routage par complexité, le cache sémantique et les budgets de tokens maintiennent la facture et le time-to-first-token sous contrôle à l'échelle.

En production, un agent n'est pas un prompt : c'est un système distribué dans lequel le modèle est le planificateur.

Questions directes

Ce que les clients nous demandent

Pourquoi la réponse est-elle assurée mais fausse ?

Presque toujours le problème est en amont : le retrieval a remonté les mauvais documents et le modèle a produit une réponse bien formée mais fondée sur la mauvaise source. On le corrige avec un retrieval hybride, du reranking et une mesure de fidélité, pas avec le prompt.

Comment nous défendons-nous contre l'injection de prompt ?

Avec la défense en profondeur : classer l'entrée et le contexte récupéré avant le modèle, valider la sortie contre la politique, et évaluer chaque action de l'agent par rapport à l'intention initiale de l'utilisateur, en isolant le contexte intermédiaire non fiable.

Que faut-il au-delà d'un modèle qui passe les évals ?

Un prototype qui passe les évals est un ingrédient. Il faut aussi des jeux de données golden issus des échecs réels, des traces, des gates en CI, du canary, du rollback et des runbooks : cela s'ingénierise, ne se présuppose pas.

Cas

Du problème au résultat — anonymisés.

Services juridiques · anonymisé

La citation assurée mais fausse

Problème Un assistant documentaire répondait d'un ton autoritaire en citant le mauvais contrat : en démo ça marchait, devant les clients la confiance s'effondrait car personne ne savait remonter à la source.

Méthode Remplacé la recherche vectorielle seule par un retrieval hybride (vecteurs + BM25) fusionné via Reciprocal Rank Fusion et un reranking cross-encoder, ajouté un lineage chunk-à-source et une mesure de fidélité sur des réponses échantillonnées.

Résultat Chaque sortie remonte désormais au document, au chunk et à la version de politique qui la fondent ; les réponses non pertinentes sont interceptées avant l'utilisateur au lieu de surgir en réclamation.

Services financiers · anonymisé

L'agent détourné par un document

Problème Un agent utilisant des outils exécutait des instructions hostiles cachées dans les documents téléversés et les sorties d'outils : une injection de prompt qui ouvrait une surface d'attaque en environnement multi-tenant.

Méthode Introduit la défense en profondeur — classer l'entrée et le contexte récupéré avant le modèle, valider la sortie contre la politique, isoler le contexte intermédiaire non fiable et ajouter du human-in-the-loop sur les actions à fort impact.

Résultat Le comportement de l'agent est resté prévisible même avec des entrées adverses ; chaque action est évaluée par rapport à l'intention initiale de l'utilisateur et les invocations d'outils sont journalisées et traçables.

Santé · anonymisé

La qualité qui régressait en silence

Problème La même entrée donnait des résultats différents et les dégradations n'émergeaient qu'après la plainte d'un utilisateur, car il n'existait ni traces ni jeu de données de régression sur lequel s'appuyer.

Méthode Construit un jeu de données golden à partir des échecs réels, calibré les évaluateurs sur des relecteurs humains, ajouté un gate d'éval en CI avec canary et rollback, et instrumenté des traces conformes à OpenTelemetry GenAI.

Résultat Les régressions sont bloquées avant la mise en production au lieu de l'être après une réclamation, et le comportement du système est aujourd'hui reproductible et investigable run par run.

Aller plus loin

Apportons-le à votre stack.