Article ·
RAG en environnement réglementé : la conformité est une exigence d'architecture
Dans la pharma et les autres secteurs réglementés, un assistant documentaire qui « répond bien » ne suffit pas. Il doit prouver d'où viennent ses réponses. Cela se décide dans l'architecture, pas après.
Pourquoi un RAG classique ne suffit pas ?
Le principe du RAG (Retrieval-Augmented Generation) est simple : rechercher les passages pertinents dans un corpus de documents, puis demander à un modèle de langage de répondre en s'appuyant sur eux. Pour une base de connaissances interne ordinaire, une architecture standard — découpage, embeddings, base vectorielle, modèle — donne vite des résultats convaincants.
Dans un environnement réglementé, la question n'est plus seulement « la réponse est-elle juste ? », mais aussi : de quelle version de quel document vient-elle ? L'utilisateur avait-il le droit d'y accéder ? Peut-on reproduire la réponse dans six mois, lors d'un audit ? Un RAG classique ne sait répondre à aucune de ces questions.
Que change le cadre GxP pour une architecture IA ?
Les « bonnes pratiques » regroupées sous le terme GxP (fabrication, laboratoire, essais cliniques, distribution…) imposent notamment l'intégrité et la traçabilité des données : savoir qui a fait quoi, quand, à partir de quelles informations, et pouvoir le démontrer. Appliqué à un assistant IA, cela se traduit en exigences très concrètes sur le corpus, l'accès, les réponses et leur conservation.
C'est la raison pour laquelle, lors du cadrage d'un assistant documentaire pour un environnement pharmaceutique, j'ai traité la conformité comme une exigence d'architecture au même titre que la performance.
Les cinq briques d'un RAG acceptable
1. Un corpus maîtrisé et versionné
Seuls des documents approuvés entrent dans le corpus, avec leur version, leur statut et leur date d'effet. Quand une procédure est mise à jour, l'ancienne version n'est plus proposée — mais elle reste identifiable pour les réponses passées.
2. Une indexation traçable
Chaque fragment indexé garde le lien vers son document source, sa version et sa position. Sans cela, impossible de citer précisément la source d'une réponse.
3. Une recherche filtrée par droits
Le filtrage des droits d'accès se fait au moment de la recherche, avant que le modèle ne voie quoi que ce soit. Un modèle de langage ne doit jamais recevoir un document que l'utilisateur n'a pas le droit de lire.
4. Des réponses sourcées — ou pas de réponse
Chaque réponse cite les passages qui la fondent. Si aucune source pertinente n'est trouvée, l'assistant le dit plutôt que de compléter avec ses connaissances générales. Dans ce contexte, un « je ne sais pas » est une réponse correcte.
5. Un journal d'audit
Question, utilisateur, documents récupérés avec leur version, réponse produite, version du modèle : tout est journalisé. C'est ce qui permet de reconstituer un échange lors d'un audit ou d'une investigation.
Quelle place pour l'humain ?
Dans un environnement réglementé, l'assistant prépare et argumente ; il ne décide pas. Il accélère la recherche d'information, signale les passages pertinents, propose une synthèse — et un professionnel qualifié reste responsable de la décision. Ce principe guide aussi l'interface : les sources doivent être visibles et consultables en un clic, pas cachées derrière la réponse.
Par où commencer ?
Pas par un « grand assistant pour toute l'entreprise ». Dans une stratégie IA pharmaceutique couvrant R&D, qualité, affaires réglementaires et données, j'ai privilégié une feuille de route par domaine : un premier périmètre documentaire bien délimité, des utilisateurs identifiés, des critères de succès mesurables. Une fois ce socle validé — corpus, droits, traçabilité — l'étendre à d'autres domaines devient une extension, pas un nouveau projet.
En résumé
- En environnement réglementé, la conformité se conçoit dans l'architecture dès le départ.
- Corpus versionné, indexation traçable, filtrage des droits avant le modèle, réponses sourcées et journal d'audit sont les cinq briques indispensables.
- Le modèle de langage n'est qu'une étape du système, et la décision reste humaine.
- On commence par un domaine, on valide le socle, puis on étend.
Pour aller plus loin : mon travail d'architecte IA et le schéma de cette architecture.