Glossaire ContellectInterroger et agir

Génération augmentée par récupération

Ancrer les réponses générées dans vos propres contenus, droits d'accès appliqués dès la récupération.

La génération augmentée par récupération (RAG) est une technique dans laquelle un modèle de langage récupère des passages pertinents au sein d’un corpus de contenu défini et s’en sert de base pour sa réponse, plutôt que de s’appuyer sur ce qu’il a appris pendant son entraînement.

L’objectif est de permettre à un modèle généraliste de répondre à des questions portant sur un contenu spécifique sur lequel il n’a jamais été entraîné, et de rendre la réponse vérifiable.

Fonctionnement

Une question est convertie en une recherche au sein d’une collection de contenus, combinant généralement similarité sémantique et correspondance par mots-clés classique. Les passages obtenus sont fournis au modèle avec la question, et le modèle reçoit pour instruction de répondre à partir de ces passages.

Le contenu est préparé à l’avance en le découpant en fragments puis en les indexant. Ce découpage a des conséquences plus importantes qu’il n’y paraît. Des fragments trop petits perdent le contexte nécessaire à leur interprétation ; trop grands, la phrase pertinente se dilue dans le texte environnant. Découper au milieu d’un tableau ou d’une clause produit des fragments qui se récupèrent bien mais induisent en erreur à la lecture.

Pour les documents numérisés, tout dépend du fait que le contenu soit d’abord rendu exploitable par machine, ce qui implique la reconnaissance optique de caractères et, pour les documents structurés, l’extraction de données documentaires. Un système de récupération appliqué à des images non reconnues ne récupère rien.

Pourquoi les citations comptent

Une réponse RAG doit indiquer de quels passages elle provient, et les citations doivent pouvoir être examinées, non se contenter d’un rôle décoratif.

Elles remplissent trois fonctions. Elles permettent au lecteur de vérifier l’affirmation, ce qui constitue la seule défense fiable contre une réponse assurée mais fausse. Elles rendent le système auditable, ce qu’exigent les processus réglementés. Et elles révèlent les échecs de récupération : une réponse citant un passage sans rapport indique que le problème vient de la récupération, et non de la génération.

Les citations ne garantissent pas l’exactitude. Un modèle peut citer un passage réel tout en le résumant de façon inexacte : la citation vient donc appuyer la vérification, elle ne la remplace pas.

L’ancrage réduit les hallucinations sans les éliminer

L’ancrage restreint le champ du modèle au texte fourni, ce qui réduit sensiblement l’invention de contenu. Il ne l’élimine pas pour autant.

Il vaut la peine de nommer les modes de défaillance résiduels, car les documents commerciaux des éditeurs ont tendance à affirmer que le problème est résolu. Un modèle interrogé sur un point auquel les passages récupérés ne répondent pas produira souvent malgré tout une réponse plausible plutôt que de décliner. Il peut fusionner deux passages en une affirmation qu’aucun des deux ne fait. Et il peut reproduire un contenu correctement récupéré mais erroné à la source, l’ancrage héritant de l’exactitude du contenu sous-jacent.

Les mesures d’atténuation relèvent davantage de la procédure que de la technique : demander au modèle de décliner lorsque les passages sont insuffisants, afficher les passages récupérés à côté de la réponse, et traiter l’étape de récupération comme le principal levier de qualité, car un échec de génération consécutif à une mauvaise récupération ne peut pas être corrigé par un meilleur modèle.

Le contrôle d’accès doit être appliqué dès la récupération

C’est l’exigence qui distingue un RAG d’entreprise d’une simple démonstration, et c’est aussi celle la plus souvent mal traitée.

Si l’index contient tout et que les autorisations sont appliquées à la réponse générée, le système a déjà échoué. Le modèle a vu un contenu que l’utilisateur ne devrait peut-être pas voir, et la réponse en découle. Filtrer la sortie ne défait pas cela, car le résumé d’un document restreint en constitue une divulgation. Même un refus peut fuiter, en confirmant qu’un document existe.

Le comportement correct consiste à résoudre les autorisations de l’utilisateur avant la récupération et à ne rechercher que ce qu’il est autorisé à voir, de sorte que deux utilisateurs posant la même question reçoivent des réponses différentes selon leurs droits d’accès. Cela suppose que la couche de récupération comprenne le modèle d’autorisations de la plateforme de services de contenu qu’elle interroge, y compris les droits hérités et dérivés de groupes, et qu’elle les résolve à nouveau à chaque requête plutôt que de les mettre en cache.

Cette défaillance est facile à manquer lors des tests, car elle n’apparaît que lorsqu’un test est exécuté avec un utilisateur à faibles privilèges. Un système testé uniquement par des administrateurs paraît correct.

Les erreurs courantes

La qualité de la récupération n’est pas mesurée. Les équipes évaluent les réponses sans jamais vérifier si les bons passages ont été trouvés, si bien que la génération est blâmée pour des échecs de récupération.

Du contenu obsolète est indexé. Un index reconstruit selon un calendrier fixe restitue des documents périmés avec une confiance totale. Un contenu supprimé ou reclassé doit quitter l’index sans délai, ce qui relève également d’une obligation de gestion des archives.

Tout est indexé parce que c’est possible. Les brouillons, les doublons et les versions périmées entrent en concurrence avec le document faisant foi et dégradent chaque réponse.

Il n’existe aucun chemin vers la source. Une réponse que le lecteur ne peut pas retracer jusqu’à un document dans sa forme originale ne peut pas servir de fondement à une décision importante.

Contellect One applique une récupération respectant les droits d’accès dans le cadre de l’intelligence des contenus et des enseignements pilotés par l’IA.

Passer de la définition à l'action

Voyez comment Contellect One gouverne le contenu, de la capture à l'action

Demander une démo