Glossaire ContellectCapturer et comprendre

Score de confiance en IA documentaire

Ce qu'une valeur de certitude d'un modèle vous apprend, et ce qu'elle ne vous apprend pas.

Un score de confiance, dans le traitement des documents par l’IA, est une valeur numérique qu’un modèle associe à un résultat, correspondant à sa propre estimation de la probabilité que ce résultat soit correct.

Ce score est le mécanisme qui rend l’automatisation sûre, car c’est sur lui qu’un système s’appuie pour décider quels résultats il peut accepter sans intervention humaine. Comprendre ce qu’il ne signifie pas est plus utile que de comprendre ce qu’il signifie.

Ce qu’un score de confiance n’est pas

Ce n’est pas une probabilité calibrée. Un champ renvoyé avec une valeur de 0,90 ne signifie pas qu’il est correct dans 90 % des cas. Les sorties brutes d’un modèle sont généralement trop optimistes, parfois nettement, et la relation entre le chiffre affiché et l’exactitude réelle doit être mesurée sur vos propres documents avant d’avoir un sens.

Il n’est pas comparable d’un modèle ou d’une étape à l’autre. Un score de 0,85 issu d’un moteur d’OCR exprime une certitude sur la forme des caractères. Un score de 0,85 issu d’un modèle d’extraction exprime une certitude qu’une valeur appartient bien à un champ. Un score de 0,85 issu d’un classificateur exprime une certitude sur le type de document. Ce sont des grandeurs différentes placées sur une même échelle, qui ne peuvent ni être moyennées ni être comparées.

Ce n’est pas une mesure de la justesse pour la bonne raison. Un modèle peut se tromper d’objet avec une grande assurance, par exemple en extrayant une date authentique du document qui n’est pas celle attendue par le champ. Une confiance élevée associée à une sémantique erronée est le mode de défaillance qui échappe aux tests superficiels.

Il ne détecte pas l’inhabituel de façon fiable. Face à une entrée qui ne ressemble à rien de ce sur quoi ils ont été entraînés, les modèles renvoient en général une confiance moyenne à élevée plutôt qu’une valeur utilement basse. C’est pourquoi un chemin explicite pour l’inclassable compte davantage que la confiance accordée aux scores faibles pour repérer la nouveauté.

Calibration

La calibration consiste à établir la correspondance entre les scores bruts et l’exactitude observée. Elle s’effectue en prenant un échantillon annoté représentatif, en regroupant les prédictions par tranches de score, puis en mesurant la proportion de cas réellement corrects dans chaque tranche.

Le résultat est une table indiquant ce que signifie un score donné dans votre environnement. Elle révèle souvent que le seuil de décision utile se situe à un endroit contre-intuitif, et que le chiffre brut était systématiquement optimiste.

La calibration est propre à un environnement donné et elle se périme. Elle doit être refaite lorsque le modèle change, lorsqu’une nouvelle source de documents importante est ajoutée, et périodiquement à mesure que la composition des entrées évolue.

Le modèle à trois zones

La plupart des systèmes en production partitionnent la plage de scores en trois zones plutôt qu’en deux.

L’acceptation automatique, au-dessus d’un seuil supérieur, laisse passer le résultat sans intervention humaine. Cette zone doit être fixée à partir des données de calibration, au niveau d’exactitude réellement requis par le processus, et non sur un chiffre rond.

La revue humaine, entre les deux seuils, met le résultat en file d’attente pour une personne. Le relecteur voit la valeur ainsi que la zone du document dont elle provient, et la confirme ou la corrige.

Le rejet ou la réorientation, en dessous d’un seuil inférieur, évite la file de revue ordinaire. Une confiance très faible signale en général un problème sur l’entrée plutôt qu’un cas limite : mauvais type de document, numérisation illisible, page blanche. Envoyer ces cas dans la même file que les véritables cas limites ralentit les relecteurs avec un travail qui aurait dû être retourné à l’expéditeur ou renumérisé.

C’est le recours à deux seuils plutôt qu’à un seul qui distingue une file à laquelle les relecteurs font confiance d’une file qu’ils apprennent à survoler.

Comment les seuils déterminent le traitement sans intervention

Le taux de traitement sans intervention, c’est-à-dire la proportion de documents traités de bout en bout sans intervention humaine, dépend directement de l’emplacement du seuil supérieur. L’abaisser augmente l’automatisation et augmente le taux d’erreur ; le relever produit l’effet inverse.

Cela fait du seuil une décision métier plutôt qu’une décision technique, et il doit être fixé en fonction du coût de chaque type d’erreur. Une description erronée sur une ligne de commande est une gêne mineure. Un compte bancaire erroné sur un ordre de paiement est une perte. Ces champs ne relèvent pas du même seuil, ce qui explique pourquoi les seuils sont définis par champ et par type de document plutôt que de façon globale. Voir classification documentaire et extraction de données documentaires.

Les erreurs les plus fréquentes

Un seuil global unique. Une valeur unique pour tous les champs et tous les types conduit soit à sur-automatiser les champs à fort enjeu, soit à sous-automatiser tout le reste.

Des seuils fixés une fois pour toutes. La composition des entrées évolue, les modèles sont mis à jour, et un point de fonctionnement défini au démarrage cesse d’être le bon.

Une confiance affichée aux relecteurs sous forme de pourcentage. Présenter un score non calibré de 0,92 comme « fiable à 92 % » incite les relecteurs à le traiter comme une probabilité et à valider sans vérifier.

L’agrégation des confiances par champ en un score de document. Résumer un document par la moyenne des confiances de ses champs n’a pas d’utilité, car un seul champ critique à faible confiance pèse plus que vingt champs à confiance élevée.

Contellect One applique des seuils par champ dans l’étape de validation du traitement intelligent des documents.

Passer de la définition à l'action

Voyez comment Contellect One gouverne le contenu, de la capture à l'action

Demander une démo