Glossaire ContellectCapturer et comprendre

Extraction de données documentaires

Extraire des champs, tableaux et entités précis d'un document.

L’extraction de données documentaires consiste à identifier et à capturer des valeurs précises dans un document, telles que des champs, des tableaux, des dates et des entités nommées, sous forme de données structurées selon un schéma défini.

L’extraction est l’étape qui produit le résultat réellement consommé par un processus métier. Tout ce qui la précède prépare le document ; tout ce qui la suit vérifie et livre ce que l’extraction a trouvé.

Ce qui est extrait

Les champs d’en-tête sont les valeurs uniques qui identifient et datent un document : numéro de facture, référence du bon de commande, date d’émission, devise, montant total, nom du fournisseur et identifiants fiscaux.

Les lignes de détail et les tableaux sont des structures répétitives, nettement plus difficiles à traiter que les champs d’en-tête. Une ligne de détail peut s’étendre sur plusieurs lignes, se poursuivre après un saut de page, porter son propre régime fiscal, ou faire référence à une adresse de livraison différente de celle de l’en-tête du document.

Les clauses ont de l’importance dans les contrats plutôt que dans les documents transactionnels : droits de résiliation, délais de préavis, plafonds de responsabilité, droit applicable, conditions de renouvellement. L’extraction de clauses relève généralement de l’identification d’un passage plutôt que de la capture d’une valeur, en renvoyant l’extrait et sa position afin qu’un relecteur puisse le lire en contexte.

Les entités sont les parties, lieux, produits et identifiants nommés n’importe où dans le texte, qui ne correspondent pas nécessairement à un champ étiqueté.

Les signatures et les marques sont détectées plutôt que lues : un bloc de signature est-il rempli, une case est-elle cochée, un paraphe figure-t-il sur chaque page.

Les métadonnées sont déduites plutôt que trouvées : nombre de pages, langue, canal de capture, score de qualité, et les valeurs de confiance associées à tout ce qui précède.

Extraction par gabarit et extraction par modèle

L’extraction par gabarit définit l’emplacement des valeurs, soit par coordonnées absolues, soit par rapport à un repère tel qu’une étiquette. Avec une mise en page stable, elle est très précise, entièrement explicable et peu coûteuse. Son mode de défaillance est impitoyable : un fournisseur qui déplace un champ d’un centimètre, ajoute un logo qui décale l’en-tête, ou publie un nouveau gabarit, produit silencieusement des valeurs erronées plutôt que l’absence de valeurs.

Le coût caché est la maintenance. Un gabarit par fournisseur et par type de document devient rapidement des centaines de gabarits, chacun nécessitant une réparation dès qu’une contrepartie modifie ses documents. Les entreprises sous-estiment fréquemment ce phénomène jusqu’à ce que la bibliothèque de gabarits devienne ingérable.

L’extraction par modèle apprend à quoi ressemble un champ à partir d’exemples, en combinant des caractéristiques textuelles, de mise en page et visuelles, ce qui lui permet de généraliser à des mises en page qu’elle n’a jamais rencontrées. Elle supprime la charge de maintenance par fournisseur et gère la longue traîne des contreparties à faible volume qui n’auraient jamais justifié un gabarit.

Ses compromis sont réels. Elle nécessite des données d’entraînement annotées. Sa précision sur un document donné est moins prévisible que celle d’un gabarit correspondant. Et lorsqu’elle se trompe, expliquer pourquoi à un auditeur est plus difficile que de pointer une règle de coordonnées.

Le schéma pratique est en couches : l’extraction par modèle par défaut, les gabarits n’étant conservés que lorsqu’une contrepartie à fort volume présente une mise en page réellement stable et que le gain de précision justifie la maintenance.

La validation avec intervention humaine

Aucun système d’extraction n’atteint une précision totale ; la question de conception n’est donc pas de savoir si des personnes interviennent, mais à quel endroit.

Le dispositif habituel oriente les documents selon la confiance. Les valeurs au-dessus d’un seuil par champ passent automatiquement. Les valeurs en dessous sont mises en file de revue, où une personne voit la valeur extraite à côté de la zone du document dont elle provient, la corrige si nécessaire, et la valide.

Deux propriétés déterminent si ce dispositif fonctionne. Les corrections doivent réalimenter l’entraînement, sans quoi la même erreur se reproduit indéfiniment. Et l’interface de revue doit être plus rapide que la lecture du document depuis le début, sans quoi la file de revue coûte plus cher que le processus manuel qu’elle a remplacé.

Le taux de traitement sans intervention, c’est-à-dire la proportion de documents traités de bout en bout sans intervention humaine, est la mesure qui indique si cet équilibre est atteint. Voir automatisation des flux documentaires.

Les erreurs les plus fréquentes

La précision est moyennée sur l’ensemble des champs. Un chiffre unique masque quels champs échouent. La précision doit être communiquée par champ, car la conséquence d’un montant de paiement erroné n’est pas celle d’une description erronée.

Le vide est confondu avec le manquant. Un champ que le document ne contient réellement pas et un champ que l’extraction n’a pas réussi à trouver sont deux résultats différents, nécessitant un traitement différent. Renvoyer une valeur vide dans les deux cas fait perdre cette distinction.

La validation est ignorée parce que l’extraction semble sûre d’elle. Les contrôles croisés entre champs détectent ce que la confiance par champ ne peut pas détecter : des totaux qui ne s’additionnent pas, des dates dans un ordre impossible, une taxe qui ne correspond pas au taux applicable.

Contellect One extrait des champs, des tableaux et des entités dans le cadre de l’extraction d’informations avancée.

Passer de la définition à l'action

Voyez comment Contellect One gouverne le contenu, de la capture à l'action

Demander une démo