Glossaire ContellectCapturer et comprendre

Reconnaissance optique de caractères

Convertir des images de texte en caractères exploitables par machine, et où cela s'arrête.

La reconnaissance optique de caractères (OCR) est la conversion d’images de texte, telles que des numérisations et des photographies, en données de caractères exploitables par machine.

L’OCR répond à une seule question : quels caractères figurent sur cette page. Elle ne détermine ni la nature du document, ni les valeurs qui importent, ni si l’une d’elles est correcte.

Ce que produit réellement l’OCR

Un moteur OCR moderne renvoie bien plus qu’une simple chaîne de texte. Une sortie typique comprend les caractères reconnus, leurs coordonnées de délimitation sur la page, une valeur de confiance par caractère ou par mot, et une description de structure telle que les lignes, les blocs et l’ordre de lecture.

C’est en raison de cette sortie structurelle que la qualité de l’OCR ne se résume pas à un seul chiffre. Un moteur peut reconnaître chaque caractère correctement tout en les restituant dans un ordre qui rend le résultat inutilisable, ce qui se produit couramment avec les mises en page multicolonnes, les encadrés et les formulaires où les libellés et les valeurs sont visuellement proches mais très éloignés dans le flux sous-jacent.

Interprétation de la mise en page et ordre de lecture

Avant la reconnaissance, la page est segmentée : les blocs de texte sont séparés des images, les colonnes sont identifiées, les tableaux sont détectés, les en-têtes et pieds de page sont mis de côté. C’est l’interprétation de la mise en page, et elle détermine si les caractères sont restitués dans un ordre qu’un humain reconnaîtrait comme le contenu du document.

Les tableaux constituent la difficulté classique. Un tableau sans bordures est visuellement évident mais structurellement invisible, si bien que les limites des cellules doivent être déduites de l’alignement des espaces. Les cellules fusionnées, le texte qui s’enroule dans une cellule et la continuation au-delà d’un saut de page mettent tous en échec une détection naïve.

Détection de la langue et de l’écriture

Les documents multilingues nécessitent l’identification de la langue avant ou pendant la reconnaissance, car les modèles de caractères sont spécifiques à chaque langue, tout comme les dictionnaires utilisés pour corriger les formes ambiguës. Les documents à écriture mixte, courants dans les documents professionnels arabes et de la région du Golfe où des noms de produits en anglais s’insèrent dans un texte arabe, nécessitent une détection par région plutôt qu’un unique paramètre de langue au niveau du document.

Les écritures de droite à gauche ajoutent une complexité d’ordre de lecture distincte de la précision de reconnaissance des caractères. Un système peut identifier correctement chaque caractère arabe tout en les restituant dans un ordre qui inverse le sens lorsqu’ils sont mêlés à du texte latin et à des chiffres.

Pourquoi la sortie de l’OCR n’est pas une donnée structurée

C’est la distinction qui compte commercialement, et c’est aussi celle la plus souvent brouillée. L’OCR donne du texte. Un processus a besoin de valeurs : ce numéro de facture, ce total, ces lignes de détail, cette date de signature.

Passer de l’un à l’autre suppose de déterminer la nature du document, ce qui relève de la classification documentaire, puis de repérer et d’interpréter des valeurs précises, ce qui relève de l’extraction de données documentaires. Associé à la validation et à l’orientation, ce pipeline constitue le traitement intelligent des documents. L’OCR en est la première étape substantielle, pas un substitut.

Un test utile : si la sortie de votre système est consultable mais qu’une personne doit encore lire chaque document pour saisir des valeurs dans un autre système, vous avez déployé de l’OCR, pas de l’automatisation documentaire.

La précision dépend davantage de l’entrée que du moteur

Les équipes qui comparent des moteurs OCR constatent généralement des écarts plus faibles qu’attendu, car la qualité de l’image domine tout le reste. Une résolution inférieure à environ 200 points par pouce, une forte compression JPEG, l’inclinaison, les ombres des photographies prises au téléphone, une impression thermique pâle et une numérisation au mauvais contraste coûtent tous plus en précision que l’écart entre des moteurs compétents.

C’est pourquoi le prétraitement pèse de façon disproportionnée. Le redressement, le débruitage, l’uniformisation du contraste et le rejet des images sous un seuil de qualité minimal avant toute tentative de reconnaissance améliorent généralement les résultats de bout en bout davantage qu’un changement de moteur.

Le corollaire mérite d’être énoncé clairement : un projet qui corrige son canal de capture, par exemple en remplaçant les documents photographiés par une application de numérisation qui impose une résolution et un cadrage, gagne souvent davantage qu’un projet consacrant le même effort au choix du modèle.

Les erreurs courantes

La précision est annoncée au niveau du caractère. Une précision de 99 % au niveau des caractères semble excellente et peut malgré tout signifier qu’une proportion importante de documents comporte au moins un champ erroné, car les erreurs se concentrent dans la minorité de documents de faible qualité plutôt que de se répartir uniformément.

La confiance est assimilée à l’exactitude. Une valeur de confiance OCR élevée indique la certitude du moteur quant à la forme des caractères. Elle ne dit rien sur le fait que la valeur soit la bonne pour le champ concerné. Voir score de confiance.

L’écriture manuscrite est présumée couverte. La reconnaissance de texte manuscrit est un problème différent, avec une précision sensiblement différente, et les champs contraints tels que des dates encadrées se comportent très différemment d’une annotation libre.

Contellect One effectue la reconnaissance dans l’étape de lecture du traitement intelligent des documents.

Passer de la définition à l'action

Voyez comment Contellect One gouverne le contenu, de la capture à l'action

Demander une démo