Glossaire ContellectCapturer et comprendre

Classification documentaire

Déterminer ce qu'est un document, pour que le système sache comment le traiter.

La classification documentaire consiste à affecter un document à une ou plusieurs catégories prédéfinies, le plus souvent son type, afin que le traitement en aval sache comment le gérer.

La classification est la décision dont dépend tout ce qui suit. Les règles d’extraction, la logique de validation, la durée de rétention, les restrictions d’accès et la destination d’orientation sont tous choisis en fonction de la nature du document telle qu’elle a été déterminée.

Ce qui est classifié

Le type est l’axe évident : facture, bon de commande, contrat, passeport, relevé bancaire, bon de livraison. C’est rarement le seul axe qui compte en production.

Le contexte métier distingue des documents de même type qui suivent des processus différents, par exemple une facture nationale par rapport à une facture d’importation, ou une demande de nouvelle affaire par rapport à un renouvellement.

La catégorie d’archive détermine la rétention. Le même contrat signé peut être une archive courante ou une archive formellement déclarée, soumise à une durée de rétention légale. Voir gestion des archives.

La sensibilité détermine le contrôle d’accès et le masquage. Un document contenant des données de carte de paiement ou des informations de santé nécessite l’application de règles de traitement dès la classification, et non après sa diffusion.

Le besoin d’orientation est parfois classifié directement, par exemple en marquant un document comme nécessitant une revue juridique, quel que soit son type.

Traiter ces éléments comme des étiquettes distinctes plutôt que de les intégrer dans une seule taxonomie de type évite que la taxonomie n’explose de façon combinatoire.

Trois approches, et où chacune atteint ses limites

La classification par règles repose sur la correspondance de mots-clés, d’expressions régulières, de codes-barres ou d’empreintes de mise en page. Elle est transparente, peu coûteuse à exécuter, et trivialement explicable, ce qui compte dans les contextes réglementés. Elle est fragile : un fournisseur qui refond son modèle de document, ou un mot-clé apparaissant dans un contexte inattendu, suffit à la faire échouer. Les règles restent le bon choix lorsque le signal est réellement déterministe, comme un code-barres ou un identifiant de formulaire imprimé sur la page.

La classification par apprentissage automatique entraîne un modèle sur des exemples annotés, à partir de caractéristiques textuelles, de mise en page, ou des deux. Elle généralise bien mieux que les règles face aux variations de modèle de document. Elle nécessite des données d’entraînement annotées, elle se dégrade lorsque les documents en production s’éloignent de la distribution d’entraînement, et ses erreurs sont plus difficiles à expliquer à un auditeur.

La classification par grand modèle de langage exploite un modèle généraliste, sollicité par instruction ou affiné, et nécessite peu ou pas de données d’entraînement spécifiques à la tâche. Elle gère bien les types de documents inhabituels ou jamais rencontrés, et peut classifier sur la base de la sémantique plutôt que des caractéristiques de surface. Les compromis sont le coût par document à grande échelle, la latence, un manque de déterminisme entre les exécutions sauf contrainte explicite, et une tendance à produire une étiquette plausible pour un document qui aurait dû être rejeté comme inclassable.

La plupart des systèmes en production les combinent : des règles déterministes là où un marqueur fiable existe, un modèle entraîné pour les types connus à fort volume, et un LLM en repli pour la traîne.

Pourquoi les seuils doivent être définis par type de document

Un seuil de score de confiance détermine quelles classifications sont acceptées automatiquement et lesquelles sont transmises à une personne. Fixer un seuil global unique est l’erreur de conception la plus fréquente à cette étape.

La raison en est que le coût d’une erreur n’est pas uniforme. Classer à tort une brochure marketing comme un bon de livraison fait perdre quelques secondes. Classer à tort une mise en demeure comme une correspondance générale peut faire manquer une échéance légale. La première erreur peut sans risque être acceptée automatiquement à une confiance modérée ; la seconde justifie une revue même à confiance élevée.

La fréquence des classes aggrave ce phénomène. Un type représentant 40 % du volume dispose d’un signal d’entraînement abondant et affiche généralement une confiance réellement élevée. Un type représentant 0,5 % en dispose de peu, et ses valeurs de confiance sont moins fiables au même niveau numérique.

Des seuils par type permettent à un système d’automatiser la majorité des cas tout en réservant les cas rares et à fort enjeu au jugement humain. Ils rendent aussi le point de fonctionnement explicite et vérifiable, plutôt que dissimulé dans un chiffre unique que personne ne peut justifier.

Les erreurs les plus fréquentes

Aucun résultat inclassable n’existe. Forcer chaque document dans une catégorie garantit une classification erronée, mais confiante, de tout ce qui est réellement nouveau. Un chemin explicite de rejet ou de revue est une exigence, pas un raffinement optionnel.

Les fichiers multi-documents sont ignorés. Un même PDF numérisé contient fréquemment plusieurs documents. Sans découpage au niveau de la page avant la classification, le fichier est étiqueté selon ce qui domine sa première page.

La taxonomie est conçue par les mauvaises personnes. Les catégories définies par les propriétaires de processus ont tendance à être exploitables. Les catégories héritées d’une structure de classement ont tendance à décrire où les documents étaient auparavant rangés, ce qui n’aide plus.

Contellect One met en œuvre cette étape sous la forme de la classification documentaire par IA.

Passer de la définition à l'action

Voyez comment Contellect One gouverne le contenu, de la capture à l'action

Demander une démo