Documentclassificatie is het toekennen van een document aan een of meer vooraf bepaalde categorieën, meestal het documenttype, zodat de vervolgverwerking weet hoe zij het moet behandelen.
Classificatie is de beslissing waar al het volgende van afhangt. Extractieregels, validatielogica, bewaartermijn, toegangsbeperkingen en routeringsbestemming worden allemaal gekozen op basis van wat het document blijkt te zijn.
Wat er wordt geclassificeerd
Type is de voor de hand liggende as: factuur, inkooporder, contract, paspoort, bankafschrift, vrachtbrief. In productie is dat zelden de enige as die telt.
Zakelijke context onderscheidt documenten van hetzelfde type die een ander proces volgen, zoals een binnenlandse tegenover een importfactuur, of een nieuwe aanvraag tegenover een verlenging.
Categorie archiefstuk bepaalt de bewaartermijn. Dezelfde ondertekende overeenkomst kan een gewoon bedrijfsdocument zijn of een formeel verklaard archiefstuk met een wettelijke bewaartermijn. Zie recordsmanagement.
Gevoeligheid bepaalt toegangsbeheer en het onleesbaar maken van gegevens. Een document met betaalkaartgegevens of gezondheidsinformatie vraagt om behandelregels op het moment van classificatie, niet nadat het is verspreid.
Routeringsbehoefte wordt soms direct geclassificeerd, bijvoorbeeld door een document te markeren als juridisch te beoordelen, ongeacht het type.
Deze aspecten als afzonderlijke labels behandelen in plaats van ze in een enkele typetaxonomie te persen, voorkomt dat de taxonomie combinatorisch uit de hand loopt.
Drie aanpakken, en waar elk tekortschiet
Op regels gebaseerde classificatie zoekt naar trefwoorden, reguliere expressies, barcodes of lay-outkenmerken. Ze is transparant, goedkoop in gebruik en eenvoudig uit te leggen, wat in gereguleerde omgevingen van belang is. Ze is ook fragiel: een leverancier die zijn template herontwerpt, of een trefwoord dat in een onverwachte context opduikt, breekt haar. Regels blijven de juiste keuze wanneer het signaal echt deterministisch is, zoals een barcode of een formuliernummer dat op de pagina staat.
Classificatie met machine learning traint een model op gelabelde voorbeelden, met tekstkenmerken, lay-outkenmerken of beide. Ze generaliseert veel beter over templatevariatie dan regels. Ze vraagt gelabelde trainingsdata, ze wordt zwakker wanneer productiedocumenten afwijken van de trainingsverdeling, en haar fouten zijn moeilijker uit te leggen aan een auditor.
Classificatie met een large language model gebruikt een algemeen model, via een prompt of fijn afgestemd, en vraagt weinig tot geen taakspecifieke trainingsdata. Ze gaat goed om met ongebruikelijke en niet eerder gezien documenttypen en kan classificeren op semantiek in plaats van op oppervlakkige kenmerken. De keerzijden zijn de kosten per document bij volume, de latentie, het niet-deterministische gedrag tussen runs zonder aanvullende beperkingen, en de neiging om een plausibel label te geven aan een document dat als niet-classificeerbaar had moeten worden afgewezen.
De meeste productiesystemen combineren ze: deterministische regels waar een betrouwbaar kenmerk bestaat, een getraind model voor de bekende typen met hoog volume, en een LLM als terugvaloptie voor de staart.
Waarom drempelwaarden per documenttype horen
Een drempelwaarde op de confidence score bepaalt welke classificaties automatisch worden geaccepteerd en welke naar een medewerker gaan. Een enkele globale drempelwaarde instellen is de meest gemaakte ontwerpfout in deze stap.
De reden is dat de kosten van een fout niet gelijk zijn. Een marketingbrochure als vrachtbrief classificeren kost een paar seconden. Een juridische kennisgeving als algemene correspondentie classificeren kan een wettelijke termijn laten verlopen. Het eerste kan veilig automatisch worden geaccepteerd bij gemiddelde zekerheid; het tweede verdient beoordeling, zelfs bij hoge zekerheid.
De frequentie van een klasse versterkt dit. Een type dat in 40 procent van het volume voorkomt, heeft ruim trainingssignaal en doorgaans hoge echte zekerheid. Een type dat in 0,5 procent voorkomt, heeft dat nauwelijks, en zijn zekerheidswaarden zijn bij hetzelfde getal minder betrouwbaar.
Drempelwaarden per type laten een systeem het gros automatiseren terwijl het zeldzame en het zwaarwegende aan menselijk oordeel blijft. Ze maken het werkpunt ook expliciet en toetsbaar, in plaats van weggestopt in een enkel getal dat niemand kan verantwoorden.
Wat er vaak misgaat
Er is geen uitkomst niet-classificeerbaar. Elk document in een categorie dwingen garandeert zelfverzekerde misclassificatie van alles wat echt nieuw is. Een expliciet pad voor afwijzen of beoordelen is een eis, geen extraatje.
Bestanden met meerdere documenten worden genegeerd. Een enkele gescande PDF bevat vaak meerdere documenten. Zonder splitsing op paginaniveau vóór de classificatie krijgt het bestand het label van wat de eerste pagina domineert.
De taxonomie wordt door de verkeerde mensen ontworpen. Categorieën die door proceseigenaren zijn bepaald, blijken doorgaans bruikbaar. Categorieën die uit een oude mappenstructuur zijn overgenomen, beschrijven doorgaans waar documenten vroeger stonden, en dat helpt niet meer.
Contellect One voert deze stap uit als documentclassificatie met AI.
