Het extraheren van documentdata is het identificeren en vastleggen van specifieke waarden uit een document, zoals velden, tabellen, datums en benoemde entiteiten, als gestructureerde data met een vastgelegd schema.
Extractie is de fase die de uitvoer oplevert die een bedrijfsproces daadwerkelijk gebruikt. Alles daarvoor bereidt het document voor; alles daarna controleert en levert wat de extractie heeft gevonden.
Wat er wordt geëxtraheerd
Kopvelden zijn de enkelvoudige waarden die een document identificeren en dateren: factuurnummer, inkooporderreferentie, uitgiftedatum, valuta, totaal, leveranciersnaam en fiscale identificatienummers.
Regelposten en tabellen zijn repeterende structuren, en zij zijn wezenlijk moeilijker dan kopvelden. Een regelpost kan over meerdere rijen doorlopen, over een pagina-einde doorlopen, een eigen fiscale behandeling hebben, of naar een ander afleveradres verwijzen dan de documentkop.
Clausules zijn van belang in contracten en niet in transactionele documenten: opzegrechten, opzegtermijnen, aansprakelijkheidsplafonds, toepasselijk recht, verlengingsvoorwaarden. Het extraheren van clausules is doorgaans het aanwijzen van een tekstbereik en niet het vastleggen van een waarde: de passage en haar locatie worden teruggegeven zodat een beoordelaar haar in context kan lezen.
Entiteiten zijn de partijen, plaatsen, producten en identificatiekenmerken die ergens in de tekst worden genoemd, en die niet noodzakelijk overeenkomen met een gelabeld veld.
Ondertekeningen en aankruisingen worden gedetecteerd en niet gelezen: of een ondertekeningsblok is gevuld, of een aankruisvak is aangevinkt, of op elke pagina een initiaal staat.
Metadata wordt afgeleid en niet gevonden: paginaaantal, taal, aanleverkanaal, kwaliteitsscore, en de zekerheidswaarden die aan al het bovenstaande hangen.
Extractie met templates tegenover extractie met modellen
Extractie met templates legt vast waar waarden staan, hetzij met absolute coördinaten, hetzij ten opzichte van een anker zoals een label. Bij een stabiele opmaak is die aanpak zeer nauwkeurig, volledig uitlegbaar en goedkoop. De manier waarop zij faalt is onverbiddelijk: een leverancier die een veld een centimeter verplaatst, een logo toevoegt dat de kop verschuift, of een nieuw template uitbrengt, levert stilzwijgend onjuiste waarden op in plaats van geen waarden.
De verborgen kosten zitten in het onderhoud. Eén template per leverancier per documenttype wordt honderden templates, die elk hersteld moeten worden zodra een tegenpartij haar documentatie wijzigt. Organisaties onderschatten dit vaak totdat de templatebibliotheek al onbeheersbaar is.
Extractie met modellen leert uit voorbeelden hoe een veld eruitziet, waarbij tekst, opmaak en visuele kenmerken samen worden gebruikt, zodat de aanpak generaliseert naar opmaak die zij niet eerder heeft gezien. Zij neemt de onderhoudslast per leverancier weg en verwerkt de lange staart van tegenpartijen met een klein volume die nooit een template rechtvaardigden.
De afwegingen zijn reëel. Er is gelabelde trainingsdata nodig. De nauwkeurigheid op een individueel document is minder voorspelbaar dan die van een passend template. En wanneer het model fout zit, is uitleggen waarom aan een auditor moeilijker dan verwijzen naar een coördinatenregel.
Het praktische patroon is gelaagd: extractie met modellen als standaard, waarbij templates alleen worden aangehouden waar een tegenpartij met een groot volume een werkelijk stabiele opmaak heeft en de winst in nauwkeurigheid het onderhoud rechtvaardigt.
Validatie met een mens in de keten
Geen enkel extractiesysteem bereikt volledige nauwkeurigheid, dus de ontwerpvraag is niet of mensen betrokken zijn maar waar.
De gebruikelijke inrichting routeert documenten op zekerheid. Waarden boven een drempelwaarde per veld gaan automatisch door. Waarden daaronder komen in een beoordelingswachtrij, waar iemand de geëxtraheerde waarde naast het gebied van het document ziet waaruit zij komt, haar zo nodig corrigeert, en haar vrijgeeft.
Twee eigenschappen bepalen of dit werkt. Correcties moeten terugvloeien naar de training, anders treedt dezelfde fout onbeperkt opnieuw op. En de beoordelingsinterface moet sneller zijn dan het document van voren af aan lezen, want als dat niet zo is, kost de wachtrij meer dan het handmatige proces dat zij verving.
Het percentage volledig geautomatiseerde verwerking, het aandeel documenten dat zonder menselijke tussenkomst wordt afgerond, is de maatstaf die vastlegt of de balans juist is. Zie documentworkflowautomatisering.
Wat er vaak misgaat
Nauwkeurigheid wordt over velden gemiddeld. Eén cijfer verbergt welke velden falen. Nauwkeurigheid moet per veld worden gerapporteerd, want het gevolg van een onjuist betaalbedrag is niet het gevolg van een onjuiste omschrijving.
Leeg wordt met ontbrekend verward. Een veld dat het document werkelijk niet bevat en een veld dat de extractie niet heeft gevonden zijn verschillende uitkomsten die verschillende behandeling vragen. Voor beide een lege waarde teruggeven laat dat onderscheid verdwijnen.
Validatie wordt overgeslagen omdat de extractie zeker lijkt. Controles over velden heen vangen wat zekerheid per veld niet kan: totalen die niet kloppen, datums in een onmogelijke volgorde, belasting die niet overeenkomt met het toepasselijke tarief.
Contellect One extraheert velden, tabellen en entiteiten in geavanceerde informatie-extractie.
