Intelligent document processing (IDP) is het gebruik van AI om ongestructureerde documenten om te zetten naar gestructureerde, gevalideerde data waarop volgende systemen kunnen handelen.
De term beschrijft een keten en geen enkele techniek. Een document komt binnen in een voor mensen leesbare vorm, zoals een scan, een fotografische opname, een PDF of een e-mailbijlage, en verlaat de keten als records in een database, velden in een zaaksysteem, of een bericht op een wachtrij. Alles tussen die twee punten is IDP.
De fasen van de keten
Een typische implementatie doorloopt zes fasen: aanleveren, lezen, classificeren, extraheren, valideren en routeren.
Aanleveren haalt documenten op uit de kanalen die een organisatie werkelijk gebruikt. In de praktijk is dat zelden één bron. Gescande post, gedeelde mailboxen, uploadportalen, SFTP-leveringen van partners en exports uit oude systemen komen doorgaans allemaal in hetzelfde project voor.
Lezen zet de documentafbeelding om naar machineleesbare tekst en opmaak. Hier zit optical character recognition, samen met paginasegmentatie, tabeldetectie en leesvolgordeanalyse.
Classificeren bepaalt wat het document is. Documentclassificatie stelt het type vast, en vaak ook de bedrijfscontext, de categorie archiefstuk en de gevoeligheid, omdat die beslissingen alles bepalen wat erna komt.
Extraheren haalt de specifieke waarden op die het proces nodig heeft. Het extraheren van documentdata omvat kopvelden, regelposten, tabellen, clausules, datums, partijen en ondertekeningen.
Valideren toetst de geëxtraheerde data aan regels, referentiedata en interne consistentie. Een factuurtotaal dat niet gelijk is aan de som van de regels wordt hier gevangen, net als een leverancier die niet in het leveranciersbestand bestaat.
Routeren geeft het resultaat door aan wat er daarna komt: een goedkeuring, een uitzonderingswachtrij, een administratief bronsysteem, of een menselijke beoordelaar.
Waarin IDP zich onderscheidt van OCR
Dit is het onderscheid dat in leveranciersmateriaal het vaakst wordt weggelaten, en het is van belang. OCR beantwoordt de vraag welke tekens op deze pagina staan. IDP beantwoordt de vraag wat dit document is, wat het betekent, en of het juist is.
OCR levert tekst. IDP levert gestructureerde data met een bekend schema, een zekerheidswaarde per veld, een validatie-uitkomst en een auditspoor. Een systeem dat bij OCR ophoudt heeft een afbeelding omgezet naar een muur van tekens, die eenvoudiger te doorzoeken is en niet eenvoudiger automatisch te verwerken.
In de praktijk is het verschil alles wat OCR niet doet: classificatie, extractie op veldniveau, validatie tegen bedrijfsregels, zekerheidswaarden met drempelwaarden, het behandelen van uitzonderingen en integratie met workflows.
Hoe IDP zich verhoudt tot RPA
Robotic process automation en IDP zijn aanvullend en niet concurrerend. RPA is goed in het aansturen van systemen die geen bruikbare API hebben, door hun interfaces te bedienen zoals een mens dat zou doen. RPA is slecht in het interpreteren van een ongestructureerd document, omdat er geen deterministische reeks kliks bestaat die een contract leest.
Het gebruikelijke patroon is dat IDP gestructureerde data oplevert en dat RPA of een workflowengine daarop handelt. Waar teams in moeilijkheden komen, is bij het inzetten van RPA op zichzelf tegen documenten, doorgaans met kwetsbare vergelijking op templates, om daarna te ontdekken dat een leverancier die haar factuuropmaak wijzigt de automatisering stilzwijgend onderbreekt.
Wat er vaak misgaat
Nauwkeurigheid wordt aan het verkeerde gemeten. Een cijfer voor nauwkeurigheid op veldniveau dat over alle velden is gemiddeld, verbergt de velden die van belang zijn. Een documentreferentie 99 procent van de tijd juist hebben en een betaalbedrag 90 procent van de tijd juist hebben is geen systeem van 94 procent, het is een systeem dat het verkeerde bedrag gaat betalen.
Drempelwaarden voor zekerheid worden globaal ingesteld. Een drempelwaarde die werkt voor een gedrukte factuur is verkeerd voor een handgeschreven formulier. Drempelwaarden horen per documenttype en vaak per veld te worden vastgesteld.
Het behandelen van uitzonderingen wordt als laatste ontworpen. Het percentage volledig geautomatiseerde verwerking is nooit 100 procent, dus de ervaring van de beoordelaar bepaalt of het systeem in totaal tijd bespaart. Een wachtrij die langzamer te bewerken is dan het oorspronkelijke handmatige proces neemt het voordeel weg.
Trainingsdata komt niet overeen met de productiepraktijk. Modellen die op schone voorbeelden zijn gebouwd, verslechteren op de gefotografeerde, scheefstaande, gedeeltelijk geanonimiseerde documenten die in werkelijkheid binnenkomen.
Waar het wordt gebruikt
IDP wordt toegepast waar het documentvolume hoog is en het volgende proces door regels wordt bepaald: crediteurenadministratie, schadebehandeling, klantacceptatie en know-your-customer-controles, kredietverstrekking, handelsdocumentatie, en digitaliseringsprogramma voor archieven. De gemeenschappelijke factor is niet de sector maar de combinatie van ongestructureerde invoer en een proces dat controleerbaar moet zijn.
Contellect One realiseert deze keten in intelligent document processing, over de zes hierboven beschreven fasen.
