Een confidence score in document-AI is een numerieke waarde die een model aan een uitkomst hangt en die aangeeft hoe waarschijnlijk het model die uitkomst zelf correct acht.
De score is het mechanisme dat automatisering veilig maakt, want een systeem gebruikt hem om te bepalen welke resultaten het zonder menselijke tussenkomst kan accepteren. Begrijpen wat de score niet betekent is nuttiger dan begrijpen wat hij wel betekent.
Wat een confidence score niet is
Het is geen gekalibreerde kans. Een veld dat met 0,90 wordt teruggegeven, is niet in 90 procent van de gevallen correct. Ruwe modeluitkomsten zijn doorgaans te zelfverzekerd, soms aanzienlijk, en de relatie tussen het getal en de werkelijke nauwkeurigheid moet op uw eigen documenten worden gemeten voordat hij iets betekent.
Het is niet vergelijkbaar tussen modellen of processtappen. Een 0,85 van een OCR-engine beschrijft zekerheid over lettervormen. Een 0,85 van een extractiemodel beschrijft zekerheid dat een waarde bij een veld hoort. Een 0,85 van een classificatiemodel beschrijft zekerheid over het documenttype. Het zijn verschillende grootheden op dezelfde schaal en ze kunnen niet worden gemiddeld of vergeleken.
Het is geen maat voor correctheid om de juiste reden. Een model kan met grote zekerheid het verkeerde antwoord geven, bijvoorbeeld door een echte datum uit het document te halen die niet de datum is waar het veld om vroeg. Hoge zekerheid met verkeerde semantiek is de faalwijze die naïef testen overleeft.
Het herkent het onbekende niet betrouwbaar. Modellen geven op invoer die niet lijkt op hun trainingsmateriaal doorgaans middelmatige tot hoge zekerheid terug, in plaats van bruikbaar lage waarden. Daarom is een expliciet pad voor niet-classificeerbare documenten belangrijker dan vertrouwen op lage scores om nieuwigheid te betrappen.
Kalibratie
Kalibratie is het proces waarbij ruwe scores worden gekoppeld aan waargenomen nauwkeurigheid. Het gebeurt door een representatieve gelabelde steekproef te nemen, voorspellingen in scorebanden te groeperen en te meten welk aandeel in elke band daadwerkelijk correct was.
De uitkomst is een tabel die vertelt wat een bepaalde score in uw omgeving betekent. Vaak blijkt daaruit dat de bruikbare beslisgrens op een onverwachte plek ligt en dat het ruwe getal systematisch te optimistisch was.
Kalibratie is omgevingsspecifiek en verloopt. Ze moet opnieuw worden gedaan wanneer het model verandert, wanneer een grote nieuwe documentbron wordt toegevoegd, en periodiek terwijl de samenstelling van de invoer verschuift.
Het drie-zonemodel
De meeste productiesystemen verdelen het scorebereik in drie zones in plaats van twee.
Automatisch accepteren, boven een bovengrens, gaat door zonder menselijke tussenkomst. Deze zone moet worden bepaald op basis van kalibratiegegevens en de nauwkeurigheid die het proces werkelijk vereist, niet op een rond getal.
Menselijke beoordeling, tussen de twee drempelwaarden, komt in een wachtrij voor een medewerker. De beoordelaar ziet de waarde naast het deel van het document waaruit ze komt en bevestigt of corrigeert die.
Afwijzen of omleiden, onder een ondergrens, gaat niet naar de gewone beoordelingswachtrij. Zeer lage zekerheid duidt meestal op een probleem met de invoer in plaats van op een grensgeval: het verkeerde documenttype, een onleesbare scan, een blanco pagina. Deze naar dezelfde wachtrij sturen als echte grensgevallen vertraagt beoordelaars met werk dat naar de afzender terug had moeten gaan of opnieuw had moeten worden vastgelegd.
Twee drempelwaarden in plaats van één is wat het verschil maakt tussen een wachtrij die beoordelaars vertrouwen en een die ze leren doorbladeren.
Hoe drempelwaarden straight-through processing bepalen
Het percentage straight-through processing, het aandeel documenten dat zonder menselijke tussenkomst wordt afgerond, is een directe functie van waar de bovengrens ligt. Verlagen verhoogt de automatisering en verhoogt het foutpercentage; verhogen doet het omgekeerde.
Daarmee is de drempelwaarde een zakelijke keuze en geen technische, en ze moet worden bepaald op basis van de kosten van elk fouttype. Een verkeerde omschrijving op een inkoopregel is een kleine ergernis. Een verkeerd bankrekeningnummer op een betaalopdracht is een verlies. Die velden horen niet op dezelfde drempelwaarde, en daarom worden drempelwaarden per veld en per documenttype ingesteld in plaats van globaal. Zie documentclassificatie en documentdata-extractie.
Wat er vaak misgaat
Een enkele globale drempelwaarde. Een enkele waarde voor alle velden en alle typen automatiseert de kritieke velden te veel of al het overige te weinig.
Drempelwaarden die eenmaal worden ingesteld en nooit worden herzien. De samenstelling van de invoer verschuift, modellen worden bijgewerkt, en een werkpunt dat bij livegang klopte is dat later niet meer.
Zekerheid die als percentage aan beoordelaars wordt getoond. Een ongekalibreerde 0,92 tonen als “92% zeker” verleidt beoordelaars ertoe die als kans te behandelen en er een stempel op te zetten.
Veldzekerheden samenvoegen tot een documentscore. Een document wordt niet zinvol samengevat door het gemiddelde van zijn veldzekerheden, want een enkel kritiek veld met lage zekerheid weegt zwaarder dan twintig velden met hoge zekerheid.
Contellect One past drempelwaarden per veld toe in de validatiestap van intelligente documentverwerking.
