Glossario ContellectAcquisire e comprendere

Punteggio di confidenza

Che cosa indica, e che cosa non indica, il valore di certezza di un modello.

Un punteggio di confidenza, nell’ambito del document AI, è un valore numerico che un modello associa a un output, per indicare la propria stima della probabilità che quell’output sia corretto.

Il punteggio è il meccanismo che rende sicura l’automazione, perché è ciò che un sistema utilizza per decidere quali risultati può accettare senza che una persona li esamini. Capire che cosa il punteggio non significa è più utile che capire che cosa significa.

Che cosa non è un punteggio di confidenza

Non è una probabilità calibrata. Un campo restituito a 0,90 non significa che sia corretto nel 90 per cento dei casi. Gli output grezzi dei modelli sono in genere troppo ottimistici, a volte in misura considerevole, e la relazione tra il numero e l’accuratezza reale deve essere misurata sui documenti della propria organizzazione prima di assumere un qualsiasi significato.

Non è comparabile tra modelli o tra fasi diverse. Un valore di 0,85 prodotto da un motore OCR descrive la certezza sulla forma dei caratteri. Un 0,85 prodotto da un modello di estrazione descrive la certezza che un valore appartenga a un determinato campo. Un 0,85 prodotto da un classificatore descrive la certezza sul tipo di documento. Sono grandezze differenti sulla stessa scala e non possono essere mediate né confrontate.

Non è una misura della correttezza per il motivo giusto. Un modello può avere ragione con grande sicurezza sulla cosa sbagliata, per esempio estraendo dal documento una data reale che non è la data richiesta dal campo. Una confidenza elevata associata a una semantica errata è la modalità di errore che sopravvive ai test superficiali.

Non rileva in modo affidabile ciò che non conosce. In genere i modelli restituiscono valori di confidenza medi o elevati su input diversi da qualsiasi cosa su cui sono stati addestrati, anziché valori utilmente bassi. Per questo un percorso esplicito per i documenti non classificabili conta più che affidarsi ai punteggi bassi per intercettare le novità.

Calibrazione

La calibrazione è il processo con cui i punteggi grezzi vengono messi in relazione con l’accuratezza osservata. Si effettua prendendo un campione rappresentativo ed etichettato, raggruppando le previsioni in fasce di punteggio e misurando quale proporzione di ciascuna fascia era effettivamente corretta.

Il risultato è una tabella che indica il significato di un dato punteggio nel proprio ambiente. Spesso rivela che il confine decisionale utile si colloca in un punto poco intuitivo e che il numero grezzo era sistematicamente ottimistico.

La calibrazione è specifica per ogni ambiente e scade. Deve essere rifatta quando il modello cambia, quando viene aggiunta una nuova fonte documentale importante e periodicamente, al variare della composizione degli input.

Il modello a tre zone

La maggior parte dei sistemi in produzione suddivide l’intervallo dei punteggi in tre zone anziché in due.

Accettazione automatica, sopra una soglia superiore, procede senza intervento umano. Questa zona va definita a partire dai dati di calibrazione, in base all’accuratezza che il processo richiede realmente, e non su un numero tondo.

Revisione umana, tra le due soglie, mette il documento in coda per una persona. Chi effettua la revisione vede il valore accanto alla porzione di documento da cui proviene e lo conferma oppure lo corregge.

Rifiuto o reindirizzamento, sotto una soglia inferiore, non passa dalla normale coda di revisione. Una confidenza molto bassa indica di solito un problema nell’input più che un giudizio incerto: un tipo di documento errato, una scansione illeggibile, una pagina bianca. Inviare questi casi nella stessa coda di quelli realmente incerti rallenta chi effettua la revisione con lavoro che avrebbe dovuto essere restituito al mittente o acquisito di nuovo.

Due soglie anziché una: è questo che distingue una coda di cui chi revisiona si fida da una che impara a scorrere in fretta.

Come le soglie determinano l’elaborazione senza intervento umano

Il tasso di elaborazione senza intervento umano, ossia la proporzione di documenti che si completano senza alcun tocco umano, è funzione diretta del punto in cui è collocata la soglia superiore. Abbassarla aumenta l’automazione e aumenta il tasso di errore; alzarla produce l’effetto opposto.

Questo rende la soglia una decisione di business più che tecnica, e va definita a partire dal costo di ciascun tipo di errore. Una descrizione errata su una riga di acquisto è un fastidio minore. Un conto bancario errato su una disposizione di pagamento è una perdita. Questi campi non possono stare alla stessa soglia: è la ragione per cui le soglie vengono impostate per campo e per tipo di documento anziché globalmente. Si veda classificazione dei documenti ed estrazione dei dati dai documenti.

Gli errori più comuni

Una sola soglia globale. Un unico valore applicato a tutti i campi e a tutti i tipi finisce per automatizzare troppo i campi che hanno conseguenze rilevanti, oppure per automatizzare troppo poco tutto il resto.

Soglie impostate una volta e mai riviste. La composizione degli input cambia, i modelli vengono aggiornati e un punto operativo definito all’avvio smette di essere quello giusto.

Confidenza mostrata a chi revisiona come percentuale. Presentare un valore non calibrato di 0,92 come “92% di confidenza” induce chi effettua la revisione a trattarlo come una probabilità e ad approvarlo di conseguenza senza verificarlo.

Aggregazione delle confidenze dei campi in un punteggio del documento. Un documento non è riassunto in modo utile dalla media delle confidenze dei suoi campi, perché un singolo campo critico con confidenza bassa conta più di venti campi con confidenza elevata.

Contellect One applica soglie per singolo campo nella fase di validazione dell’elaborazione documentale intelligente.

Dalla definizione alla pratica

Scopri come Contellect One governa i contenuti dall'acquisizione all'azione

Richiedi una demo