Glossario ContellectAcquisire e comprendere

Estrazione dei dati dai documenti

Individuare ed estrarre campi, tabelle ed entità da un documento.

L’estrazione dei dati dai documenti è l’individuazione e l’acquisizione di valori specifici presenti in un documento, come campi, tabelle, date ed entità nominate, sotto forma di dati strutturati con uno schema definito.

L’estrazione è la fase che produce l’output effettivamente utilizzato da un processo aziendale. Tutto ciò che la precede prepara il documento; tutto ciò che la segue verifica e consegna quanto l’estrazione ha individuato.

Che cosa viene estratto

I campi di testata sono i valori singoli che identificano e datano un documento: numero della fattura, riferimento dell’ordine di acquisto, data di emissione, valuta, totale, nome del fornitore e identificativi fiscali.

Le righe di dettaglio e le tabelle sono strutture ripetitive e risultano molto più difficili dei campi di testata. Una riga di dettaglio può estendersi su più righe, proseguire oltre un salto di pagina, avere un proprio trattamento fiscale o rimandare a un indirizzo di consegna diverso da quello indicato nella testata del documento.

Le clausole hanno rilevanza nei contratti, più che nei documenti transazionali: diritti di recesso, termini di preavviso, limitazioni di responsabilità, legge applicabile, condizioni di rinnovo. L’estrazione delle clausole consiste di norma nell’individuazione di un intervallo di testo più che nell’acquisizione di un valore: restituisce il passaggio e la sua posizione, così che un revisore possa leggerlo nel suo contesto.

Le entità sono le parti, i luoghi, i prodotti e gli identificativi citati in qualunque punto del testo, che possono non corrispondere a un campo etichettato.

Le firme e i segni grafici vengono rilevati anziché letti: se un blocco firma è compilato, se una casella di controllo è barrata, se una sigla compare su ogni pagina.

I metadati sono derivati anziché reperiti: numero di pagine, lingua, canale di acquisizione, punteggio di qualità e i valori di confidenza associati a tutti gli elementi precedenti.

Estrazione basata su template ed estrazione basata su modelli

L’estrazione basata su template definisce dove si collocano i valori, per coordinate assolute oppure in posizione relativa rispetto a un punto di riferimento, come un’etichetta. In presenza di un layout stabile risulta molto accurata, del tutto spiegabile ed economica. La sua modalità di errore non perdona: un fornitore che sposta un campo di un centimetro, aggiunge un logo che disallinea la testata o emette un nuovo template produce silenziosamente valori errati anziché nessun valore.

Il costo nascosto è la manutenzione. Un template per ogni fornitore e per ogni tipo di documento diventa una libreria di centinaia di template, ciascuno da correggere ogni volta che una controparte modifica la propria modulistica. Le organizzazioni tendono a sottovalutare questo aspetto fino a quando la libreria di template è già ingestibile.

L’estrazione basata su modelli apprende dagli esempi come si presenta un campo, utilizzando insieme testo, layout e caratteristiche visive, e riesce così a generalizzare su layout mai visti. Elimina l’onere di manutenzione per singolo fornitore e gestisce la lunga coda di controparti a basso volume, per le quali un template non è mai stato giustificabile.

I compromessi sono reali. Richiede dati di addestramento etichettati. La sua accuratezza sul singolo documento è meno prevedibile di quella di un template corrispondente. E quando sbaglia, spiegarne il motivo a un auditor è più difficile che indicare una regola basata su coordinate.

L’impostazione pratica è a livelli: l’estrazione basata su modelli come scelta predefinita e template mantenuti soltanto dove una controparte ad alto volume presenta un layout davvero stabile e il guadagno di accuratezza giustifica la manutenzione.

Validazione con revisione umana

Nessun sistema di estrazione raggiunge un’accuratezza completa: la domanda progettuale non è quindi se le persone siano coinvolte, ma dove.

L’impostazione consueta instrada i documenti in base alla confidenza. I valori al di sopra di una soglia definita per singolo campo passano automaticamente. I valori al di sotto entrano in coda di revisione, dove una persona vede il valore estratto accanto alla porzione di documento da cui proviene, lo corregge se necessario e lo conferma.

Due caratteristiche determinano il funzionamento di questo schema. Le correzioni devono rientrare nell’addestramento, altrimenti lo stesso errore si ripresenta indefinitamente. E l’interfaccia di revisione deve essere più rapida della lettura del documento da zero, perché in caso contrario la coda costa più del processo manuale che ha sostituito.

Il tasso di elaborazione senza intervento umano, ovvero la quota di documenti che si completano senza alcun intervento manuale, è la metrica che indica se l’equilibrio è corretto. Si veda automazione dei flussi di lavoro documentali.

Gli errori più frequenti

L’accuratezza viene calcolata come media tra i campi. Un unico valore nasconde quali campi non funzionano. L’accuratezza va riportata per singolo campo, perché le conseguenze di un importo di pagamento errato non sono quelle di una descrizione errata.

Il valore vuoto viene confuso con il valore non trovato. Un campo che il documento effettivamente non contiene e un campo che l’estrazione non è riuscita a individuare sono esiti diversi, che richiedono una gestione diversa. Restituire un valore vuoto in entrambi i casi fa perdere questa distinzione.

La validazione viene omessa perché l’estrazione sembra sicura. I controlli incrociati tra campi individuano ciò che la confidenza per singolo campo non può rilevare: totali che non quadrano, date in un ordine impossibile, imposte che non corrispondono all’aliquota applicabile.

Contellect One estrae campi, tabelle ed entità in estrazione avanzata delle informazioni.

Dalla definizione alla pratica

Scopri come Contellect One governa i contenuti dall'acquisizione all'azione

Richiedi una demo