Glossario ContellectAcquisire e comprendere

Classificazione dei documenti

Stabilire che cosa è un documento, perché il sistema sappia come trattarlo.

La classificazione dei documenti è l’assegnazione di un documento a una o più categorie predefinite, il più delle volte al suo tipo, in modo che l’elaborazione successiva sappia come trattarlo.

La classificazione è la decisione da cui dipende tutto ciò che viene dopo. Regole di estrazione, logiche di validazione, periodo di conservazione, restrizioni di accesso e destinazione di instradamento vengono tutti selezionati in base a ciò che il documento è stato giudicato essere.

Che cosa viene classificato

Il tipo è l’asse più evidente: fattura, ordine di acquisto, contratto, passaporto, estratto conto, bolla di consegna. Raramente è il solo che conta in produzione.

Il contesto di business distingue documenti dello stesso tipo che seguono processi differenti, per esempio una fattura nazionale rispetto a una di importazione, oppure una richiesta di nuovo contratto rispetto a un rinnovo.

La categoria archivistica determina la conservazione. Lo stesso accordo firmato può essere un ordinario documento aziendale oppure un documento archivistico formalmente dichiarato, con un periodo di conservazione previsto per legge. Si veda gestione dei documenti archivistici.

La sensibilità guida il controllo degli accessi e l’oscuramento. Un documento che contiene dati di carte di pagamento o informazioni sanitarie richiede regole di trattamento applicate al momento della classificazione, non dopo che è stato distribuito.

L’esigenza di instradamento viene a volte classificata direttamente, per esempio contrassegnando un documento come soggetto a revisione legale indipendentemente dal suo tipo.

Trattare queste dimensioni come etichette separate, anziché farle rientrare in un’unica tassonomia dei tipi, evita che la tassonomia esploda in modo combinatorio.

Tre approcci, e dove ciascuno viene meno

La classificazione a regole individua parole chiave, espressioni regolari, codici a barre o impronte di impaginazione. È trasparente, poco costosa da eseguire e spiegabile in modo immediato, aspetto che conta negli ambiti regolamentati. È fragile: un fornitore che ridisegna il proprio modello, o una parola chiave che compare in un contesto inatteso, la manda in errore. Le regole restano la scelta corretta quando il segnale è realmente deterministico, come un codice a barre o un identificativo di modulo stampato sulla pagina.

La classificazione con machine learning addestra un modello su esempi etichettati, utilizzando caratteristiche testuali, caratteristiche di impaginazione o entrambe. Generalizza sulle varianti di modello molto meglio delle regole. Richiede dati di addestramento etichettati, peggiora quando i documenti in produzione si allontanano dalla distribuzione di addestramento e i suoi errori sono più difficili da spiegare a un auditor.

La classificazione con large language model utilizza un modello generalista, guidato da prompt o messo a punto, e richiede pochi dati di addestramento specifici, o nessuno. Gestisce bene i tipi di documento inusuali e mai visti prima e può classificare sulla base della semantica anziché delle caratteristiche superficiali. I compromessi sono il costo per documento sui grandi volumi, la latenza, la non determinatezza tra esecuzioni diverse se non viene vincolata, e la tendenza a produrre un’etichetta plausibile per un documento che avrebbe dovuto essere respinto come non classificabile.

La maggior parte dei sistemi in produzione li combina: regole deterministiche dove esiste un marcatore affidabile, un modello addestrato per i tipi noti a grande volume e un LLM come ripiego per la coda lunga.

Perché le soglie vanno definite per tipo di documento

Una soglia di punteggio di confidenza decide quali classificazioni vengono accettate automaticamente e quali passano a una persona. Impostare una sola soglia globale è l’errore di progettazione più comune in questa fase.

La ragione è che il costo di un errore non è uniforme. Classificare erroneamente un opuscolo pubblicitario come bolla di consegna fa perdere qualche secondo. Classificare erroneamente un atto legale come corrispondenza generica può far mancare una scadenza di legge. Il primo caso può essere accettato automaticamente in sicurezza con una confidenza moderata; il secondo merita una revisione anche in presenza di confidenza elevata.

La frequenza delle classi aggrava il problema. Un tipo che compare nel 40 per cento del volume dispone di abbondante segnale di addestramento e di solito di una confidenza reale elevata. Un tipo che compare nello 0,5 per cento ne ha poco, e i suoi valori di confidenza sono meno affidabili a parità di livello numerico.

Le soglie per tipo permettono a un sistema di automatizzare il grosso del volume trattenendo per il giudizio umano i casi rari e quelli con conseguenze rilevanti. Rendono inoltre il punto operativo esplicito e verificabile, anziché nascosto in un unico numero che nessuno è in grado di giustificare.

Gli errori più comuni

Non esiste un esito “non classificabile”. Forzare ogni documento in una categoria garantisce una classificazione errata e sicura di sé per qualsiasi documento realmente nuovo. Un percorso esplicito di rifiuto o revisione è un requisito, non un accessorio.

I file con più documenti vengono ignorati. Un singolo PDF acquisito da scanner contiene spesso più documenti. Senza una suddivisione a livello di pagina prima della classificazione, il file viene etichettato in base a ciò che prevale nella sua prima pagina.

La tassonomia è progettata dalle persone sbagliate. Le categorie definite dai responsabili di processo tendono a essere operative. Le categorie ereditate da una struttura di archiviazione tendono a descrivere dove i documenti erano conservati un tempo, il che non aiuta più.

Contellect One realizza questa fase come classificazione dei documenti con AI.

Dalla definizione alla pratica

Scopri come Contellect One governa i contenuti dall'acquisizione all'azione

Richiedi una demo