La retrieval-augmented generation (RAG) è una tecnica in cui un modello linguistico recupera i passaggi rilevanti da un corpo di contenuti definito e li impiega come base per la propria risposta, anziché affidarsi a quanto appreso durante l’addestramento.
La finalità è far sì che un modello generico risponda a domande su contenuti specifici su cui non è mai stato addestrato, e rendere la risposta verificabile.
Come funziona
Una domanda viene convertita in una ricerca su una raccolta di contenuti, combinando di norma la similarità semantica con la corrispondenza per parole chiave tradizionale. I passaggi restituiti vengono forniti al modello insieme alla domanda, e al modello viene richiesto di rispondere a partire da quei passaggi.
I contenuti sono preparati in anticipo suddividendoli in blocchi e indicizzandoli. La suddivisione in blocchi è più determinante di quanto sembri. Blocchi troppo piccoli perdono il contesto necessario per interpretarli; troppo grandi e la frase rilevante viene diluita dal testo circostante. Spezzare a metà di una tabella o di una clausola produce frammenti che si recuperano bene e ingannano alla lettura.
Per il materiale scansionato tutto dipende dal fatto che il contenuto sia prima leggibile dalla macchina, il che significa riconoscimento ottico dei caratteri e, per i documenti strutturati, estrazione dei dati. Un sistema di recupero che opera su immagini non riconosciute non recupera nulla.
Perché le citazioni contano
Una risposta RAG dovrebbe indicare da quali passaggi proviene, e le citazioni dovrebbero essere consultabili anziché decorative.
Servono a tre scopi. Permettono a chi legge di verificare l’affermazione, che è l’unica difesa affidabile contro una risposta sicura e sbagliata. Rendono il sistema verificabile, come richiedono i processi regolamentati. E fanno emergere i fallimenti del recupero: una risposta che cita un passaggio non pertinente rivela che il problema è il recupero, non la generazione.
Le citazioni non sono una garanzia di correttezza. Un modello può citare un passaggio reale e riassumerlo comunque in modo inesatto, quindi la citazione sostiene la verifica anziché sostituirla.
L’ancoraggio riduce le allucinazioni senza eliminarle
L’ancoraggio restringe l’ambito del modello al testo fornito, riducendo sensibilmente l’invenzione. Non la elimina.
Vale la pena nominare le modalità di fallimento residue, perché il materiale dei fornitori tende a sostenere che il problema sia risolto. Un modello a cui si chiede qualcosa a cui i passaggi recuperati non rispondono produrrà spesso comunque una risposta plausibile anziché rifiutare. Può fondere due passaggi in un’affermazione che nessuno dei due sostiene. E può riprodurre contenuti recuperati correttamente ma errati all’origine, poiché l’ancoraggio eredita l’accuratezza dei contenuti sottostanti.
Le mitigazioni sono procedurali più che tecniche: istruire il modello a rifiutare quando i passaggi sono insufficienti, mostrare i passaggi recuperati accanto alla risposta e trattare la fase di recupero come la principale leva di qualità, perché un fallimento della generazione a valle di un recupero scadente non può essere risolto con un modello migliore.
Il controllo degli accessi va applicato al momento del recupero
È questo il requisito che distingue una RAG aziendale da una dimostrazione, ed è quello che viene sbagliato più spesso.
Se l’indice contiene tutto e le autorizzazioni vengono applicate alla risposta generata, il sistema ha già fallito. Il modello ha visto contenuti che l’utente potrebbe non poter vedere, e la risposta ne deriva. Filtrare l’output non annulla il fatto, perché la sintesi di un documento riservato è una sua divulgazione. Perfino un rifiuto può far filtrare informazioni, confermando che un documento esiste.
Il comportamento corretto è risolvere le autorizzazioni dell’utente prima del recupero e cercare solo in ciò che gli è consentito vedere, così che due utenti che pongono la stessa domanda ricevano risposte diverse in base ai propri accessi. Questo richiede che il livello di recupero comprenda il modello di autorizzazioni della piattaforma di content services su cui esegue le ricerche, inclusi i diritti ereditati e derivati dai gruppi, e che li risolva di nuovo a ogni interrogazione anziché memorizzarli in cache.
Il difetto è facile da non notare in fase di test, perché emerge solo quando una prova viene eseguita come utente con privilegi ridotti. Un sistema testato solo dagli amministratori sembra corretto.
Che cosa va storto più spesso
La qualità del recupero non viene misurata. I team valutano le risposte e non verificano mai se sono stati trovati i passaggi giusti, quindi la generazione viene incolpata di fallimenti del recupero.
Vengono indicizzati contenuti obsoleti. Un indice ricostruito a intervalli programmati serve documenti superati con piena sicurezza. I contenuti eliminati o riclassificati devono uscire tempestivamente dall’indice, che è anche un obbligo di gestione dei documenti archivistici.
Si indicizza tutto perché è possibile. Bozze, duplicati e versioni superate competono con il documento autorevole e degradano ogni risposta.
Non esiste un percorso verso la fonte. Una risposta che chi legge non può ricondurre a un documento nella sua forma originale non può essere considerata affidabile per una decisione che conta.
Contellect One applica il recupero con autorizzazioni controllate in intelligenza dei contenuti e insight basati su AI.
