Retrieval-augmented generation (RAG) is een techniek waarbij een taalmodel relevante passages ophaalt uit een vastgelegde verzameling content en die passages gebruikt als grondslag voor zijn antwoord, in plaats van te vertrouwen op wat het tijdens de training heeft geleerd.
Het doel is een algemeen model vragen te laten beantwoorden over specifieke content waarop het nooit is getraind, en het antwoord controleerbaar te maken.
Hoe het werkt
Een vraag wordt omgezet naar een zoekopdracht over een contentverzameling, waarbij semantische gelijkenis doorgaans wordt gecombineerd met conventionele vergelijking op zoekwoorden. De passages die terugkomen worden samen met de vraag aan het model aangeboden, en het model krijgt de opdracht uit die passages te antwoorden.
Content wordt vooraf voorbereid door haar in fragmenten te splitsen en die te indexeren. Het splitsen in fragmenten weegt zwaarder dan het lijkt. Fragmenten die te klein zijn verliezen de context die nodig is om ze te interpreteren; zijn ze te groot, dan wordt de relevante zin verdund door de omringende tekst. Splitsen midden in een tabel of midden in een clausule levert fragmenten op die goed worden gevonden en misleiden wanneer ze worden gelezen.
Voor gescand materiaal hangt alles ervan af dat de content eerst machineleesbaar is, en dat betekent optical character recognition en, voor gestructureerde documenten, het extraheren van data. Een retrievalsysteem over niet-herkende afbeeldingen haalt niets op.
Waarom bronvermelding van belang is
Een RAG-antwoord moet vermelden uit welke passages het voortkomt, en die bronvermeldingen moeten te inspecteren zijn en niet decoratief.
Zij dienen drie doelen. Zij stellen een lezer in staat de bewering te verifiëren, wat de enige betrouwbare verdedigingslinie is tegen een zelfverzekerd en onjuist antwoord. Zij maken het systeem controleerbaar, wat gereguleerde processen vereisen. En zij brengen falende retrieval aan het licht: een antwoord dat een irrelevante passage aanhaalt, laat zien dat retrieval het probleem is en niet de generatie.
Bronvermelding is geen garantie voor juistheid. Een model kan een echte passage aanhalen en die toch onnauwkeurig samenvatten, dus bronvermelding ondersteunt verificatie in plaats van haar te vervangen.
Fundering vermindert hallucinatie zonder haar weg te nemen
Fundering beperkt het bereik van het model tot de aangeboden tekst, wat het verzinnen van inhoud wezenlijk vermindert. Zij neemt het niet weg.
De resterende manieren waarop het faalt zijn het benoemen waard, omdat leveranciersmateriaal de neiging heeft te beweren dat het probleem is opgelost. Een model waaraan iets wordt gevraagd dat de opgehaalde passages niet beantwoorden, levert vaak alsnog een plausibel antwoord in plaats van af te zien van een antwoord. Het kan twee passages samenvoegen tot een bewering die geen van beide doet. En het kan content weergeven die correct is opgehaald maar aan de bron onjuist is, aangezien fundering de nauwkeurigheid van de onderliggende content overneemt.
De maatregelen zijn procedureel en niet technisch: geef het model de opdracht af te zien van een antwoord wanneer de passages ontoereikend zijn, toon de opgehaalde passages naast het antwoord, en behandel de retrievalstap als de belangrijkste kwaliteitsknop, want een falende generatie na slechte retrieval valt niet te verhelpen met een beter model.
Autorisatie moet bij retrieval worden afgedwongen
Dit is de eis die RAG in de onderneming onderscheidt van een demonstratie, en de eis die het vaakst verkeerd wordt uitgevoerd.
Als de index alles bevat en rechten op het gegenereerde antwoord worden toegepast, dan heeft het systeem al gefaald. Het model heeft content gezien die de gebruiker mogelijk niet mag zien, en het antwoord is daaruit afgeleid. Het filteren van de uitvoer maakt dat niet ongedaan, want een samenvatting van een beperkt toegankelijk document is een openbaarmaking daarvan. Zelfs een weigering kan informatie prijsgeven, door te bevestigen dat een document bestaat.
Correct gedrag is de rechten van de gebruiker vast te stellen vóór de retrieval en alleen te zoeken in wat zij mogen zien, zodat twee gebruikers die dezelfde vraag stellen verschillende antwoorden ontvangen naar gelang hun toegang. Dat vereist dat de retrievallaag het rechtenmodel begrijpt van het content services platform waarin zij zoekt, inclusief overgeërfde en aan groepen ontleende rechten, en die per zoekopdracht opnieuw vaststelt in plaats van ze te bewaren.
De fout is bij het testen eenvoudig te missen, omdat zij alleen aan het licht komt wanneer een test wordt uitgevoerd als gebruiker met beperkte rechten. Een systeem dat alleen door beheerders is getest, lijkt correct.
Wat er vaak misgaat
De kwaliteit van de retrieval wordt niet gemeten. Teams beoordelen antwoorden en bekijken nooit of de juiste passages zijn gevonden, waardoor de generatie de schuld krijgt van falende retrieval.
Verouderde content wordt geïndexeerd. Een index die volgens een schema opnieuw wordt opgebouwd, dient achterhaalde documenten met volle overtuiging uit. Verwijderde of opnieuw geclassificeerde content moet de index prompt verlaten, wat ook een verplichting is uit recordsmanagement.
Alles wordt geïndexeerd omdat het kan. Concepten, duplicaten en achterhaalde versies concurreren met het gezaghebbende document en verslechteren elk antwoord.
Er is geen route naar de bron. Een antwoord dat een lezer niet kan herleiden tot een document in zijn oorspronkelijke vorm, kan niet worden vertrouwd voor een beslissing die van belang is.
Contellect One past retrieval met rechtenbewustzijn toe in content intelligence en AI-gestuurde inzichten.
