Contellect GlossarFragen und handeln

Was ist Retrieval-Augmented Generation?

Generierte Antworten in eigenen Inhalten verankert, mit Berechtigungsprüfung beim Retrieval.

Retrieval-Augmented Generation (RAG) ist eine Technik, bei der ein Sprachmodell relevante Passagen aus einem definierten Inhaltsbestand abruft und sie als Grundlage seiner Antwort verwendet, statt sich auf das zu verlassen, was es während des Trainings gelernt hat.

Der Zweck besteht darin, ein allgemeines Modell Fragen zu spezifischen Inhalten beantworten zu lassen, auf die es nie trainiert wurde, und die Antwort überprüfbar zu machen.

Wie es funktioniert

Eine Frage wird in eine Suche über eine Inhaltssammlung umgewandelt, die üblicherweise semantische Ähnlichkeit mit klassischem Stichwortabgleich kombiniert. Die zurückgelieferten Passagen werden dem Modell zusammen mit der Frage übergeben, und das Modell wird angewiesen, aus diesen Passagen heraus zu antworten.

Inhalte werden im Voraus vorbereitet, indem sie in Abschnitte (Chunks) zerlegt und indexiert werden. Diese Zerlegung hat mehr Gewicht, als es scheint. Zu kleine Abschnitte verlieren den Kontext, der zu ihrer Interpretation nötig ist, zu große verwässern den relevanten Satz durch umgebenden Text. Eine Teilung mitten in einer Tabelle oder mitten in einer Klausel erzeugt Fragmente, die sich gut auffinden lassen, aber beim Lesen in die Irre führen.

Bei gescanntem Material hängt alles davon ab, dass die Inhalte zunächst maschinenlesbar gemacht werden, was optische Zeichenerkennung bedeutet und bei strukturierten Dokumenten zusätzlich Datenextraktion. Ein Retrieval-System über nicht erkannte Bilder findet nichts.

Warum Quellenangaben wichtig sind

Eine RAG-Antwort sollte angeben, aus welchen Passagen sie stammt, und die Quellenangaben sollten nachprüfbar sein statt bloß dekorativ.

Sie erfüllen drei Zwecke. Sie erlauben einer lesenden Person, die Aussage zu überprüfen, was die einzige verlässliche Verteidigung gegen eine selbstsicher vorgetragene, aber falsche Antwort ist. Sie machen das System prüfbar, was regulierte Prozesse verlangen. Und sie legen Retrieval-Fehler offen: Eine Antwort, die eine irrelevante Passage zitiert, zeigt, dass das Problem beim Retrieval liegt, nicht bei der Generierung.

Quellenangaben sind keine Garantie für Korrektheit. Ein Modell kann eine echte Passage zitieren und sie dennoch ungenau zusammenfassen, weshalb die Quellenangabe die Überprüfung unterstützt, statt sie zu ersetzen.

Grounding reduziert Halluzination, beseitigt sie aber nicht

Grounding schränkt den Spielraum des Modells auf den bereitgestellten Text ein, was Erfindungen erheblich reduziert. Es beseitigt sie aber nicht vollständig.

Es lohnt sich, die verbleibenden Fehlerarten zu benennen, denn Verkaufsunterlagen behaupten gern, das Problem sei gelöst. Ein Modell, das nach etwas gefragt wird, das die abgerufenen Passagen nicht beantworten, liefert oft trotzdem eine plausible Antwort, statt abzulehnen. Es kann zwei Passagen zu einer Aussage verschmelzen, die keine von beiden trifft. Und es kann Inhalte wiedergeben, die korrekt abgerufen wurden, aber an der Quelle falsch sind, denn Grounding übernimmt die Genauigkeit der zugrunde liegenden Inhalte.

Gegenmaßnahmen sind eher organisatorischer als technischer Natur: das Modell anweisen abzulehnen, wenn die Passagen nicht ausreichen, die abgerufenen Passagen neben der Antwort anzeigen und den Retrieval-Schritt als wichtigsten Hebel für die Qualität behandeln, denn ein Generierungsfehler, der auf schlechtem Retrieval beruht, lässt sich nicht durch ein besseres Modell beheben.

Zugriffskontrolle muss beim Retrieval durchgesetzt werden

Das ist die Anforderung, die Enterprise-RAG von einer Demonstration unterscheidet, und diejenige, die am häufigsten falsch umgesetzt wird.

Wenn der Index alles enthält und Berechtigungen erst auf die generierte Antwort angewendet werden, hat das System bereits versagt. Das Modell hat Inhalte gesehen, die die Nutzerin möglicherweise nicht sehen darf, und die Antwort ist daraus abgeleitet. Das Filtern der Ausgabe macht das nicht ungeschehen, denn die Zusammenfassung eines eingeschränkten Dokuments ist bereits dessen Offenlegung. Selbst eine Ablehnung kann Informationen preisgeben, indem sie bestätigt, dass ein Dokument existiert.

Das korrekte Verhalten besteht darin, die Berechtigungen der Nutzerin vor dem Retrieval aufzulösen und nur das zu durchsuchen, was sie sehen darf, sodass zwei Nutzer, die dieselbe Frage stellen, je nach ihrem Zugriff unterschiedliche Antworten erhalten. Das erfordert, dass die Retrieval-Schicht das Berechtigungsmodell der durchsuchten Content Services Platform versteht, einschließlich vererbter und gruppenbasierter Rechte, und diese pro Abfrage neu auflöst, statt sie zwischenzuspeichern.

Dieser Fehler lässt sich beim Testen leicht übersehen, denn er tritt nur zutage, wenn ein Test mit geringen Berechtigungen durchgeführt wird. Ein System, das nur von Administratoren getestet wird, wirkt korrekt.

Was häufig schiefgeht

Die Retrieval-Qualität wird nicht gemessen. Teams bewerten Antworten und prüfen nie, ob die richtigen Passagen gefunden wurden, sodass der Generierung die Schuld für Retrieval-Fehler gegeben wird.

Veraltete Inhalte sind indexiert. Ein Index, der nach einem festen Zeitplan neu aufgebaut wird, liefert überholte Dokumente mit voller Zuversicht aus. Gelöschte oder umklassifizierte Inhalte müssen den Index umgehend verlassen, was auch eine Pflicht im Sinne des Records Management ist.

Alles wird indexiert, weil es möglich ist. Entwürfe, Duplikate und überholte Versionen konkurrieren mit dem maßgeblichen Dokument und verschlechtern jede Antwort.

Es gibt keinen Weg zur Quelle. Auf eine Antwort, die eine lesende Person nicht bis zu einem Dokument in seiner ursprünglichen Form zurückverfolgen kann, lässt sich bei einer wichtigen Entscheidung nicht vertrauen.

Contellect One setzt berechtigungsbewusstes Retrieval in Content Intelligence und KI-Insights ein.

Die Definition in die Praxis bringen

Sehen Sie, wie Contellect One Inhalte von der Erfassung bis zur Aktion steuert

Demo anfordern