Dokumentendatenextraktion ist das Erkennen und Erfassen bestimmter Werte aus einem Dokument, etwa Felder, Tabellen, Daten und benannte Entitäten, als strukturierte Daten mit einem festgelegten Schema.
Extraktion ist die Stufe, die das Ergebnis liefert, das ein Geschäftsprozess tatsächlich verwendet. Alles davor bereitet das Dokument vor, alles danach prüft und liefert aus, was die Extraktion gefunden hat.
Was extrahiert wird
Kopffelder sind die einzelnen Werte, die ein Dokument identifizieren und datieren: Rechnungsnummer, Bestellreferenz, Ausstellungsdatum, Währung, Gesamtbetrag, Lieferantenname und Steuerkennungen.
Positionen und Tabellen sind sich wiederholende Strukturen und deutlich schwieriger als Kopffelder. Eine Position kann sich über mehrere Zeilen erstrecken, über einen Seitenumbruch hinweg fortsetzen, eine eigene steuerliche Behandlung tragen oder eine andere Lieferadresse referenzieren als der Dokumentenkopf.
Klauseln sind bei Verträgen relevant, nicht bei Transaktionsdokumenten: Kündigungsrechte, Fristen, Haftungsobergrenzen, anwendbares Recht, Verlängerungsbedingungen. Die Klauselextraktion identifiziert meist eine Textstelle, statt einen Wert zu erfassen, und liefert die Passage samt ihrer Fundstelle, damit eine prüfende Person sie im Kontext lesen kann.
Entitäten sind die Parteien, Orte, Produkte und Kennungen, die irgendwo im Text genannt werden und nicht unbedingt einem gekennzeichneten Feld entsprechen.
Unterschriften und Markierungen werden erkannt, nicht gelesen: ob ein Unterschriftenfeld ausgefüllt ist, ob ein Kontrollkästchen angekreuzt ist, ob auf jeder Seite ein Kürzel steht.
Metadaten werden abgeleitet, nicht gefunden: Seitenzahl, Sprache, Erfassungskanal, Qualitätswert und die Konfidenzwerte, die allem oben Genannten zugeordnet sind.
Vorlagenbasierte versus modellbasierte Extraktion
Vorlagenbasierte Extraktion legt fest, wo Werte stehen, entweder über absolute Koordinaten oder relativ zu einem Ankerpunkt wie einer Beschriftung. Bei einem stabilen Layout ist sie hochgenau, vollständig nachvollziehbar und kostengünstig. Ihr Fehlermodus ist unnachsichtig: Verschiebt ein Lieferant ein Feld um einen Zentimeter, fügt ein Logo hinzu, das den Kopfbereich verschiebt, oder gibt eine neue Vorlage aus, entstehen still falsche statt fehlende Werte.
Die versteckten Kosten liegen in der Pflege. Eine Vorlage pro Lieferant und Dokumenttyp summiert sich zu Hunderten Vorlagen, von denen jede repariert werden muss, sobald eine Gegenpartei ihre Unterlagen ändert. Unternehmen unterschätzen das häufig, bis die Vorlagenbibliothek bereits unüberschaubar geworden ist.
Modellbasierte Extraktion lernt anhand von Beispielen, wie ein Feld aussieht, unter gemeinsamer Nutzung von Text-, Layout- und visuellen Merkmalen, sodass sie sich auf ungesehene Layouts verallgemeinern lässt. Sie beseitigt den lieferantenspezifischen Pflegeaufwand und deckt den langen Rest an Gegenparteien mit geringem Volumen ab, für die sich nie eine eigene Vorlage gelohnt hätte.
Ihre Nachteile sind real. Sie benötigt gekennzeichnete Trainingsdaten. Ihre Genauigkeit bei einem einzelnen Dokument ist weniger vorhersehbar als bei einer passenden Vorlage. Und liegt sie falsch, ist die Erklärung gegenüber einem Prüfer schwieriger, als auf eine Koordinatenregel zu verweisen.
Das gängige Muster ist mehrstufig: modellbasierte Extraktion als Standard, wobei Vorlagen nur dort beibehalten werden, wo eine Gegenpartei mit hohem Volumen ein wirklich stabiles Layout hat und der Genauigkeitsgewinn den Pflegeaufwand rechtfertigt.
Validierung im Human-in-the-Loop
Kein Extraktionssystem erreicht vollständige Genauigkeit, weshalb die Designfrage nicht lautet, ob Menschen beteiligt sind, sondern wo.
Üblicherweise werden Dokumente nach Konfidenz weitergeleitet. Werte oberhalb eines feldspezifischen Schwellenwerts laufen automatisch durch. Werte darunter reihen sich in eine Prüfwarteschlange ein, in der eine Person den extrahierten Wert zusammen mit der Stelle im Dokument sieht, aus der er stammt, ihn bei Bedarf korrigiert und freigibt.
Zwei Eigenschaften entscheiden, ob das funktioniert. Korrekturen müssen ins Training zurückfließen, sonst wiederholt sich derselbe Fehler unbegrenzt. Und die Prüfoberfläche muss schneller sein als das Dokument von Grund auf zu lesen, denn sonst kostet die Warteschlange mehr als der manuelle Prozess, den sie ersetzt hat.
Die Quote der durchgängigen Verarbeitung, also der Anteil der Dokumente, die ohne menschliches Zutun abgeschlossen werden, ist die Kennzahl, die zeigt, ob die Balance stimmt. Siehe Dokumenten-Workflow-Automatisierung.
Was häufig schiefgeht
Genauigkeit wird über Felder gemittelt. Eine einzelne Zahl verdeckt, welche Felder versagen. Genauigkeit muss pro Feld ausgewiesen werden, denn die Folge eines falschen Zahlungsbetrags ist nicht dieselbe wie die Folge einer falschen Beschreibung.
Leer wird mit fehlend verwechselt. Ein Feld, das im Dokument tatsächlich nicht vorhanden ist, und ein Feld, das die Extraktion nicht finden konnte, sind unterschiedliche Ergebnisse, die unterschiedlich behandelt werden müssen. Für beide einen leeren Wert zurückzugeben, verwischt diesen Unterschied.
Validierung wird übersprungen, weil die Extraktion sicher wirkt. Feldübergreifende Prüfungen erfassen, was feldbezogene Konfidenz nicht erfassen kann: Summen, die nicht aufgehen, Daten in unmöglicher Reihenfolge, Steuerbeträge, die nicht zum geltenden Satz passen.
Contellect One extrahiert Felder, Tabellen und Entitäten im Bereich erweiterte Informationsextraktion.
