Intelligente Dokumentenverarbeitung (IDP) ist der Einsatz von KI, um unstrukturierte Dokumente in strukturierte, validierte Daten umzuwandeln, auf deren Grundlage nachgelagerte Systeme handeln können.
Der Begriff beschreibt eine Pipeline und keine einzelne Technik. Ein Dokument kommt in einer für Menschen lesbaren Form an, etwa als Scan, Fotografie, PDF oder E-Mail-Anhang, und verlässt den Prozess als Datensatz in einer Datenbank, als Feld in einem Fallmanagementsystem oder als Nachricht in einer Warteschlange. Alles dazwischen ist IDP.
Die Stufen der Pipeline
Eine typische Implementierung durchläuft sechs Stufen: Erfassung, Lesen, Klassifizierung, Extraktion, Validierung und Weiterleitung.
Erfassung sammelt Dokumente aus den Kanälen, die ein Unternehmen tatsächlich nutzt. In der Praxis ist das selten eine einzige Quelle. Gescannte Post, gemeinsame Postfächer, Upload-Portale, SFTP-Ablagen von Partnern und Exporte aus Altsystemen tauchen meist alle im selben Projekt auf.
Lesen wandelt das Dokumentenbild in maschinenlesbaren Text und ein maschinenlesbares Layout um. Hier kommt die optische Zeichenerkennung zum Einsatz, zusammen mit Seitensegmentierung, Tabellenerkennung und Lesereihenfolgenanalyse.
Klassifizierung entscheidet, um was für ein Dokument es sich handelt. Die Dokumentenklassifizierung legt den Typ fest, häufig auch den geschäftlichen Kontext, die Aktenkategorie und die Sensibilität, denn diese Entscheidungen bestimmen alles Weitere.
Extraktion entnimmt die konkreten Werte, die der Prozess benötigt. Die Dokumentendatenextraktion umfasst Kopfdaten, Positionen, Tabellen, Klauseln, Daten, Parteien und Unterschriften.
Validierung prüft die extrahierten Daten gegen Regeln, Referenzdaten und interne Konsistenz. Ein Rechnungsbetrag, der nicht der Summe seiner Positionen entspricht, wird hier erkannt, ebenso ein Lieferant, der im Lieferantenstamm nicht existiert.
Weiterleitung übergibt das Ergebnis an den nächsten Schritt: eine Genehmigung, eine Ausnahmewarteschlange, ein System of Record oder eine manuelle Prüfung.
Wie sich IDP von OCR unterscheidet
Das ist die Unterscheidung, die in Verkaufsunterlagen am häufigsten verwischt wird, und sie ist wichtig. OCR beantwortet die Frage, welche Zeichen auf dieser Seite stehen. IDP beantwortet die Frage, um welches Dokument es sich handelt, was es bedeutet und ob es korrekt ist.
OCR erzeugt Text. IDP erzeugt strukturierte Daten mit einem bekannten Schema, einem Konfidenzwert pro Feld, einem Validierungsergebnis und einem Audit-Trail. Ein System, das bei OCR stehen bleibt, hat ein Bild in eine Wand aus Zeichen verwandelt, die sich leichter durchsuchen, aber nicht leichter automatisch verarbeiten lässt.
In der Praxis besteht der Unterschied aus allem, was OCR nicht leistet: Klassifizierung, Extraktion auf Feldebene, Validierung gegen Geschäftsregeln, Konfidenzbewertung mit Schwellenwerten, Ausnahmebehandlung und Workflow-Integration.
Wie IDP mit RPA zusammenhängt
Robotic Process Automation und IDP ergänzen sich, statt zu konkurrieren. RPA eignet sich gut, um Systeme ohne nutzbare API zu bedienen, indem es deren Oberflächen so bedient, wie es eine Person tun würde. Beim Interpretieren eines unstrukturierten Dokuments ist RPA schwach, denn es gibt keine deterministische Klickfolge, die einen Vertrag liest.
Das übliche Muster ist, dass IDP strukturierte Daten erzeugt und RPA oder eine Workflow-Engine darauf reagiert. Schwierig wird es, wenn Teams RPA allein gegen Dokumente einsetzen, typischerweise mit anfälligem Template-Abgleich, und dann feststellen, dass ein Lieferant, der sein Rechnungslayout ändert, die Automatisierung unbemerkt zum Erliegen bringt.
Was häufig schiefgeht
Genauigkeit wird am falschen Maßstab gemessen. Ein über alle Felder gemittelter Genauigkeitswert verdeckt die Felder, auf die es ankommt. Eine Dokumentreferenz zu 99 Prozent und einen Zahlungsbetrag zu 90 Prozent korrekt zu erfassen, ergibt kein System mit 94 Prozent, sondern ein System, das den falschen Betrag zahlt.
Konfidenzschwellenwerte werden global festgelegt. Ein Schwellenwert, der für eine gedruckte Rechnung funktioniert, ist für ein handschriftliches Formular falsch. Schwellenwerte gehören pro Dokumenttyp und oft pro Feld festgelegt.
Ausnahmebehandlung wird zuletzt entworfen. Die Quote der durchgängigen Verarbeitung liegt nie bei 100 Prozent, weshalb die Erfahrung der prüfenden Person darüber entscheidet, ob das System insgesamt Zeit spart. Eine Warteschlange, die langsamer zu bearbeiten ist als der ursprüngliche manuelle Prozess, macht den Nutzen zunichte.
Trainingsdaten entsprechen nicht der Produktion. Modelle, die auf sauberen Beispielen trainiert wurden, verlieren an Leistung bei den fotografierten, schiefen, teilweise geschwärzten Dokumenten, die in der Realität eintreffen.
Wo es eingesetzt wird
IDP wird überall dort eingesetzt, wo das Dokumentenvolumen hoch und der nachgelagerte Prozess regelbasiert ist: Kreditorenbuchhaltung, Schadenbearbeitung, Kunden-Onboarding und Know-your-Customer-Prüfungen, Kreditvergabe, Handelsdokumentation und Digitalisierungsvorhaben für Akten. Der gemeinsame Faktor ist nicht die Branche, sondern die Kombination aus unstrukturierten Eingaben und einem Prozess, der prüfsicher sein muss.
Contellect One setzt diese Pipeline in der intelligenten Dokumentenverarbeitung um, über die sechs oben beschriebenen Stufen hinweg.
