Contellect GlossarErfassen und verstehen

Was ist Dokumentenklassifizierung?

Festlegen, was ein Dokument ist, damit das System weiß, was zu tun ist.

Dokumentenklassifizierung ist die Zuordnung eines Dokuments zu einer oder mehreren vordefinierten Kategorien, meist zu seinem Typ, damit die nachgelagerte Verarbeitung weiß, wie damit umzugehen ist.

Klassifizierung ist die Entscheidung, von der alles Nachfolgende abhängt. Extraktionsregeln, Validierungslogik, Aufbewahrungsfrist, Zugriffsbeschränkungen und Weiterleitungsziel werden alle danach ausgewählt, als was das Dokument erkannt wurde.

Was klassifiziert wird

Der Typ ist die naheliegende Achse: Rechnung, Bestellung, Vertrag, Reisepass, Kontoauszug, Lieferschein. Im Produktivbetrieb ist er selten die einzige Achse, die zählt.

Geschäftskontext unterscheidet Dokumente desselben Typs, die unterschiedlichen Prozessen folgen, etwa eine inländische gegenüber einer Import-Rechnung oder ein Neuantrag gegenüber einem Verlängerungsantrag.

Aktenkategorie bestimmt die Aufbewahrung. Derselbe unterzeichnete Vertrag kann eine gewöhnliche Geschäftsunterlage oder eine formal erklärte Akte mit gesetzlicher Aufbewahrungsfrist sein. Siehe Records Management.

Sensitivität bestimmt Zugriffskontrolle und Schwärzung. Ein Dokument mit Zahlungskartendaten oder Gesundheitsinformationen braucht Handhabungsregeln bereits im Moment der Klassifizierung, nicht erst nach der Verteilung.

Weiterleitungsbedarf wird manchmal direkt klassifiziert, etwa indem ein Dokument unabhängig von seinem Typ als rechtlich prüfungspflichtig markiert wird.

Diese als eigene Kennzeichnungen zu behandeln, statt sie in eine einzige Typtaxonomie zu integrieren, verhindert, dass die Taxonomie kombinatorisch explodiert.

Drei Ansätze, und wo jeder an Grenzen stößt

Regelbasierte Klassifizierung sucht nach Schlüsselwörtern, regulären Ausdrücken, Barcodes oder Layout-Fingerabdrücken. Sie ist transparent, günstig im Betrieb und ohne weiteres nachvollziehbar, was in regulierten Umgebungen zählt. Sie ist zerbrechlich: Ein Lieferant, der seine Vorlage neu gestaltet, oder ein Schlüsselwort, das in einem unerwarteten Kontext auftaucht, bringt sie zum Scheitern. Regeln bleiben die richtige Wahl, wenn das Signal wirklich deterministisch ist, etwa ein Barcode oder eine auf der Seite aufgedruckte Formularkennung.

Machine-Learning-Klassifizierung trainiert ein Modell anhand gekennzeichneter Beispiele, mit Text-Merkmalen, Layout-Merkmalen oder beidem. Sie verallgemeinert über Vorlagenvariationen hinweg deutlich besser als Regeln. Sie benötigt gekennzeichnete Trainingsdaten, ihre Leistung sinkt, wenn produktive Dokumente von der Trainingsverteilung abweichen, und ihre Fehler lassen sich einem Prüfer schwerer erklären.

Large-Language-Model-Klassifizierung nutzt ein allgemeines Modell, per Prompt gesteuert oder feinabgestimmt, und benötigt wenig bis gar keine aufgabenspezifischen Trainingsdaten. Sie kommt gut mit ungewöhnlichen und bisher nicht gesehenen Dokumenttypen zurecht und kann nach Bedeutung statt nach Oberflächenmerkmalen klassifizieren. Der Preis dafür sind Kosten pro Dokument bei hohem Volumen, Latenz, Nichtdeterminismus zwischen Durchläufen, sofern nicht eingeschränkt, und die Neigung, für ein Dokument, das eigentlich als nicht klassifizierbar hätte abgelehnt werden müssen, eine plausible Kennzeichnung zu erzeugen.

Die meisten Produktivsysteme kombinieren alle drei: deterministische Regeln, wo ein verlässliches Merkmal existiert, ein trainiertes Modell für die bekannten Typen mit hohem Volumen, und ein LLM als Rückfalllösung für den langen Rest.

Warum Schwellenwerte je Dokumenttyp gehören

Ein Schwellenwert für den Konfidenzwert entscheidet, welche Klassifizierungen automatisch akzeptiert werden und welche an eine Person gehen. Einen einzigen globalen Schwellenwert festzulegen ist der häufigste Designfehler in dieser Stufe.

Der Grund dafür ist, dass die Kosten eines Fehlers nicht einheitlich sind. Eine Marketingbroschüre fälschlich als Lieferschein einzustufen, kostet ein paar Sekunden. Eine rechtliche Mitteilung fälschlich als allgemeine Korrespondenz einzustufen, kann eine gesetzliche Frist verstreichen lassen. Ersteres kann bei mittlerer Konfidenz gefahrlos automatisch akzeptiert werden, Letzteres verlangt selbst bei hoher Konfidenz eine Prüfung.

Die Häufigkeit der Klasse verstärkt das noch. Ein Typ, der 40 Prozent des Volumens ausmacht, verfügt über reichlich Trainingssignal und hat meist eine hohe echte Konfidenz. Ein Typ, der nur 0,5 Prozent ausmacht, hat davon wenig, und seine Konfidenzwerte sind bei derselben Zahl weniger vertrauenswürdig.

Typspezifische Schwellenwerte erlauben es einem System, die Masse zu automatisieren und gleichzeitig das Seltene und Folgenreiche für die menschliche Beurteilung zurückzuhalten. Sie machen den Betriebspunkt außerdem explizit und überprüfbar, statt ihn in einer einzigen Zahl zu verstecken, die niemand begründen kann.

Was häufig schiefgeht

Es gibt kein Ergebnis für nicht klassifizierbar. Jedes Dokument in eine Kategorie zu zwingen, garantiert die selbstsichere Fehleinordnung von allem wirklich Neuartigen. Ein expliziter Pfad für Ablehnung oder Prüfung ist eine Notwendigkeit, keine Annehmlichkeit.

Dateien mit mehreren Dokumenten werden ignoriert. Ein einzelnes gescanntes PDF enthält häufig mehrere Dokumente. Ohne eine seitenweise Aufteilung vor der Klassifizierung wird die Datei nach dem gekennzeichnet, was ihre erste Seite dominiert.

Die Taxonomie wird von den falschen Personen entworfen. Von Prozessverantwortlichen definierte Kategorien sind meist handlungsleitend. Von einer Ablagestruktur geerbte Kategorien beschreiben meist, wo Dokumente früher abgelegt wurden, was nicht mehr weiterhilft.

Contellect One setzt diese Stufe als KI-gestützte Dokumentenklassifizierung um.

Die Definition in die Praxis bringen

Sehen Sie, wie Contellect One Inhalte von der Erfassung bis zur Aktion steuert

Demo anfordern