Contellect GlossarErfassen und verstehen

Was ist ein Konfidenzwert?

Was der Sicherheitswert eines Modells aussagt und was nicht.

Ein Konfidenzwert in der Dokumenten-KI ist ein numerischer Wert, den ein Modell einer Ausgabe zuweist und der die eigene Einschätzung des Modells angibt, wie wahrscheinlich diese Ausgabe korrekt ist.

Der Wert ist der Mechanismus, der Automatisierung sicher macht, denn ein System nutzt ihn, um zu entscheiden, welche Ergebnisse es ohne menschliche Prüfung akzeptieren kann. Zu verstehen, was er nicht bedeutet, ist nützlicher als zu verstehen, was er bedeutet.

Was ein Konfidenzwert nicht ist

Er ist keine kalibrierte Wahrscheinlichkeit. Ein Feld mit dem Wert 0,90 bedeutet nicht, dass es in 90 Prozent der Fälle korrekt ist. Rohe Modellausgaben sind in der Regel zu selbstsicher, mitunter deutlich, und der Zusammenhang zwischen der Zahl und der tatsächlichen Genauigkeit muss erst an den eigenen Dokumenten gemessen werden, bevor er aussagekräftig ist.

Er ist nicht über Modelle oder Verarbeitungsstufen hinweg vergleichbar. Ein Wert von 0,85 einer OCR-Engine beschreibt die Sicherheit über Zeichenformen. Ein Wert von 0,85 eines Extraktionsmodells beschreibt die Sicherheit, dass ein Wert zu einem Feld gehört. Ein Wert von 0,85 eines Klassifikators beschreibt die Sicherheit über den Dokumenttyp. Es handelt sich um unterschiedliche Größen auf derselben Skala, die sich weder mitteln noch vergleichen lassen.

Er ist kein Maß dafür, ob die Korrektheit aus dem richtigen Grund vorliegt. Ein Modell kann mit hoher Sicherheit das Falsche richtig erkennen, etwa indem es ein tatsächlich im Dokument vorhandenes Datum extrahiert, das aber nicht das vom Feld verlangte Datum ist. Hohe Konfidenz bei falscher Bedeutung ist der Fehlermodus, der einfache Tests unbeschadet übersteht.

Er erkennt Unbekanntes nicht zuverlässig. Bei Eingaben, die nichts mit den Trainingsdaten gemein haben, liefern Modelle in der Regel mittlere bis hohe statt hilfreich niedrige Werte. Deshalb ist ein expliziter Pfad für nicht klassifizierbare Fälle wichtiger, als sich darauf zu verlassen, dass niedrige Werte Neuartiges zuverlässig erkennen.

Kalibrierung

Kalibrierung ist der Prozess, rohe Werte auf die beobachtete Genauigkeit abzubilden. Dazu wird eine repräsentative, gekennzeichnete Stichprobe herangezogen, die Vorhersagen werden in Wertebänder gruppiert, und es wird gemessen, welcher Anteil in jedem Band tatsächlich korrekt war.

Das Ergebnis ist eine Tabelle, die zeigt, was ein bestimmter Wert in der eigenen Umgebung bedeutet. Häufig zeigt sich, dass die sinnvolle Entscheidungsgrenze an einer unerwarteten Stelle liegt und dass die rohe Zahl systematisch zu optimistisch war.

Kalibrierung ist umgebungsspezifisch und verliert mit der Zeit an Gültigkeit. Sie muss wiederholt werden, wenn sich das Modell ändert, wenn eine bedeutende neue Dokumentenquelle hinzukommt und in regelmäßigen Abständen, wenn sich die Zusammensetzung der Eingaben verschiebt.

Das Drei-Zonen-Muster

Die meisten Produktivsysteme unterteilen den Wertebereich in drei statt in zwei Zonen.

Automatische Annahme oberhalb eines oberen Schwellenwerts läuft ohne menschliche Beteiligung durch. Diese Zone sollte anhand von Kalibrierungsdaten auf die Genauigkeit festgelegt werden, die der Prozess tatsächlich braucht, nicht auf eine runde Zahl.

Manuelle Prüfung zwischen den Schwellenwerten reiht sich in eine Warteschlange für eine prüfende Person ein. Der Prüfer sieht den Wert zusammen mit der Stelle im Dokument, aus der er stammt, und bestätigt oder korrigiert ihn.

Ablehnung oder Umleitung unterhalb eines unteren Schwellenwerts gelangt nicht in die normale Prüfwarteschlange. Sehr niedrige Konfidenz deutet meist auf ein Problem mit der Eingabe hin und nicht auf einen echten Grenzfall: den falschen Dokumenttyp, einen unlesbaren Scan, eine leere Seite. Werden solche Fälle in dieselbe Warteschlange wie echte Grenzfälle gegeben, verlangsamt das die Prüfenden mit Arbeit, die eigentlich an den Absender hätte zurückgehen oder neu erfasst werden müssen.

Zwei Schwellenwerte statt einem sind der Unterschied zwischen einer Warteschlange, der Prüfende vertrauen, und einer, die sie nur noch überfliegen.

Wie Schwellenwerte die durchgängige Verarbeitung steuern

Die Quote der durchgängigen Verarbeitung, also der Anteil der Dokumente, die ohne menschliches Zutun abgeschlossen werden, hängt unmittelbar davon ab, wo der obere Schwellenwert liegt. Senkt man ihn, steigen sowohl der Automatisierungsgrad als auch die Fehlerquote; hebt man ihn an, gilt das Gegenteil.

Damit ist der Schwellenwert eine geschäftliche und keine rein technische Entscheidung, und er sollte anhand der Kosten jeder Fehlerart festgelegt werden. Eine falsche Bezeichnung auf einer Bestellposition ist ein kleines Ärgernis. Ein falsches Bankkonto auf einer Zahlungsanweisung ist ein finanzieller Verlust. Diese Felder gehören nicht zum selben Schwellenwert, weshalb Schwellenwerte pro Feld und pro Dokumenttyp und nicht global festgelegt werden. Siehe Dokumentenklassifizierung und Dokumentendatenextraktion.

Was häufig schiefgeht

Ein einziger globaler Schwellenwert. Ein einzelner Wert für alle Felder und Typen automatisiert entweder die folgenreichen Felder zu stark oder alles andere zu wenig.

Schwellenwerte, die einmal festgelegt und nie wieder überprüft werden. Die Zusammensetzung der Eingaben verschiebt sich, Modelle werden aktualisiert, und ein beim Go-live festgelegter Betriebspunkt ist irgendwann nicht mehr der richtige.

Konfidenz wird Prüfenden als Prozentwert angezeigt. Ein unkalibrierter Wert von 0,92, dargestellt als 92 Prozent sicher, verleitet Prüfende dazu, ihn wie eine Wahrscheinlichkeit zu behandeln und entsprechend durchzuwinken.

Feld-Konfidenzwerte zu einem Dokumentwert zusammenfassen. Ein Dokument lässt sich nicht sinnvoll durch den Mittelwert seiner Feld-Konfidenzwerte zusammenfassen, denn ein einziges kritisches Feld mit niedriger Konfidenz wiegt schwerer als zwanzig Felder mit hoher Konfidenz.

Contellect One wendet feldbasierte Schwellenwerte in der Validierungsstufe der intelligenten Dokumentenverarbeitung an.

Die Definition in die Praxis bringen

Sehen Sie, wie Contellect One Inhalte von der Erfassung bis zur Aktion steuert

Demo anfordern