Contellect GlossarErfassen und verstehen

Was ist optische Zeichenerkennung (OCR)?

Die Umwandlung von Textbildern in maschinenlesbare Zeichen, und wo das endet.

Optische Zeichenerkennung (OCR) ist die Umwandlung von Bildern mit Text, etwa Scans und Fotografien, in maschinenlesbare Zeichendaten.

OCR beantwortet eine einzige Frage: welche Zeichen auf dieser Seite stehen. OCR entscheidet nicht, um welches Dokument es sich handelt, welche Werte wichtig sind oder ob einer davon korrekt ist.

Was OCR tatsächlich liefert

Eine moderne OCR-Engine liefert mehr als eine einfache Zeichenkette. Typische Ausgaben umfassen die erkannten Zeichen, ihre Begrenzungskoordinaten auf der Seite, einen Konfidenzwert pro Zeichen oder Wort sowie eine Beschreibung der Struktur wie Zeilen, Blöcke und Lesereihenfolge.

Diese strukturelle Ausgabe ist der Grund, warum sich die OCR-Qualität nicht in einer einzigen Zahl ausdrücken lässt. Eine Engine kann jedes Zeichen korrekt lesen und sie dennoch in einer Reihenfolge zurückgeben, die das Ergebnis unbrauchbar macht, was bei mehrspaltigen Layouts, Randspalten und Formularen regelmäßig vorkommt, bei denen Bezeichnungen und Werte visuell benachbart, im zugrunde liegenden Datenstrom aber weit auseinanderliegen.

Layoutanalyse und Lesereihenfolge

Vor der Erkennung wird die Seite segmentiert: Textblöcke werden von Bildern getrennt, Spalten identifiziert, Tabellen erkannt, Kopf- und Fußzeilen ausgesondert. Das ist die Layoutanalyse, und sie bestimmt, ob die Zeichen in einer Reihenfolge zurückkommen, die ein Mensch als Inhalt des Dokuments erkennen würde.

Tabellen sind die typische Schwierigkeit. Eine randlose Tabelle ist optisch offensichtlich und strukturell unsichtbar, weshalb Zellgrenzen aus der Ausrichtung von Leerräumen abgeleitet werden müssen. Verbundene Zellen, umgebrochener Text innerhalb einer Zelle und die Fortsetzung über einen Seitenumbruch hinweg bringen eine naive Erkennung durchweg zum Scheitern.

Sprach- und Schrifterkennung

Bei mehrsprachigen Dokumenten muss die Sprache vor oder während der Erkennung bestimmt werden, denn Zeichenmodelle sind sprachspezifisch, ebenso wie die Wörterbücher, die zur Korrektur mehrdeutiger Formen verwendet werden. Dokumente mit gemischten Schriftsystemen, wie sie in arabischen und Golf-Geschäftsunterlagen häufig vorkommen, wo englische Produktnamen inmitten arabischen Fließtexts stehen, benötigen eine Erkennung pro Textabschnitt statt einer einzigen Spracheinstellung für das gesamte Dokument.

Rechts-nach-links-Schriften bringen eine Komplexität in der Lesereihenfolge mit sich, die von der Zeichengenauigkeit unabhängig ist. Ein System kann jedes arabische Zeichen korrekt erkennen und sie dennoch in einer Reihenfolge ausgeben, die die Bedeutung umkehrt, wenn sie mit lateinischem Text und Ziffern verschachtelt sind.

Warum die OCR-Ausgabe keine strukturierten Daten sind

Das ist die geschäftlich entscheidende Unterscheidung, und sie wird am häufigsten verwischt. OCR liefert Text. Ein Prozess braucht Werte: diese Rechnungsnummer, jenen Gesamtbetrag, diese Positionen, dieses Unterschriftsdatum.

Der Weg vom einen zum anderen erfordert zunächst zu entscheiden, um welches Dokument es sich handelt, das ist Dokumentenklassifizierung, und dann bestimmte Werte zu finden und zu interpretieren, das ist Dokumentendatenextraktion. Zusammen mit Validierung und Weiterleitung ist diese Pipeline die intelligente Dokumentenverarbeitung. OCR ist deren erste inhaltliche Stufe, kein Ersatz dafür.

Ein nützlicher Test: Wenn die Ausgabe Ihres Systems durchsuchbar ist, aber eine Person weiterhin jedes Dokument lesen muss, um Werte in ein anderes System einzutippen, haben Sie OCR eingeführt, keine Dokumentenautomatisierung.

Genauigkeit hängt mehr von der Eingabe als von der Engine ab

Teams, die OCR-Engines vergleichen, stellen meist fest, dass die Unterschiede kleiner sind als erwartet, weil die Bildqualität den Ausschlag gibt. Eine Auflösung unter etwa 200 dpi, starke JPEG-Kompression, Schräglage, Schatten von Smartphone-Fotos, blasse Thermodrucker-Ausgaben und ein falsch eingestellter Kontrast beim Scannen kosten alle mehr Genauigkeit als der Unterschied zwischen kompetenten Engines.

Deshalb hat die Vorverarbeitung ein überproportionales Gewicht. Entzerren, Entrauschen, Kontrastnormalisierung und das Zurückweisen von Bildern unterhalb einer Qualitätsschwelle, bevor die Erkennung überhaupt versucht wird, verbessern die Ergebnisse über die gesamte Kette meist stärker als ein Wechsel der Engine.

Die logische Folgerung sollte man klar aussprechen: Ein Projekt, das seinen Erfassungskanal in Ordnung bringt, etwa indem es fotografierte Dokumente durch eine Scan-App ersetzt, die Auflösung und Bildausschnitt erzwingt, gewinnt oft mehr als eines, das denselben Aufwand in die Auswahl des Modells steckt.

Was häufig schiefgeht

Genauigkeit wird auf Zeichenebene angegeben. Neunundneunzig Prozent Zeichengenauigkeit klingt hervorragend und kann trotzdem bedeuten, dass ein erheblicher Anteil der Dokumente mindestens ein falsches Feld enthält, weil sich Fehler in der Minderheit niedriger Qualität konzentrieren, statt sich gleichmäßig zu verteilen.

Konfidenz wird mit Korrektheit verwechselt. Ein hoher OCR-Konfidenzwert zeigt die Sicherheit der Engine bei den Zeichenformen an. Er sagt nichts darüber aus, ob der Wert für das Feld der richtige ist. Siehe Konfidenzwert.

Handschrift wird als abgedeckt vorausgesetzt. Die Erkennung von handschriftlichem Text ist ein anderes Problem mit deutlich anderer Genauigkeit, und begrenzte Felder wie kastenförmige Datumsfelder verhalten sich ganz anders als frei geschriebene Anmerkungen.

Contellect One führt die Erkennung in der Lesestufe der intelligenten Dokumentenverarbeitung durch.

Die Definition in die Praxis bringen

Sehen Sie, wie Contellect One Inhalte von der Erfassung bis zur Aktion steuert

Demo anfordern