Contellect sözlüğüYakala ve anla

Optik Karakter Tanıma Nedir?

Metin görüntülerini makine okunabilir karakterlere dönüştürmek ve bunun nerede bittiği.

Optik karakter tanıma (OCR), taramalar ve fotoğraflar gibi metin görüntülerinin makine okunabilir karakter verisine dönüştürülmesidir.

OCR tek bir soruyu yanıtlar: bu sayfada hangi karakterler görünüyor. Belgenin ne olduğuna, hangi değerlerin önemli olduğuna veya bunlardan herhangi birinin doğru olup olmadığına karar vermez.

OCR’nin gerçekte ürettiği şey

Modern bir OCR motoru düz bir dizeden fazlasını döndürür. Tipik çıktı; tanınan karakterleri, sayfadaki sınırlayıcı koordinatlarını, karakter başına veya sözcük başına bir güven değerini ve satırlar, bloklar ve okuma sırası gibi bir yapı betimlemesini içerir.

OCR kalitesinin tek bir sayı olmamasının nedeni bu yapısal çıktıdır. Bir motor her karakteri doğru okuyup yine de onları sonucu işe yaramaz kılan bir sırada döndürebilir; bu, çok sütunlu yerleşimlerde, kenar çubuklarında ve etiketlerle değerlerin görsel olarak komşu ama temeldeki akışta birbirinden uzak olduğu formlarda rutin biçimde olur.

Yerleşim analizi ve okuma sırası

Tanımadan önce sayfa bölütlenir: metin blokları görüntülerden ayrılır, sütunlar saptanır, tablolar bulunur, üst ve alt bilgiler bir yana konur. Bu yerleşim analizidir ve karakterlerin, bir insanın belgenin içeriği olarak tanıyacağı bir dizide geri dönüp dönmediğini belirler.

Tablolar standart güçlüktür. Kenarlıksız bir tablo görsel olarak apaçık ve yapısal olarak görünmezdir; bu nedenle hücre sınırlarının boşluk hizalamasından çıkarsanması gerekir. Birleştirilmiş hücreler, bir hücre içinde saran metin ve sayfa sonundan öteye süren içerik, naif saptamayı bozar.

Dil ve yazı sistemi saptama

Çok dilli belgelerde dilin, tanımadan önce veya tanıma sırasında belirlenmesi gerekir; çünkü karakter modelleri dile özgüdür ve belirsiz biçimleri düzeltmek için kullanılan sözlükler de öyledir. İngilizce ürün adlarının Arapça düzyazı içinde yer aldığı Arapça ve Körfez bölgesi iş evraklarında yaygın olan karışık yazı sistemli belgeler, belge düzeyinde tek bir dil ayarı yerine bölge başına saptama gerektirir.

Sağdan sola yazılan sistemler, karakter doğruluğundan ayrı bir okuma sırası karmaşıklığı ekler. Bir sistem her Arapça karakteri doğru saptayıp yine de onları, Latin metin ve rakamlarla iç içe geçtiğinde anlamı tersine çeviren bir sırada verebilir.

OCR çıktısının neden yapılandırılmış veri olmadığı

Ticari olarak önem taşıyan ayrım budur ve en sık bulanıklaştırılan da budur. OCR size metin verir. Bir süreç ise değerlere ihtiyaç duyar: şu fatura numarası, şu toplam, şu satır kalemleri, şu imza tarihi.

Birinden diğerine geçmek, belgenin ne olduğuna karar vermeyi, yani belge sınıflandırmayı ve ardından belirli değerleri konumlandırıp yorumlamayı, yani belgeden veri çıkarımını gerektirir. Doğrulama ve yönlendirmeyle birlikte bu süreç hattı akıllı belge işlemedir. OCR onun ilk esaslı aşamasıdır, yerine geçen bir şey değildir.

İşe yarar bir sınama: sisteminizin çıktısı aranabilir ancak bir kişi hâlâ değerleri başka bir sisteme girmek için her belgeyi okumak zorundaysa, belge otomasyonu değil OCR devreye almışsınızdır.

Doğruluk motordan çok girdiye bağlıdır

OCR motorlarını karşılaştıran ekipler farkları genellikle beklediklerinden küçük bulur, çünkü görüntü kalitesi baskındır. Yaklaşık inç başına 200 noktanın altındaki çözünürlük, yoğun JPEG sıkıştırması, eğrilik, telefon fotoğraflarındaki gölgeler, soluk termal yazıcı çıktısı ve yanlış karşıtlıkla tarama, yetkin motorlar arasındaki boşluktan daha fazla doğruluğa mal olur.

Ön işlemenin oransız bir ağırlık taşımasının nedeni budur. Eğrilik giderme, nokta temizleme, karşıtlık normalleştirme ve tanıma denenmeden önce bir kalite tabanının altına düşen görüntülerin reddedilmesi, uçtan uca sonuçları motor değiştirmekten daha çok iyileştirme eğilimindedir.

Bunun doğal sonucu açıkça söylenmeye değer: yakalama kanalını düzelten bir proje, örneğin fotoğraflanan belgelerin yerine çözünürlük ve çerçevelemeyi zorunlu kılan bir tarama uygulaması koyarak, aynı çabayı model seçimine harcayan bir projeden sıklıkla daha çok kazanır.

Yaygın olarak yanlış giden şeyler

Doğruluğun karakter düzeyinde bildirilmesi. Yüzde doksan dokuz karakter doğruluğu mükemmel görünür ve yine de belgelerin anlamlı bir oranının en az bir hatalı alan içerdiği anlamına gelebilir; çünkü hatalar eşit dağılmak yerine düşük kaliteli azınlıkta yoğunlaşır.

Güvenin doğruluk sayılması. Yüksek bir OCR güven değeri, motorun karakter biçimlerine ilişkin kesinliğini gösterir. Değerin o alan için doğru değer olup olmadığı hakkında hiçbir şey söylemez. Bkz. güven puanı.

El yazısının kapsamda olduğunun varsayılması. El yazısı metnin tanınması, esasen farklı doğruluğa sahip farklı bir sorundur ve kutulu tarihler gibi kısıtlı alanlar, serbest biçimli açıklamalardan çok farklı davranır.

Contellect One tanımayı, akıllı belge işleme sürecinin okuma aşamasında gerçekleştirir.

Tanımı işe dönüştürün

Contellect One'ın içeriği yakalamadan eyleme kadar nasıl yönettiğini görün

Demo talep edin