El reconocimiento óptico de caracteres (OCR) es la conversión de imágenes de texto, como escaneos y fotografías, en datos de caracteres legibles por máquina.
El OCR responde a una sola pregunta: qué caracteres aparecen en esta página. No decide qué es el documento, qué valores importan ni si alguno de ellos es correcto.
Lo que produce realmente el OCR
Un motor de OCR moderno devuelve más que una cadena plana. La salida típica incluye los caracteres reconocidos, sus coordenadas delimitadoras en la página, un valor de confianza por carácter o por palabra, y alguna descripción de la estructura, como líneas, bloques y orden de lectura.
Esa salida estructural es la razón por la que la calidad del OCR no es una sola cifra. Un motor puede leer todos los caracteres correctamente y devolverlos en un orden que vuelve inútil el resultado, algo que ocurre de forma habitual con maquetaciones a varias columnas, barras laterales y formularios donde las etiquetas y los valores están visualmente juntos pero muy separados en el flujo subyacente.
Análisis de maquetación y orden de lectura
Antes del reconocimiento, la página se segmenta: los bloques de texto se separan de las imágenes, se identifican las columnas, se detectan las tablas y se apartan los encabezados y los pies de página. Esto es el análisis de maquetación, y determina si los caracteres vuelven en una secuencia que una persona reconocería como el contenido del documento.
Las tablas son la dificultad clásica. Una tabla sin bordes es visualmente evidente y estructuralmente invisible, así que los límites de las celdas deben inferirse de la alineación de los espacios en blanco. Las celdas combinadas, el texto ajustado dentro de una celda y la continuación tras un salto de página rompen cualquier detección ingenua.
Detección de idioma y de sistema de escritura
Los documentos multilingües exigen identificar el idioma antes del reconocimiento o durante él, porque los modelos de caracteres son específicos de cada idioma y también lo son los diccionarios que se usan para corregir formas ambiguas. Los documentos con varios sistemas de escritura, habituales en la documentación empresarial en árabe y de la región del Golfo, donde los nombres de producto en inglés aparecen dentro de prosa en árabe, necesitan detección por regiones y no un único ajuste de idioma para todo el documento.
Las escrituras de derecha a izquierda añaden una complejidad de orden de lectura independiente de la exactitud de los caracteres. Un sistema puede identificar correctamente todos los caracteres árabes y emitirlos en un orden que invierte el significado cuando se intercalan con texto latino y cifras.
Por qué la salida del OCR no son datos estructurados
Esta es la distinción que importa en el plano comercial, y es la que más a menudo se difumina. El OCR entrega texto. Un proceso necesita valores: este número de factura, aquel total, estas líneas de detalle, esta fecha de firma.
Pasar de lo primero a lo segundo exige decidir qué es el documento, es decir, la clasificación de documentos, y después localizar e interpretar valores concretos, es decir, la extracción de datos de documentos. Junto con la validación y el enrutamiento, esa cadena es el procesamiento inteligente de documentos. El OCR es su primera etapa sustantiva, no un sustituto de ella.
Una prueba útil: si la salida de su sistema es consultable pero una persona todavía tiene que leer cada documento para teclear valores en otro sistema, ha implantado OCR, no automatización documental.
La exactitud depende más de la entrada que del motor
Los equipos que comparan motores de OCR suelen encontrar diferencias menores de lo esperado, porque lo que domina es la calidad de la imagen. Una resolución por debajo de unos 200 puntos por pulgada, una compresión JPEG agresiva, la inclinación, las sombras de las fotografías tomadas con el teléfono, la impresión térmica desvaída y el escaneo con un contraste inadecuado cuestan más exactitud que la distancia entre motores competentes.
Por eso el preprocesamiento tiene un peso desproporcionado. Corregir la inclinación, eliminar el ruido, normalizar el contraste y rechazar las imágenes que no alcanzan un mínimo de calidad antes de intentar el reconocimiento suelen mejorar el resultado de extremo a extremo más que cambiar de motor.
Conviene decir el corolario sin rodeos: un proyecto que arregla su canal de captura, por ejemplo sustituyendo los documentos fotografiados por una aplicación de escaneo que impone resolución y encuadre, gana a menudo más que otro que dedica el mismo esfuerzo a elegir el modelo.
Lo que suele ir mal
La exactitud se cita a nivel de carácter. Un noventa y nueve por ciento de exactitud por carácter suena excelente y aun así puede significar que una proporción relevante de documentos contiene al menos un campo incorrecto, porque los errores se acumulan en la minoría de baja calidad en lugar de repartirse por igual.
La confianza se trata como corrección. Un valor alto de confianza del OCR indica la certeza del motor sobre las formas de los caracteres. No dice nada sobre si el valor es el correcto para ese campo. Véase puntuación de confianza.
Se da por hecho que la escritura manuscrita entra en el alcance. El reconocimiento de texto manuscrito es un problema distinto, con una exactitud sensiblemente diferente, y los campos acotados, como las fechas en casillas, se comportan de forma muy distinta a una anotación libre.
Contellect One realiza el reconocimiento en la etapa de lectura de procesamiento inteligente de documentos.
