Glossário da ContellectCapturar e entender

O que é OCR (Reconhecimento de Texto)?

Converter imagens de texto em caracteres legíveis por máquina, e onde isso para.

O reconhecimento óptico de caracteres (OCR) é a conversão de imagens de texto, como digitalizações e fotografias, em dados de caracteres legíveis por máquina.

O OCR responde a uma pergunta: quais caracteres aparecem nesta página. Ele não decide o que o documento é, quais valores importam, ou se algum deles está correto.

O que o OCR realmente produz

Um motor de OCR moderno retorna mais do que uma string simples. A saída típica inclui os caracteres reconhecidos, suas coordenadas delimitadoras na página, um valor de confiança por caractere ou por palavra, e alguma descrição de estrutura como linhas, blocos e ordem de leitura.

Essa saída estrutural é o motivo pelo qual a qualidade do OCR não é um único número. Um motor pode ler cada caractere corretamente e ainda assim retorná-los em uma ordem que torna o resultado inútil, o que acontece rotineiramente com layouts em várias colunas, barras laterais e formulários em que rótulos e valores estão visualmente adjacentes, mas distantes entre si no fluxo subjacente.

Análise de layout e ordem de leitura

Antes do reconhecimento, a página é segmentada: blocos de texto separados de imagens, colunas identificadas, tabelas detectadas, cabeçalhos e rodapés isolados. Isso é análise de layout, e ela determina se os caracteres retornam em uma sequência que um ser humano reconheceria como o conteúdo do documento.

As tabelas são a dificuldade padrão. Uma tabela sem bordas é visualmente óbvia e estruturalmente invisível, então os limites das células precisam ser inferidos pelo alinhamento dos espaços em branco. Células mescladas, texto que quebra dentro de uma célula e continuação após uma quebra de página quebram todos a detecção ingênua.

Detecção de idioma e escrita

Documentos multilíngues precisam ter o idioma identificado antes ou durante o reconhecimento, porque os modelos de caracteres são específicos por idioma, assim como os dicionários usados para corrigir formas ambíguas. Documentos com escrita mista, comuns em documentação empresarial árabe e da região do Golfo, em que nomes de produtos em inglês aparecem dentro de texto em árabe, precisam de detecção por região, e não de uma única configuração de idioma no nível do documento.

Escritas da direita para a esquerda acrescentam uma complexidade de ordem de leitura separada da precisão de caracteres. Um sistema pode identificar corretamente cada caractere árabe e ainda assim emiti-los em uma ordem que inverte o significado quando intercalados com texto latino e dígitos.

Por que a saída do OCR não é dados estruturados

Essa é a distinção que importa comercialmente, e é a mais frequentemente diluída. O OCR entrega texto. Um processo precisa de valores: este número de nota fiscal, aquele total, estes itens de linha, esta data de assinatura.

Ir de um para o outro exige decidir o que o documento é, o que é classificação de documentos, e depois localizar e interpretar valores específicos, o que é extração de dados de documentos. Junto com a validação e o encaminhamento, esse pipeline é o processamento inteligente de documentos. O OCR é sua primeira etapa substantiva, não um substituto para ele.

Um teste útil: se a saída do seu sistema é pesquisável, mas uma pessoa ainda precisa ler cada documento para digitar valores em outro sistema, você implantou OCR, não automação documental.

A precisão depende mais da entrada do que do motor

As equipes que comparam motores de OCR costumam encontrar diferenças menores do que o esperado, porque a qualidade da imagem domina. Resolução abaixo de aproximadamente 200 pontos por polegada, compressão JPEG pesada, inclinação, sombras de fotografias de celular, saída fraca de impressora térmica e digitalização com contraste errado custam todos mais precisão do que a diferença entre motores competentes.

É por isso que o pré-processamento carrega um peso desproporcional. Corrigir a inclinação, remover ruído, normalizar o contraste, e rejeitar imagens que ficam abaixo de um piso de qualidade antes de tentar o reconhecimento tendem a melhorar os resultados de ponta a ponta mais do que trocar de motor.

O corolário vale a pena declarar claramente: um projeto que corrige seu canal de captura, por exemplo substituindo documentos fotografados por um aplicativo de digitalização que impõe resolução e enquadramento, frequentemente ganha mais do que um que gasta o mesmo esforço na seleção de modelo.

O que costuma dar errado

A precisão é informada no nível de caractere. Uma precisão de caracteres de noventa e nove por cento soa excelente e ainda assim pode significar que uma proporção relevante de documentos contém pelo menos um campo errado, porque os erros se concentram na minoria de baixa qualidade, em vez de se distribuírem de forma uniforme.

A confiança é tratada como correção. Um valor de confiança de OCR alto indica a certeza do motor sobre as formas dos caracteres. Ele não diz nada sobre se o valor é o correto para o campo. Veja índice de confiança.

Presume-se que a escrita manuscrita está dentro do escopo. O reconhecimento de texto manuscrito é um problema diferente, com precisão materialmente diferente, e campos restritos como datas em caixas se comportam de forma muito diferente de anotações livres.

A Contellect One realiza o reconhecimento na etapa de leitura do processamento inteligente de documentos.

Da definição à prática

Veja como o Contellect One governa o conteúdo da captura à ação

Solicitar uma demo