Glossário da ContellectCapturar e entender

O que é IDP (Processamento Documental)?

O pipeline que transforma documentos não estruturados em dados estruturados e validados.

O processamento inteligente de documentos (IDP) é o uso de IA para converter documentos não estruturados em dados estruturados e validados sobre os quais os sistemas posteriores podem agir.

O termo descreve um pipeline, e não uma técnica isolada. Um documento chega em alguma forma legível por humanos, como uma digitalização, uma fotografia, um PDF ou um anexo de e-mail, e sai como registros em um banco de dados, campos em um sistema de gestão de casos, ou uma mensagem em uma fila. Tudo o que acontece entre esses dois pontos é IDP.

As etapas do pipeline

Uma implementação típica executa seis etapas: ingestão, leitura, classificação, extração, validação e encaminhamento.

A ingestão coleta documentos dos canais que uma organização efetivamente usa. Na prática, raramente é uma única fonte. Correspondência digitalizada, caixas de e-mail compartilhadas, portais de upload, envios SFTP de parceiros e exportações de sistemas legados costumam aparecer todos no mesmo projeto.

A leitura converte a imagem do documento em texto e layout legíveis por máquina. É aqui que entra o reconhecimento óptico de caracteres, junto com a segmentação de página, a detecção de tabelas e a análise da ordem de leitura.

A classificação decide o que o documento é. A classificação de documentos determina o tipo e, frequentemente, o contexto de negócio, a categoria de registro e a sensibilidade, porque essas decisões orientam tudo o que vem depois delas.

A extração obtém os valores específicos de que o processo precisa. A extração de dados de documentos cobre campos de cabeçalho, itens de linha, tabelas, cláusulas, datas, partes e assinaturas.

A validação verifica os dados extraídos em relação a regras, dados de referência e consistência interna. Um total de nota fiscal que não corresponde à soma de suas linhas é detectado aqui, assim como um fornecedor que não existe no cadastro de fornecedores.

O encaminhamento entrega o resultado para o que vem a seguir: uma aprovação, uma fila de exceções, um sistema de registro, ou um revisor humano.

Como o IDP difere do OCR

Essa é a distinção mais frequentemente diluída em materiais de fornecedores, e ela importa. O OCR responde à pergunta “quais caracteres estão nesta página”. O IDP responde a “o que é este documento, o que ele significa, e está correto”.

O OCR produz texto. O IDP produz dados estruturados com um esquema conhecido, um valor de confiança por campo, um resultado de validação e uma trilha de auditoria. Um sistema que para no OCR converteu uma imagem em uma parede de caracteres, o que é mais fácil de pesquisar e não mais fácil de processar automaticamente.

Na prática, a diferença é tudo o que o OCR não faz: classificação, extração no nível de campo, validação em relação a regras de negócio, índice de confiança com limiares, tratamento de exceções e integração com fluxo de trabalho.

Como o IDP se relaciona com a RPA

A automação robótica de processos (RPA) e o IDP são complementares, e não concorrentes. A RPA é boa em operar sistemas sem API utilizável, manipulando suas interfaces do jeito que uma pessoa faria. Ela é fraca em interpretar um documento não estruturado, porque não existe uma sequência determinística de cliques que leia um contrato.

O padrão comum é o IDP produzir dados estruturados e a RPA ou um motor de fluxo de trabalho agir sobre eles. As equipes entram em dificuldade quando usam a RPA sozinha contra documentos, tipicamente com correspondência de gabaritos frágil, e depois descobrem que um fornecedor que muda o layout da sua nota fiscal quebra a automação silenciosamente.

O que costuma dar errado

A precisão é medida na coisa errada. Um número de precisão no nível de campo calculado em média entre todos os campos esconde os campos que importam. Acertar uma referência de documento 99 por cento das vezes e um valor de pagamento 90 por cento das vezes não é um sistema de 94 por cento, é um sistema que vai pagar o valor errado.

Os limiares de confiança são definidos globalmente. Um limiar que funciona para uma nota fiscal impressa está errado para um formulário manuscrito. Os limiares devem ser definidos por tipo de documento e frequentemente por campo.

O tratamento de exceções é desenhado por último. A taxa de processamento direto nunca é 100 por cento, então a experiência do revisor determina se o sistema economiza tempo no geral. Uma fila mais lenta de trabalhar do que o processo manual original elimina o benefício.

Os dados de treinamento não correspondem à produção. Modelos construídos com amostras limpas se degradam diante dos documentos fotografados, inclinados e parcialmente censurados que chegam na realidade.

Onde é usado

O IDP é aplicado sempre que o volume de documentos é alto e o processo posterior é regido por regras: contas a pagar, tratamento de sinistros, integração de clientes e verificações de conhecimento do cliente (KYC), originação de empréstimos, documentação comercial, e programas de digitalização de registros. O fator comum não é o setor, mas a combinação de entrada não estruturada com um processo que precisa ser auditável.

A Contellect One implementa esse pipeline em processamento inteligente de documentos, ao longo das seis etapas descritas acima.

Da definição à prática

Veja como o Contellect One governa o conteúdo da captura à ação

Solicitar uma demo