A extração de dados de documentos é a identificação e a captura de valores específicos de um documento, tais como campos, tabelas, datas e entidades nomeadas, na forma de dados estruturados com um esquema definido.
A extração é a etapa que produz o resultado que um processo de negócio efetivamente consome. Tudo o que vem antes prepara o documento; tudo o que vem depois verifica e entrega o que a extração encontrou.
O que é extraído
Os campos de cabeçalho são os valores únicos que identificam e datam um documento: número da nota fiscal, referência do pedido de compra, data de emissão, moeda, total, nome do fornecedor e identificadores fiscais.
Itens de linha e tabelas são estruturas repetitivas, e são substancialmente mais difíceis do que os campos de cabeçalho. Um item de linha pode se estender por várias linhas, continuar após uma quebra de página, ter seu próprio tratamento fiscal, ou referenciar um endereço de entrega diferente do cabeçalho do documento.
As cláusulas importam em contratos, e não em documentos transacionais: direitos de rescisão, prazos de aviso prévio, limites de responsabilidade, lei aplicável, termos de renovação. A extração de cláusulas costuma ser identificação de trecho, e não captura de valor, retornando a passagem e sua localização para que um revisor possa lê-la em contexto.
As entidades são as partes, lugares, produtos e identificadores nomeados em qualquer parte do texto, que podem não corresponder a um campo rotulado.
Assinaturas e marcas são detectadas, e não lidas: se um bloco de assinatura está preenchido, se uma caixa de seleção está marcada, se uma rubrica aparece em cada página.
Os metadados são derivados, e não encontrados: número de páginas, idioma, canal de captura, índice de qualidade, e os valores de confiança atribuídos a tudo o que foi listado acima.
Extração por gabarito versus extração por modelo
A extração por gabarito define onde os valores estão, seja por coordenadas absolutas ou em relação a uma âncora como um rótulo. Diante de um layout estável, ela é altamente precisa, totalmente explicável e barata. Seu modo de falha é implacável: um fornecedor que desloca um campo em um centímetro, que adiciona um logotipo que move o cabeçalho, ou que emite um novo modelo, produz silenciosamente valores errados em vez de nenhum valor.
O custo oculto é a manutenção. Um gabarito por fornecedor por tipo de documento se transforma em centenas de gabaritos, cada um precisando de reparo sempre que uma contraparte muda seus formulários. As organizações frequentemente subestimam isso até que a biblioteca de gabaritos já esteja impossível de gerenciar.
A extração por modelo aprende como um campo se parece a partir de exemplos, usando características textuais, de layout e visuais em conjunto, de modo que generaliza para layouts que nunca viu. Ela elimina o ônus de manutenção por fornecedor e trata a longa cauda de contrapartes de baixo volume que nunca justificariam um gabarito.
Suas contrapartidas são reais. Ela precisa de dados de treinamento rotulados. Sua precisão em qualquer documento individual é menos previsível do que a de um gabarito compatível. E quando ela erra, explicar o motivo a um auditor é mais difícil do que apontar para uma regra de coordenadas.
O padrão prático é em camadas: extração por modelo como padrão, com gabaritos mantidos apenas onde uma contraparte de alto volume tem um layout genuinamente estável e o ganho de precisão justifica a manutenção.
Validação com participação humana
Nenhum sistema de extração atinge precisão completa, então a questão de desenho não é se pessoas estão envolvidas, mas onde.
O arranjo usual encaminha documentos por confiança. Valores acima de um limiar por campo passam automaticamente. Valores abaixo dele entram na fila de revisão, onde uma pessoa vê o valor extraído ao lado da região do documento de onde ele veio, corrige-o se necessário, e o libera.
Duas propriedades determinam se isso funciona. As correções precisam realimentar o treinamento, ou o mesmo erro se repete indefinidamente. E a interface de revisão precisa ser mais rápida do que ler o documento do zero, porque, se não for, a fila custa mais do que o processo manual que substituiu.
A taxa de processamento direto, a proporção de documentos que se completam sem qualquer intervenção humana, é a métrica que capta se o equilíbrio está correto. Veja automação de fluxo documental.
O que costuma dar errado
A precisão é calculada em média entre os campos. Um único número esconde quais campos falham. A precisão precisa ser reportada por campo, porque a consequência de um valor de pagamento errado não é a consequência de uma descrição errada.
Vazio é confundido com ausente. Um campo que o documento genuinamente não contém e um campo que a extração não conseguiu encontrar são resultados diferentes que exigem tratamentos diferentes. Retornar um valor vazio para ambos os casos elimina essa distinção.
A validação é ignorada porque a extração parece confiante. Verificações entre campos capturam o que a confiança por campo não consegue: totais que não fecham a soma, datas em ordem impossível, imposto que não corresponde à alíquota aplicável.
A Contellect One extrai campos, tabelas e entidades em extração avançada de informações.
