A classificação de documentos é a atribuição de um documento a uma ou mais categorias predefinidas, na maioria das vezes o seu tipo, para que o processamento posterior saiba como tratá-lo.
A classificação é a decisão da qual tudo o que vem depois depende. Regras de extração, lógica de validação, prazo de retenção, restrições de acesso e destino de encaminhamento são todos selecionados com base no que se determinou que o documento é.
O que está sendo classificado
O tipo é o eixo óbvio: nota fiscal, pedido de compra, contrato, passaporte, extrato bancário, nota de entrega. Raramente é o único que importa em produção.
O contexto de negócio diferencia documentos do mesmo tipo que seguem processos diferentes, como uma nota fiscal doméstica em comparação com uma de importação, ou uma proposta de novo negócio em comparação com uma renovação.
A categoria de registro determina a retenção. O mesmo contrato assinado pode ser um registro comercial comum ou um registro formalmente declarado com prazo de retenção estatutário. Veja gestão de registros.
A sensibilidade orienta o controle de acesso e a redação de dados. Um documento com dados de cartão de pagamento ou informações de saúde precisa de regras de tratamento aplicadas no momento da classificação, não depois de já ter sido distribuído.
A necessidade de encaminhamento às vezes é classificada diretamente, por exemplo marcando um documento como exigindo revisão jurídica independentemente do seu tipo.
Tratar esses aspectos como rótulos separados, em vez de embuti-los em uma única taxonomia de tipo, evita que a taxonomia se multiplique de forma combinatória.
Três abordagens, e onde cada uma falha
A classificação baseada em regras compara palavras-chave, expressões regulares, códigos de barras ou padrões de layout. É transparente, barata de executar e trivialmente explicável, o que importa em ambientes regulados. É frágil: um fornecedor que redesenha o seu modelo, ou uma palavra-chave que aparece em um contexto inesperado, a quebra. As regras continuam sendo a escolha correta quando o sinal é genuinamente determinístico, como um código de barras ou um identificador de formulário impresso na página.
A classificação por aprendizado de máquina treina um modelo com exemplos rotulados, usando características textuais, características de layout ou ambas. Ela generaliza muito melhor do que as regras diante da variação de modelos de documento. Exige dados de treinamento rotulados, se degrada quando os documentos de produção se afastam da distribuição de treinamento, e seus erros são mais difíceis de explicar a um auditor.
A classificação por modelo de linguagem de grande porte usa um modelo geral, orientado por instrução ou ajustado, e precisa de pouco ou nenhum dado de treinamento específico para a tarefa. Ela lida bem com tipos de documento incomuns e nunca antes vistos e pode classificar com base na semântica, e não apenas em características superficiais. As contrapartidas são o custo por documento em volume, a latência, a não determinação entre execuções quando não restringida, e uma tendência a produzir um rótulo plausível para um documento que deveria ter sido rejeitado como não classificável.
A maioria dos sistemas em produção combina as três: regras determinísticas onde existe um marcador confiável, um modelo treinado para os tipos conhecidos de alto volume, e um LLM como alternativa para a cauda.
Por que os limiares devem ser definidos por tipo de documento
Um limiar de índice de confiança decide quais classificações são aceitas automaticamente e quais vão para uma pessoa. Definir um único limiar global é o erro de desenho mais comum nessa etapa.
O motivo é que o custo de um erro não é uniforme. Classificar erroneamente um folheto de marketing como uma nota de entrega desperdiça alguns segundos. Classificar erroneamente uma notificação jurídica como correspondência geral pode fazer perder um prazo estatutário. O primeiro pode ser aceito automaticamente com segurança em confiança moderada; o segundo exige revisão mesmo em confiança alta.
A frequência de cada classe agrava isso. Um tipo que aparece em 40 por cento do volume tem sinal de treinamento abundante e geralmente confiança genuína alta. Um tipo que aparece em 0,5 por cento tem pouco sinal, e seus valores de confiança são menos confiáveis no mesmo nível numérico.
Limiares por tipo permitem que um sistema automatize o grosso do volume e ao mesmo tempo reserve os casos raros e consequentes para o julgamento humano. Eles também tornam o ponto de operação explícito e revisável, em vez de escondido em um único número que ninguém consegue justificar.
O que costuma dar errado
Não existe um resultado de não classificável. Forçar todo documento a entrar em uma categoria garante a classificação incorreta e confiante de qualquer coisa genuinamente nova. Um caminho explícito de rejeição ou revisão é uma exigência, não um requinte.
Arquivos com múltiplos documentos são ignorados. Um único PDF digitalizado frequentemente contém vários documentos. Sem a separação em nível de página antes da classificação, o arquivo é rotulado pelo que predominar na sua primeira página.
A taxonomia é definida pelas pessoas erradas. Categorias definidas pelos donos do processo tendem a ser acionáveis. Categorias herdadas de uma estrutura de arquivamento tendem a descrever onde os documentos costumavam ser guardados, o que já não ajuda em nada.
A Contellect One implementa essa etapa como classificação de documentos com IA.
