Um índice de confiança em IA documental é um valor numérico que um modelo atribui a uma saída, indicando sua própria estimativa da probabilidade de essa saída estar correta.
O índice é o mecanismo que torna a automação segura, pois é o que o sistema usa para decidir quais resultados pode aceitar sem que uma pessoa precise olhar. Entender o que ele não significa é mais útil do que entender o que ele significa.
O que um índice de confiança não é
Não é uma probabilidade calibrada. Um campo retornado com 0,90 não significa que ele está correto 90% das vezes. As saídas brutas do modelo costumam ser excessivamente confiantes, às vezes de forma substancial, e a relação entre o número e a precisão real precisa ser medida nos seus próprios documentos antes de significar qualquer coisa.
Não é comparável entre modelos ou etapas. Um 0,85 de um mecanismo de OCR descreve a certeza sobre o formato dos caracteres. Um 0,85 de um modelo de extração descreve a certeza de que um valor pertence a um campo. Um 0,85 de um classificador descreve a certeza sobre o tipo de documento. São grandezas diferentes na mesma escala e não podem ser somadas em média nem comparadas.
Não é uma medida de acerto pelo motivo certo. Um modelo pode estar confiantemente certo sobre a coisa errada, por exemplo, extraindo uma data genuína do documento que não é a data que o campo pedia. Alta confiança com semântica errada é o modo de falha que sobrevive a testes ingênuos.
Não detecta o desconhecido de forma confiável. Os modelos geralmente retornam confiança de média a alta em entradas diferentes de tudo o que foi usado no treinamento, em vez de valores úteis e baixos. É por isso que um caminho explícito para casos não classificáveis importa mais do que confiar em índices baixos para capturar novidades.
Calibração
Calibração é o processo de mapear índices brutos em relação à precisão observada. É feita ao reunir uma amostra rotulada representativa, agrupar as previsões em faixas de índice e medir qual proporção em cada faixa estava de fato correta.
O resultado é uma tabela que indica o que um determinado índice significa no seu ambiente. Ela costuma revelar que o limite de decisão útil está em algum ponto pouco intuitivo, e que o número bruto era sistematicamente otimista.
A calibração é específica de cada ambiente e expira. Ela precisa ser refeita quando o modelo muda, quando uma nova fonte relevante de documentos é adicionada e periodicamente, conforme a composição das entradas se altera.
O padrão de três faixas
A maioria dos sistemas em produção divide a faixa de índices em três zonas, em vez de duas.
Aceitação automática, acima de um limiar superior, passa sem envolvimento humano. Essa zona deve ser definida a partir de dados de calibração, na precisão que o processo realmente exige, e não em um número redondo.
Revisão humana, entre os limiares, entra na fila para uma pessoa. O revisor vê o valor junto com a região do documento de onde ele veio e o confirma ou o corrige.
Rejeição ou reencaminhamento, abaixo de um limiar inferior, não segue para a fila comum de revisão. Confiança muito baixa geralmente indica um problema na entrada, e não um julgamento limítrofe: o tipo de documento errado, uma digitalização ilegível, uma página em branco. Enviar esses casos para a mesma fila dos casos genuinamente limítrofes atrasa os revisores com trabalho que deveria ter sido devolvido ao remetente ou recapturado.
Ter dois limiares em vez de um é o que separa uma fila em que os revisores confiam de uma que eles aprendem a passar por cima.
Como os limiares direcionam o processamento direto
A taxa de processamento direto, a proporção de documentos concluídos sem intervenção humana, é uma função direta de onde está o limiar superior. Reduzi-lo aumenta a automação e aumenta a taxa de erro; elevá-lo faz o inverso.
Isso torna o limiar uma decisão de negócio, não uma decisão técnica, e ele deve ser definido a partir do custo de cada tipo de erro. Uma descrição errada em uma linha de compra é um transtorno menor. Uma conta bancária errada em uma instrução de pagamento é uma perda. Esses campos não pertencem ao mesmo limiar, motivo pelo qual os limiares são definidos por campo e por tipo de documento, e não de forma global. Veja classificação de documentos e extração de dados de documentos.
O que costuma dar errado
Um único limiar global. Um valor único para todos os campos e tipos automatiza demais os campos relevantes ou automatiza de menos tudo o mais.
Limiares definidos uma vez e nunca revisados. A composição das entradas se altera, os modelos são atualizados, e um ponto operacional definido no lançamento deixa de ser o correto.
Confiança exibida aos revisores como porcentagem. Mostrar um 0,92 não calibrado como “92% de confiança” convida os revisores a tratá-lo como uma probabilidade e aprovar automaticamente sem questionar.
Agregar as confianças de campos em um índice do documento. Um documento não é resumido de forma útil pela média das confianças de seus campos, porque um único campo crítico com baixa confiança importa mais do que vinte campos com alta confiança.
O Contellect One aplica limiares por campo na etapa de validação do processamento inteligente de documentos.
