Una puntuación de confianza en la IA documental es un valor numérico que un modelo asocia a un resultado y que indica su propia estimación de la probabilidad de que ese resultado sea correcto.
La puntuación es el mecanismo que hace segura la automatización, porque es lo que un sistema utiliza para decidir qué resultados puede aceptar sin que una persona los revise. Entender lo que no significa resulta más útil que entender lo que sí significa.
Lo que no es una puntuación de confianza
No es una probabilidad calibrada. Un campo devuelto con 0,90 no significa que sea correcto el 90 por ciento de las veces. Los resultados brutos de un modelo suelen ser excesivamente optimistas, a veces de forma notable, y la relación entre el número y la exactitud real debe medirse sobre sus propios documentos antes de que signifique algo.
No es comparable entre modelos ni entre etapas. Un 0,85 de un motor de OCR describe la certeza sobre la forma de los caracteres. Un 0,85 de un modelo de extracción describe la certeza de que un valor pertenece a un campo. Un 0,85 de un clasificador describe la certeza sobre el tipo de documento. Son magnitudes distintas sobre la misma escala y no se pueden promediar ni comparar.
No mide que el resultado sea correcto por el motivo correcto. Un modelo puede acertar con plena confianza sobre lo equivocado, por ejemplo extraer del documento una fecha real que no es la fecha que pedía el campo. La confianza alta con una semántica errónea es el modo de fallo que sobrevive a las pruebas superficiales.
No detecta lo desconocido de forma fiable. Ante entradas que no se parecen a nada de lo visto durante el entrenamiento, los modelos suelen devolver una confianza media o alta en lugar de valores bajos que resulten útiles. Por eso una vía explícita para lo no clasificable importa más que confiar en que las puntuaciones bajas detecten lo nuevo.
Calibración
La calibración es el proceso de correlacionar las puntuaciones brutas con la exactitud observada. Se realiza tomando una muestra etiquetada representativa, agrupando las predicciones en bandas de puntuación y midiendo qué proporción de cada banda era realmente correcta.
El resultado es una tabla que indica lo que significa una puntuación determinada en su entorno. Suele revelar que el límite de decisión útil se sitúa en un punto poco intuitivo y que el número bruto era sistemáticamente optimista.
La calibración es específica de cada entorno y caduca. Hay que repetirla cuando cambia el modelo, cuando se añade una fuente documental importante y de forma periódica, a medida que se desplaza la mezcla de entradas.
El patrón de tres zonas
La mayoría de los sistemas en producción divide el rango de puntuación en tres zonas en lugar de dos.
Aceptación automática, por encima de un umbral superior, deja pasar el resultado sin intervención humana. Esta zona debe fijarse a partir de los datos de calibración, en la exactitud que el proceso realmente exige, y no en una cifra redonda.
Revisión humana, entre ambos umbrales, envía el resultado a la cola de una persona. El revisor ve el valor junto a la zona del documento de la que proviene y lo confirma o lo corrige.
Rechazo o reenrutamiento, por debajo de un umbral inferior, no pasa por la cola de revisión ordinaria. Una confianza muy baja suele indicar un problema con la entrada más que un caso límite: un tipo de documento equivocado, un escaneo ilegible, una página en blanco. Enviar estos casos a la misma cola que los casos límite reales ralentiza a los revisores con trabajo que debería haberse devuelto al remitente o vuelto a capturar.
Dos umbrales en lugar de uno es lo que separa una cola en la que los revisores confían de otra que aprenden a mirar por encima.
Cómo determinan los umbrales el procesamiento directo
La tasa de procesamiento directo, es decir, la proporción de documentos que se completan sin intervención humana, es una función directa de dónde se sitúe el umbral superior. Bajarlo aumenta la automatización y aumenta la tasa de error; subirlo produce el efecto contrario.
Eso convierte el umbral en una decisión de negocio antes que técnica, y debe fijarse a partir del coste de cada tipo de error. Una descripción equivocada en una línea de detalle de compra es una molestia menor. Una cuenta bancaria equivocada en una instrucción de pago es una pérdida. Esos campos no corresponden al mismo umbral, y por eso los umbrales se fijan por campo y por tipo de documento, no de forma global. Consulte clasificación de documentos y extracción de datos de documentos.
Lo que suele ir mal
Un único umbral global. Un valor único para todos los campos y todos los tipos automatiza en exceso los campos con consecuencias o automatiza demasiado poco todo lo demás.
Umbrales fijados una vez y nunca revisados. La mezcla de entradas se desplaza, los modelos se actualizan y un punto de operación fijado en la puesta en marcha deja de ser el adecuado.
Confianza mostrada a los revisores como porcentaje. Presentar un 0,92 sin calibrar como “92 % de confianza” invita a los revisores a tratarlo como una probabilidad y a aprobarlo sin más.
Agregar las confianzas de los campos en una puntuación del documento. La media de las confianzas de sus campos no resume de forma útil un documento, porque un solo campo crítico con confianza baja importa más que veinte campos con confianza alta.
Contellect One aplica umbrales por campo en la etapa de validación del procesamiento inteligente de documentos.
