La extracción de datos de documentos es la identificación y captura de valores concretos de un documento, como campos, tablas, fechas y entidades nombradas, en forma de datos estructurados con un esquema definido.
La extracción es la etapa que produce el resultado que un proceso de negocio consume realmente. Todo lo anterior prepara el documento; todo lo posterior comprueba y entrega lo que la extracción encontró.
Qué se extrae
Los campos de cabecera son los valores únicos que identifican y datan un documento: número de factura, referencia de la orden de compra, fecha de emisión, moneda, total, nombre del proveedor e identificadores fiscales.
Las líneas de detalle y las tablas son estructuras repetitivas, y resultan bastante más difíciles que los campos de cabecera. Una línea de detalle puede ocupar varias filas, continuar tras un salto de página, llevar su propio tratamiento fiscal o remitir a una dirección de entrega distinta de la de la cabecera del documento.
Las cláusulas importan en los contratos y no en los documentos transaccionales: derechos de terminación, plazos de preaviso, límites de responsabilidad, ley aplicable, condiciones de renovación. La extracción de cláusulas suele consistir en identificar un fragmento antes que en capturar un valor: devuelve el pasaje y su ubicación para que un revisor pueda leerlo en contexto.
Las entidades son las partes, los lugares, los productos y los identificadores mencionados en cualquier punto del texto, que pueden no corresponder a un campo etiquetado.
Las firmas y las marcas se detectan más que se leen: si un bloque de firma está relleno, si una casilla está marcada, si aparece una inicial en cada página.
Los metadatos se derivan más que se encuentran: número de páginas, idioma, canal de captura, puntuación de calidad y los valores de confianza asociados a todo lo anterior.
Extracción basada en plantillas frente a extracción basada en modelos
La extracción basada en plantillas define dónde se sitúan los valores, ya sea por coordenadas absolutas o en relación con un ancla, como una etiqueta. Ante una maquetación estable es muy exacta, totalmente explicable y económica. Su modo de fallo no perdona: un proveedor que mueve un campo un centímetro, que añade un logotipo que desplaza la cabecera o que emite una plantilla nueva produce en silencio valores erróneos en lugar de ningún valor.
El coste oculto es el mantenimiento. Una plantilla por proveedor y por tipo de documento se convierte en cientos de plantillas, cada una de las cuales hay que reparar cada vez que una contraparte cambia su documentación. Las organizaciones suelen subestimarlo hasta que la biblioteca de plantillas ya resulta inmanejable.
La extracción basada en modelos aprende de ejemplos qué aspecto tiene un campo, combinando características de texto, de maquetación y visuales, de modo que generaliza a maquetaciones que no ha visto. Elimina la carga de mantenimiento por proveedor y cubre la cola larga de contrapartes de bajo volumen que nunca justificaron una plantilla.
Sus contrapartidas son reales. Necesita datos de entrenamiento etiquetados. Su exactitud en un documento concreto es menos predecible que la de una plantilla que encaja. Y cuando se equivoca, explicar el motivo a un auditor es más difícil que señalar una regla de coordenadas.
El patrón práctico es por capas: la extracción basada en modelos como opción predeterminada, y las plantillas conservadas solo donde una contraparte de gran volumen tiene una maquetación realmente estable y la ganancia de exactitud justifica el mantenimiento.
Validación con revisión humana
Ningún sistema de extracción alcanza una exactitud completa, así que la cuestión de diseño no es si intervienen personas, sino dónde.
La disposición habitual enruta los documentos por confianza. Los valores por encima de un umbral definido por campo pasan de forma automática. Los que quedan por debajo entran en una cola de revisión, donde una persona ve el valor extraído junto a la zona del documento de la que proviene, lo corrige si es necesario y lo libera.
Dos propiedades determinan si esto funciona. Las correcciones deben realimentar el entrenamiento; de lo contrario, el mismo error se repite indefinidamente. Y la interfaz de revisión debe ser más rápida que leer el documento desde cero, porque si no lo es, la cola cuesta más que el proceso manual al que sustituyó.
La tasa de procesamiento directo, es decir, la proporción de documentos que se completan sin intervención humana, es la métrica que refleja si el equilibrio es el adecuado. Consulte automatización de flujos documentales.
Lo que suele ir mal
La exactitud se promedia entre campos. Una cifra única esconde qué campos fallan. La exactitud debe informarse por campo, porque la consecuencia de un importe de pago erróneo no es la de una descripción errónea.
Se confunde vacío con ausente. Un campo que el documento realmente no contiene y un campo que la extracción no consiguió localizar son resultados distintos que exigen tratamientos distintos. Devolver un valor vacío para ambos pierde esa distinción.
Se omite la validación porque la extracción parece segura. Las comprobaciones entre campos detectan lo que la confianza por campo no puede: totales que no cuadran, fechas en un orden imposible, impuestos que no coinciden con el tipo aplicable.
Contellect One extrae campos, tablas y entidades en extracción avanzada de información.
