Glosario de ContellectCapturar y comprender

¿Qué es IDP (procesamiento documental)?

El proceso que convierte documentos no estructurados en datos estructurados y validados.

El procesamiento inteligente de documentos (IDP) es el uso de la IA para convertir documentos no estructurados en datos estructurados y validados sobre los que puedan actuar los sistemas posteriores.

El término describe una cadena de procesamiento, no una técnica única. Un documento llega en alguna forma legible por personas, como un escaneo, una fotografía, un PDF o un archivo adjunto de correo, y sale como registros en una base de datos, campos en un sistema de gestión de expedientes o un mensaje en una cola. Todo lo que ocurre entre esos dos puntos es IDP.

Las etapas de la cadena de procesamiento

Una implementación típica ejecuta seis etapas: recepción, lectura, clasificación, extracción, validación y enrutamiento.

La recepción recoge documentos de los canales que la organización utiliza realmente. En la práctica, esto rara vez es una sola fuente. El correo postal escaneado, los buzones compartidos, los portales de carga, los envíos por SFTP de los socios y las exportaciones de sistemas heredados suelen aparecer todos en el mismo proyecto.

La lectura convierte la imagen del documento en texto y maquetación legibles por máquina. Aquí es donde se sitúa el reconocimiento óptico de caracteres, junto con la segmentación de páginas, la detección de tablas y el análisis del orden de lectura.

La clasificación decide qué es el documento. La clasificación de documentos determina el tipo y, a menudo, el contexto de negocio, la categoría de registro y la sensibilidad, porque esas decisiones condicionan todo lo que viene después.

La extracción obtiene los valores concretos que necesita el proceso. La extracción de datos de documentos abarca los campos de cabecera, las líneas de detalle, las tablas, las cláusulas, las fechas, las partes y las firmas.

La validación comprueba los datos extraídos contra reglas, datos de referencia y coherencia interna. Aquí se detecta el total de una factura que no coincide con la suma de sus líneas, igual que un proveedor que no existe en el maestro de proveedores.

El enrutamiento entrega el resultado a lo que venga después: una aprobación, una cola de excepciones, un sistema de registro o un revisor humano.

En qué se diferencia el IDP del OCR

Es la distinción que con más frecuencia se difumina en el material de los proveedores, y sí importa. El OCR responde a la pregunta “qué caracteres hay en esta página”. El IDP responde a “qué es este documento, qué significa y si es correcto”.

El OCR produce texto. El IDP produce datos estructurados con un esquema conocido, un valor de confianza por campo, un resultado de validación y un registro de auditoría. Un sistema que se detiene en el OCR ha convertido una imagen en un muro de caracteres, más fácil de buscar y no más fácil de procesar de forma automática.

En términos prácticos, la diferencia es todo lo que el OCR no hace: la clasificación, la extracción a nivel de campo, la validación contra reglas de negocio, la puntuación de confianza con umbrales, la gestión de excepciones y la integración con el flujo de trabajo.

Cómo se relaciona el IDP con el RPA

La automatización robótica de procesos y el IDP son complementarios, no competidores. El RPA es bueno para manejar sistemas que no tienen una API utilizable, operando sus interfaces como lo haría una persona. Es malo para interpretar un documento no estructurado, porque no existe una secuencia determinista de clics que lea un contrato.

El patrón habitual es que el IDP produzca datos estructurados y que el RPA o un motor de flujos de trabajo actúe sobre ellos. Donde los equipos se meten en problemas es al usar solo RPA sobre documentos, normalmente con una coincidencia de plantillas frágil, para descubrir después que un proveedor que cambia la maquetación de su factura rompe la automatización sin avisar.

Lo que suele ir mal

La exactitud se mide sobre lo que no importa. Una cifra de exactitud por campo promediada entre todos los campos oculta los campos que sí importan. Acertar la referencia de un documento el 99 por ciento de las veces y el importe de un pago el 90 por ciento de las veces no da un sistema del 94 por ciento, da un sistema que pagará un importe equivocado.

Los umbrales de confianza se fijan de forma global. Un umbral que funciona para una factura impresa es incorrecto para un formulario manuscrito. Los umbrales corresponden a cada tipo de documento y, a menudo, a cada campo.

La gestión de excepciones se diseña al final. La tasa de procesamiento directo nunca es del 100 por ciento, así que la experiencia del revisor determina si el sistema ahorra tiempo en conjunto. Una cola que se trabaja más despacio que el proceso manual original elimina el beneficio.

Los datos de entrenamiento no se parecen a los de producción. Los modelos construidos con muestras limpias se degradan con los documentos fotografiados, torcidos y parcialmente tachados que llegan en la realidad.

Dónde se utiliza

El IDP se aplica allí donde el volumen documental es alto y el proceso posterior se rige por reglas: cuentas por pagar, gestión de siniestros, incorporación de clientes y comprobaciones KYC, originación de préstamos, documentación de comercio internacional y programas de digitalización de registros. El factor común no es el sector, sino la combinación de una entrada no estructurada y un proceso que debe ser auditable.

Contellect One implementa esta cadena en procesamiento inteligente de documentos, a lo largo de las seis etapas descritas.

De la definición a la práctica

Vea cómo Contellect One gobierna el contenido desde la captura hasta la acción

Solicitar una demo