Glosario de ContellectCapturar y comprender

¿Qué es la clasificación documental?

Decidir qué es un documento para que el sistema sepa qué hacer con él.

La clasificación de documentos es la asignación de un documento a una o varias categorías predefinidas, con mayor frecuencia su tipo, para que el procesamiento posterior sepa cómo tratarlo.

La clasificación es la decisión de la que depende todo lo que viene después. Las reglas de extracción, la lógica de validación, el periodo de retención, las restricciones de acceso y el destino de enrutamiento se seleccionan en función de qué se determinó que era el documento.

Qué se clasifica

El tipo es el eje evidente: factura, orden de compra, contrato, pasaporte, extracto bancario, nota de entrega. Rara vez es el único que importa en producción.

El contexto de negocio distingue documentos del mismo tipo que siguen procesos distintos, como una factura nacional frente a una de importación, o una solicitud de nueva contratación frente a una de renovación.

La categoría de registro determina la retención. El mismo acuerdo firmado puede ser un registro empresarial ordinario o un registro declarado formalmente con un periodo de retención legal. Consulte gestión de registros.

La sensibilidad determina el control de acceso y la redacción. Un documento que contiene datos de tarjetas de pago o información de salud necesita que se le apliquen reglas de tratamiento en el momento de la clasificación, no después de haberse distribuido.

La necesidad de enrutamiento se clasifica a veces de forma directa, por ejemplo marcando un documento como sujeto a revisión jurídica al margen de su tipo.

Tratar todo esto como etiquetas separadas, en lugar de plegarlo en una única taxonomía de tipos, evita que la taxonomía crezca de forma combinatoria.

Tres enfoques, y dónde falla cada uno

La clasificación basada en reglas compara palabras clave, expresiones regulares, códigos de barras o huellas de maquetación. Es transparente, económica de ejecutar y explicable sin esfuerzo, algo que importa en entornos regulados. Es frágil: un proveedor que rediseña su plantilla, o una palabra clave que aparece en un contexto inesperado, la rompe. Las reglas siguen siendo la opción correcta cuando la señal es realmente determinista, como un código de barras o un identificador de formulario impreso en la página.

La clasificación por aprendizaje automático entrena un modelo con ejemplos etiquetados, a partir de características de texto, de maquetación o de ambas. Generaliza mucho mejor que las reglas ante la variación de plantillas. Requiere datos de entrenamiento etiquetados, se degrada cuando los documentos de producción se alejan de la distribución de entrenamiento y sus errores son más difíciles de explicar a un auditor.

La clasificación con un modelo de lenguaje grande (LLM) utiliza un modelo general, con instrucciones o ajustado, y necesita pocos datos de entrenamiento específicos de la tarea, o ninguno. Maneja bien los tipos de documento inusuales y no vistos antes, y puede clasificar por semántica y no por características superficiales. Sus contrapartidas son el coste por documento a gran volumen, la latencia, la falta de determinismo entre ejecuciones si no se restringe, y la tendencia a producir una etiqueta plausible para un documento que debería haberse rechazado como no clasificable.

La mayoría de los sistemas en producción los combina: reglas deterministas donde existe un marcador fiable, un modelo entrenado para los tipos conocidos de gran volumen y un LLM como recurso para la cola larga.

Por qué los umbrales corresponden a cada tipo de documento

Un umbral de puntuación de confianza decide qué clasificaciones se aceptan automáticamente y cuáles pasan a una persona. Fijar un único umbral global es el error de diseño más frecuente en esta etapa.

El motivo es que el coste de un error no es uniforme. Clasificar mal un folleto comercial como nota de entrega desperdicia unos segundos. Clasificar mal una notificación jurídica como correspondencia general puede hacer que se incumpla un plazo legal. El primer caso puede aceptarse de forma automática con seguridad ante una confianza moderada; el segundo merece revisión incluso con confianza alta.

La frecuencia de cada clase agrava esto. Un tipo que aparece en el 40 por ciento del volumen dispone de abundante señal de entrenamiento y suele tener una confianza alta y genuina. Un tipo que aparece en el 0,5 por ciento apenas tiene señal, y sus valores de confianza son menos fiables al mismo nivel numérico.

Los umbrales por tipo permiten que un sistema automatice el grueso del volumen y reserve lo poco frecuente y lo que tiene consecuencias para el juicio humano. También hacen que el punto de operación sea explícito y revisable, en lugar de quedar enterrado en un número que nadie puede justificar.

Lo que suele ir mal

No existe un resultado de no clasificable. Forzar cada documento dentro de una categoría garantiza una clasificación errónea y confiada de todo lo que es realmente novedoso. Una vía explícita de rechazo o revisión es un requisito, no un detalle.

Se ignoran los archivos con varios documentos. Un solo PDF escaneado contiene con frecuencia varios documentos. Sin una separación por páginas antes de la clasificación, el archivo se etiqueta según lo que domine su primera página.

La taxonomía la diseñan las personas equivocadas. Las categorías definidas por los responsables de los procesos tienden a ser accionables. Las categorías heredadas de una estructura de archivado tienden a describir dónde se guardaban antes los documentos, lo que ya no ayuda.

Contellect One implementa esta etapa como clasificación de documentos con IA.

De la definición a la práctica

Vea cómo Contellect One gobierna el contenido desde la captura hasta la acción

Solicitar una demo