Glosario de ContellectPreguntar y actuar

¿Qué es la generación aumentada (RAG)?

Fundamentar las respuestas generadas en su propio contenido, con los permisos aplicados en la recuperación.

La generación aumentada por recuperación (RAG) es una técnica en la que un modelo de lenguaje recupera pasajes relevantes de un conjunto definido de contenido y los utiliza como base de su respuesta, en lugar de basarse en lo que aprendió durante el entrenamiento.

Su finalidad es que un modelo general responda preguntas sobre contenido específico con el que nunca se entrenó, y que la respuesta se pueda comprobar.

Cómo funciona

Una pregunta se convierte en una búsqueda sobre una colección de contenido, normalmente combinando la similitud semántica con la coincidencia convencional de palabras clave. Los pasajes que se recuperan se entregan al modelo junto con la pregunta, y se instruye al modelo para que responda a partir de esos pasajes.

El contenido se prepara con antelación dividiéndolo en fragmentos e indexándolos. La fragmentación tiene más consecuencias de lo que parece. Los fragmentos demasiado pequeños pierden el contexto necesario para interpretarlos; si son demasiado grandes, la frase relevante queda diluida por el texto que la rodea. Partir en medio de una tabla o de una cláusula produce fragmentos que se recuperan bien y que inducen a error al leerlos.

Con material escaneado, todo depende de que el contenido sea primero legible por máquina, lo que implica reconocimiento óptico de caracteres y, en documentos estructurados, extracción de datos. Un sistema de recuperación sobre imágenes no reconocidas no recupera nada.

Por qué importan las citas

Una respuesta de RAG debe indicar de qué pasajes proviene, y las citas deben poder inspeccionarse en lugar de ser decorativas.

Cumplen tres funciones. Permiten al lector verificar la afirmación, que es la única defensa fiable frente a una respuesta segura y equivocada. Hacen auditable el sistema, algo que los procesos regulados exigen. Y sacan a la luz los fallos de recuperación: una respuesta que cita un pasaje irrelevante revela que el problema está en la recuperación y no en la generación.

Las citas no garantizan la corrección. Un modelo puede citar un pasaje real y resumirlo de forma inexacta, así que la cita respalda la verificación en lugar de sustituirla.

La fundamentación reduce las alucinaciones sin eliminarlas

La fundamentación limita el alcance del modelo al texto suministrado, lo que reduce sustancialmente la invención. No la suprime.

Conviene nombrar los modos de fallo que quedan, porque el material de los proveedores tiende a afirmar que el problema está resuelto. Un modelo al que se le pregunta algo que los pasajes recuperados no responden producirá a menudo una respuesta verosímil en lugar de abstenerse. Puede fusionar dos pasajes en una afirmación que ninguno de los dos hace. Y puede reproducir contenido recuperado correctamente pero erróneo en el origen, ya que la fundamentación hereda la exactitud del contenido subyacente.

Las mitigaciones son de procedimiento más que técnicas: instruir al modelo para que se abstenga cuando los pasajes sean insuficientes, mostrar los pasajes recuperados junto a la respuesta y tratar la etapa de recuperación como la palanca principal de calidad, porque un fallo de generación posterior a una mala recuperación no se arregla con un modelo mejor.

El control de acceso debe aplicarse en el momento de la recuperación

Es el requisito que distingue el RAG empresarial de una demostración, y el que más a menudo se resuelve mal.

Si el índice contiene todo y los permisos se aplican a la respuesta generada, el sistema ya ha fallado. El modelo ha visto contenido que el usuario no puede ver, y la respuesta se deriva de él. Filtrar la salida no deshace eso, porque el resumen de un documento restringido es una divulgación de ese documento. Incluso una negativa puede filtrar información, al confirmar que el documento existe.

El comportamiento correcto es resolver los permisos del usuario antes de la recuperación y buscar solo en lo que puede ver, de modo que dos usuarios que hacen la misma pregunta reciben respuestas distintas según su acceso. Eso exige que la capa de recuperación entienda el modelo de permisos de la plataforma de servicios de contenido en la que busca, incluidos los derechos heredados y los derivados de grupos, y que los resuelva de nuevo en cada consulta en lugar de almacenarlos en caché.

El fallo es fácil de pasar por alto en las pruebas, porque solo aparece cuando la prueba se ejecuta con un usuario de pocos privilegios. Un sistema probado solo por administradores parece correcto.

Lo que suele ir mal

No se mide la calidad de la recuperación. Los equipos evalúan las respuestas y nunca revisan si se encontraron los pasajes correctos, así que se culpa a la generación de fallos de recuperación.

Se indexa contenido obsoleto. Un índice que se reconstruye según una planificación sirve documentos ya superados con plena seguridad. El contenido eliminado o reclasificado debe salir del índice sin demora, lo que además es una obligación de gestión de registros.

Se indexa todo porque se puede. Los borradores, los duplicados y las versiones superadas compiten con el documento autorizado y degradan todas las respuestas.

No hay camino hasta la fuente. Una respuesta que el lector no puede rastrear hasta un documento en su forma original no sirve de base para una decisión que importa.

Contellect One aplica una recuperación que respeta los permisos en inteligencia de contenido y análisis impulsados por IA.

De la definición a la práctica

Vea cómo Contellect One gobierna el contenido desde la captura hasta la acción

Solicitar una demo