Glossário da ContellectPerguntar e agir

O que é RAG (Geração Aumentada)?

Fundamentar respostas geradas no seu próprio conteúdo, com permissões aplicadas na recuperação.

A geração aumentada por recuperação (RAG) é uma técnica em que um modelo de linguagem recupera passagens relevantes de um corpo definido de conteúdo e as usa como base para sua resposta, em vez de depender apenas do que aprendeu durante o treinamento.

A finalidade é fazer com que um modelo geral responda a perguntas sobre conteúdo específico para o qual nunca foi treinado, e tornar a resposta verificável.

Como funciona

Uma pergunta é convertida em uma busca sobre uma coleção de conteúdo, geralmente combinando similaridade semântica com correspondência convencional de palavras-chave. As passagens retornadas são fornecidas ao modelo junto com a pergunta, e o modelo é instruído a responder a partir dessas passagens.

O conteúdo é preparado com antecedência, sendo dividido em fragmentos e indexado. A fragmentação é mais determinante do que parece. Fragmentos pequenos demais perdem o contexto necessário para interpretá-los; fragmentos grandes demais diluem a frase relevante no texto ao redor. Dividir no meio de uma tabela ou de uma cláusula produz fragmentos que são bem recuperados na busca, mas induzem a erro na leitura.

Para material digitalizado, tudo depende de o conteúdo ser legível por máquina antes de tudo, o que significa reconhecimento óptico de caracteres e, para documentos estruturados, extração de dados. Um sistema de recuperação sobre imagens não reconhecidas não recupera nada.

Por que as citações importam

Uma resposta de RAG deve declarar de quais passagens ela veio, e as citações devem ser inspecionáveis, não meramente decorativas.

Elas servem a três propósitos. Permitem que um leitor verifique a afirmação, o que é a única defesa confiável contra uma resposta confiante e errada. Tornam o sistema auditável, o que processos regulados exigem. E revelam falhas de recuperação: uma resposta que cita uma passagem irrelevante indica que o problema é a recuperação, não a geração.

Citações não são garantia de correção. Um modelo pode citar uma passagem real e ainda assim resumi-la de forma imprecisa, então a citação apoia a verificação em vez de substituí-la.

O embasamento reduz a alucinação sem eliminá-la

O embasamento restringe o escopo do modelo ao texto fornecido, o que reduz substancialmente a invenção. Ele não a elimina.

Vale a pena nomear os modos de falha residuais, porque o material dos fornecedores tende a afirmar que o problema está resolvido. Um modelo questionado sobre algo que as passagens recuperadas não respondem frequentemente produz uma resposta plausível mesmo assim, em vez de recusar. Ele pode combinar duas passagens em uma afirmação que nenhuma das duas faz. E pode reproduzir conteúdo que foi recuperado corretamente, mas que está errado na fonte, já que o embasamento herda a precisão do conteúdo subjacente.

As mitigações são procedimentais, não técnicas: instruir o modelo a recusar quando as passagens forem insuficientes, mostrar as passagens recuperadas ao lado da resposta, e tratar a etapa de recuperação como a principal alavanca de qualidade, porque uma falha de geração decorrente de uma recuperação ruim não pode ser corrigida por um modelo melhor.

O controle de acesso precisa ser aplicado no momento da recuperação

Essa é a exigência que distingue o RAG empresarial de uma demonstração, e a que mais frequentemente é feita de forma errada.

Se o índice contém tudo e as permissões são aplicadas à resposta gerada, o sistema já falhou. O modelo viu conteúdo que o usuário talvez não possa ver, e a resposta deriva dele. Filtrar a saída não desfaz isso, porque um resumo de um documento restrito é uma divulgação desse documento. Até uma recusa pode vazar informação, ao confirmar que um documento existe.

O comportamento correto é resolver as permissões do usuário antes da recuperação e buscar apenas o que ele pode ver, de modo que dois usuários fazendo a mesma pergunta recebam respostas diferentes de acordo com seu acesso. Isso exige que a camada de recuperação entenda o modelo de permissões da content services platform que ela pesquisa, incluindo direitos herdados e derivados de grupo, e que os resolva novamente a cada consulta, em vez de armazená-los em cache.

A falha é fácil de passar despercebida em testes, porque só aparece quando um teste é executado como um usuário de baixo privilégio. Um sistema testado apenas por administradores parece correto.

O que costuma dar errado

A qualidade da recuperação não é medida. As equipes avaliam as respostas e nunca verificam se as passagens corretas foram encontradas, então a geração leva a culpa por falhas de recuperação.

Conteúdo desatualizado é indexado. Um índice reconstruído em uma agenda fixa entrega documentos superados com total confiança. Conteúdo excluído ou reclassificado precisa sair do índice prontamente, o que também é uma obrigação de gestão de registros.

Tudo é indexado porque pode ser. Minutas, duplicatas e versões superadas competem com o documento oficial e degradam todas as respostas.

Não existe caminho até a fonte. Uma resposta que um leitor não consegue rastrear até um documento em sua forma original não pode servir de base para uma decisão relevante.

A Contellect One aplica recuperação com reconhecimento de permissões em inteligência de conteúdo e insights orientados por IA.

Da definição à prática

Veja como o Contellect One governa o conteúdo da captura à ação

Solicitar uma demo