Grounded Cache Routing for Retrieval-Augmented Generation: When Is It Safe to Reuse an Answer?
Autores originais: Syed Huma Shah (Duke University)
Autores originais: Syed Huma Shah (Duke University)
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Resumo Técnico: Roteamento de Cache Fundamentado para Geração Aumentada por Recuperação
Declaração do Problema
Sistemas modernos de Geração Aumentada por Recuperação (RAG) utilizam cada vez mais cache para reduzir custos de tokens e o Tempo até o Primeiro Token (TTFT). Embora a reutilização de Chave-Valor (KV) em nível de prefixo e o cache de resultados de recuperação possuam fortes garantias de correção por construção, o cache semântico de nível de saída permanece frágil. Caches semânticos ingênuos sofrem com três modos de falha primários:
- Mudança de Referente: Consultas semanticamente semelhantes podem mapear para respostas corretas diferentes dependendo do contexto.
- Deriva de Recuperação: À medida que o corpus subjacente é atualizado, evidências anteriormente armazenadas em cache podem tornar-se inválidas ou mudar.
- Colisão Adversarial: Entradas maliciosas podem sequestrar respostas em cache, com taxas de sequestro relatadas tão altas quanto 86% em cenários avaliados.
Sistemas atuais frequentemente priorizam como reutilizar respostas mais rapidamente, negligenciando a questão crítica de quando a reutilização é segura. Este artigo argumenta que, sem validação rigorosa, o cache semântico introduz uma significativa "taxa de atendimento inseguro" (USR), onde os usuários recebem respostas incorretas do cache.
Metodologia: GroundedCache
Os autores propõem o GroundedCache, um roteador de cache validado por evidências que atua como uma camada de política sobre pilhas de serviço existentes (por exemplo, vLLM, RAGCache). Em vez de retornar cegamente uma resposta em cache para uma consulta semanticamente semelhante, o GroundedCache admite uma resposta em cache apenas quando quatro "portões" específicos são simultaneamente satisfeitos.
Os Quatro Portões de Validação
Dada uma entrada em cache (qc,ac,σc) e uma consulta fresca (q,σ,C), o roteador admite ac se e somente se:
- Similaridade de Consulta (G1): A similaridade de cosseno entre o novo embedding da consulta e o embedding da consulta em cache excede um limiar (τq).
- Sobreposição de Evidência (G2): A similaridade de Jaccard entre a nova assinatura de evidência (conjunto de hashes de fragmentos) e a assinatura em cache excede um limiar (τe).
- Validade da Versão da Fonte (G3): Fragmentos compartilhados entre a nova e a antiga evidência carregam a mesma tag de versão de fonte, garantindo que o corpus não foi mutado.
- Suporte de Evidência (G4): Os tokens de conteúdo da resposta em cache são cobertos pela evidência recém-recuperada. Isso é calculado via uma pontuação determinística de sobreposição lexical (padrão) ou opcionalmente via um LLM juiz leve.
Se qualquer portão falhar, o sistema recua para um pipeline RAG padrão: compressão condicionada à consulta dos fragmentos recuperados seguida de geração.
Carga de Trabalho e Métricas
Para testar sob estresse a segurança do cache em vez de apenas as taxas de acerto, os autores sintetizaram uma carga de trabalho de seis regimes:
- Repetição Exata & Paráfrase: Cenários de reutilização benigna.
- Quase-Erro: Consultas lexicalmente semelhantes com documentos de referência (gold) disjuntos.
- Deriva de Documento: Consultas onde tokens numéricos em documentos de referência são mutados para invalidar respostas em cache.
- Documento Compartilhado Longo & CAG de KB Limitada: Cenários que favorecem a deduplicação e a geração em contexto.
A métrica de avaliação primária é a Taxa de Atendimento Inseguro (USR), definida como a fração de todas as consultas que receberam uma resposta em cache errada. Isso é complementado pela Taxa de Acerto de Cache de Resposta (aHR) e pela Taxa de Falso-Acerto Condicional (FH).
Resultados Principais
Os experimentos foram conduzidos nos conjuntos de dados HotpotQA e mtRAG utilizando 12.000 gerações (Qwen2.5-7B-Instruct servido pelo vLLM).
Melhorias de Segurança
- HotpotQA: O GroundedCache reduziu a USR para 0,0% em todos os regimes onde o cache ingênuo apresentou erros não nulos. Por exemplo, no regime "deriva de documento", o cache ingênuo teve uma USR de 35,0%, enquanto o GroundedCache alcançou 0,0%.
- mtRAG (Multi-turn): O cache ingênuo exibiu falha catastrófica com USR variando de 26,0% a 51,5% devido a mudanças de referente. O GroundedCache reduziu a USR em mais de uma ordem de grandeza, alcançando 1,5% no regime de deriva de documento (uma redução de 34× em respostas em cache erradas).
- Estudos de Ablação: O portão de suporte lexical (G4) foi identificado como o mecanismo de segurança "estrutural". Removê-lo aumentou a USR em ~0,125 no HotpotQA e ~0,118 no mtRAG. Os outros portões (G1–G3) forneceram defesa em profundidade com custo próximo de zero, mas foram amplamente redundantes quando o G4 estava ativo.
Desempenho e Latência
- Latência: A latência p50 de ponta a ponta sob o GroundedCache permaneceu dentro de 1,04–1,07× de uma linha de base RAG sem cache.
- Compensações: Uma variante "sem suporte" (desativando G4) ofereceu um aumento de velocidade de 1,4–1,5×, mas incorreu em uma USR não nula (0,125–0,182), demonstrando a compensação ajustável entre segurança e velocidade.
- Taxas de Acerto: Embora o GroundedCache tenha reduzido a taxa bruta de acerto de cache de resposta (por exemplo, de 0,41 para 0,04 no HotpotQA para repetição exata) para garantir segurança, ele manteve economias significativas de recuperação ao utilizar o caminho de cache de recuperação.
Significado e Alegações
O artigo alega que a formulação correta para a reutilização de respostas em cache não é maximizar a velocidade, mas quantificar e minimizar a taxa de atendimento inseguro.
- Política sobre Kernel: O GroundedCache é apresentado como uma camada de política que se compõe com infraestrutura existente (vLLM APC, LMCache, etc.) sem exigir alterações no servidor de modelo, no recuperador ou nos modelos de embedding.
- Métricas Voltadas ao Operador: Os autores argumentam que relatar a USR juntamente com a taxa de acerto e a latência é essencial para que os praticantes tomem decisões informadas sobre suas compensações de segurança/velocidade.
- Robustez: Ao validar contra evidências frescas e tags de versão, o sistema neutraliza efetivamente colisões adversariais e deriva de corpus, que caches semânticos ingênuos não conseguem lidar.
Os autores concluem que, embora caches de resposta semântica troquem inerentemente correção por velocidade, o portão de suporte lexical fornece um mecanismo barato e determinístico para garantir que a reutilização seja segura, levando a taxa de atendimento inseguro a quase zero enquanto retém os benefícios de latência do cache.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.
Receba os melhores artigos de NLP toda semana.
Confiado por pesquisadores de Stanford, Cambridge e da Academia Francesa de Ciências.
Verifique sua caixa de entrada para confirmar sua inscrição.
Algo deu errado. Tentar novamente?
Sem spam, cancele quando quiser.