← Últimos artigos
💬 NLP

CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question Answering

O CompactRAG é um framework de baixo custo para resposta a perguntas de múltiplos saltos que minimiza as chamadas de LLM e o overhead de tokens ao desacoplar o reestruturamento offline do corpus em uma base de conhecimento de QA atômica de um estágio de raciocínio online que depende de recuperação densa e extração de respostas, invocando o LLM apenas duas vezes, independentemente da complexidade do raciocínio.

Autores originais: Hao Yang, Zhiyu Yang, Xupeng Zhang, Wei Wei, Yunjie Zhang, Lin Yang

Publicado 2026-02-06
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Hao Yang, Zhiyu Yang, Xupeng Zhang, Wei Wei, Yunjie Zhang, Lin Yang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando resolver um mistério complexo, como descobrir quem é o diretor de um filme específico, mas a resposta não está em um só lugar. Você tem que ler um livro sobre o filme, encontrar o nome do diretor, depois procurar a biografia desse diretor para descobrir onde ele nasceu e, finalmente, verificar um mapa para ver a cidade.

Isso é o que é o Multi-Hop Question Answering (Resposta a Perguntas de Múltiplos Saltos): resolver um quebra-cabeça que exige saltar entre diferentes partes da informação (saltos) para obter a resposta final.

O Problema: O "Bibliotecário Sobrecarregado"

Os sistemas atuais (chamados de RAG ou Geração Aumentada por Recuperação) tentam resolver isso pedindo a uma IA superinteligente (um Grande Modelo de Linguagem ou LLM) para fazer o trabalho. No entanto, a maneira como eles fazem isso é ineficiente.

Pense no método atual como contratar um bibliotecário muito caro e altamente remunerado para resolver o seu mistério.

  1. Você faz uma pergunta ao bibliotecário.
  2. O bibliotecário corre até as estantes, pega um livro, lê e escreve uma nota.
  3. O bibliotecário volta correndo até você, lê a sua nota e diz: "Ok, agora preciso saber onde o diretor nasceu".
  4. Você pergunta novamente. O bibliotecário corre até as estantes de novo, pega um livro diferente, lê e escreve outra nota.
  5. Eles repetem esse processo para cada etapa do mistério.

O resultado? O bibliotecário fica cansado, o processo demora uma eternidade e você tem que pagar uma conta enorme (em "tokens" ou poder computacional) porque o bibliotecário está fazendo tantas viagens de ida e volta. Além disso, às vezes o bibliotecário se confunde sobre a quem "ele" se refere na segunda etapa, levando a respostas erradas.

A Solução: CompactRAG (A "Caixa de Conhecimento Pré-Pacotada")

Os autores deste artigo, CompactRAG, propõem uma maneira mais inteligente. Em vez de fazer o caro bibliotecário correr pela biblioteca toda vez que você fizer uma pergunta, eles reorganizam a biblioteca antes de você sequer aparecer.

Passo 1: A Preparação Offline (A "Configuração Única")

Antes de qualquer usuário fazer uma pergunta, o sistema usa uma IA para ler toda a biblioteca de documentos uma única vez.

  • Ele divide cada documento em "cartões de fatos" minúsculos, perfeitos e autossuficientes.
  • Em vez de um parágrafo inteiro dizendo: "O filme foi feito em 1953 por Arthur Crabtree", ele cria um cartão específico que diz: "Pergunta: Quem dirigiu 'The Wedding of Lilli Marlene'? Resposta: Arthur Crabtree."
  • Ele faz isso para cada fato na biblioteca. Isso cria uma Base de Conhecimento Compacta.

Analogia: Imagine que, em vez de uma biblioteca bagunçada, você tenha uma caixa gigante de fichas de índice perfeitamente organizada. Cada ficha tem uma pergunta específica na frente e a resposta exata no verso. Sem enrolação, sem palavras extras.

Passo 2: O Raciocínio Online (A "Regra das Duas Viagens")

Agora, quando um usuário faz uma pergunta complexa, o sistema funciona assim:

  1. O Desmembramento (Viagem 1): O caro bibliotecário (LLM) é chamado uma vez apenas para dividir o grande mistério em etapas pequenas e simples.
    • Usuário: "Onde o diretor do filme nasceu?"
    • LLM: "Ok, Etapa 1: Quem dirigiu o filme? Etapa 2: Onde essa pessoa nasceu?"
  2. A Busca (Sem Necessidade de Bibliotecário): O sistema não chama o caro bibliotecário novamente. Em vez disso, ele usa um robô barato e rápido para procurar as respostas na caixa de "cartões de fatos" pré-fabricados.
    • O robô encontra o cartão para "Quem dirigiu..." e obtém "Arthur Crabtree".
    • O robô então reescreve a próxima pergunta para que fique clara: "Onde Arthur Crabtree nasceu?" (Isso evita a confusão do "ele").
    • O robô encontra o cartão para "Onde Arthur Crabtree nasceu?" e obtém "Londres".
  3. A Resposta Final (Viagem 2): Assim que o robô tem todas as pequenas respostas, o caro bibliotecário é chamado uma última vez para juntar as peças e te dar a resposta final.

A Magia: O caro bibliotecário é chamado apenas duas vezes por pergunta, não importa quantos passos (saltos) o mistério tenha. Quer o quebra-cabeça tenha 2 etapas ou 10 etapas, o custo permanece o mesmo.

Por Que Isso Importa

  • Economiza Dinheiro: Você para de pagar o caro bibliotecário para correr de um lado para o outro. Você só paga a ele duas vezes.
  • Economiza Tempo: O processo é muito mais rápido porque os "cartões de fatos" são fáceis de encontrar e ler.
  • Menos Erros: Ao reescrever as perguntas para incluir nomes específicos (como "Arthur Crabtree" em vez de "ele"), o sistema não se confunde sobre de quem está falando.

Os Resultados

O artigo testou isso em três conjuntos de dados de quebra-cabeças difíceis (HotpotQA, 2WikiMultiHopQA e MuSiQue).

  • Precisão: O CompactRAG foi tão bom quanto os métodos antigos e caros para resolver os quebra-cabeças.
  • Eficiência: Ele usou significativamente menos "tokens" (a moeda de computação de IA). Em alguns casos, usou menos da metade dos recursos dos outros métodos.

Resumo

CompactRAG é como transformar uma investigação caótica, cara e de idas e vindas em uma operação ágil e pré-pacotada. Ele faz o trabalho pesado de organizar o conhecimento uma vez antecipadamente, para que resolver qualquer novo mistério se torne um processo rápido, barato e de dois passos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →