ScalableRAG: High-Quality RAG at Zero Ingestion Cost
O artigo apresenta o ScalableRAG, uma abordagem de Geração Aumentada por Recuperação de alta qualidade que alcança precisão superior em múltiplos conjuntos de dados com custos de ingestão zero ao utilizar um espaço de trabalho dinâmico para raciocínio agregativo on-the-fly, enquanto também oferece uma variante de Ingestão Limitada que aumenta ainda mais o desempenho em escala com uso mínimo de banco de dados vetorial.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você esteja tentando resolver um mistério enorme lendo uma biblioteca de um milhão de livros. No mundo da inteligência artificial, isso é chamado de Geração Aumentada por Recuperação (RAG). Pense em uma IA padrão como um detetive brilhante que leu toda a internet, mas não consegue se lembrar de detalhes específicos de um arquivo empoeirado. Para ajudar o detetive, geralmente construímos um "catálogo de fichas" ou um "grafo de conhecimento" antes de ele começar a trabalhar. Isso envolve ler cada um dos livros, resumi-los e organizá-los em um banco de dados complexo para que a IA possa encontrar a página certa rapidamente. É como contratar uma equipe de bibliotecários para passar semanas indexando a biblioteca antes mesmo de o detetive chegar. Esse processo é caro, lento e exige muito poder computacional apenas para começar. Mas e se o detetive pudesse entrar na biblioteca, olhar os livros e descobrir as respostas na hora, sem precisar de um catálogo pré-fabricado? Essa é a grande questão que este artigo aborda: Podemos obter os mesmos resultados brilhantes sem pagar o alto custo de "ingestão" para construir esse banco de dados massivo primeiro?
Os pesquisadores da Cohesity, liderados por Hilaf Hasson e sua equipe, dizem que a resposta é um ressonante "sim". Eles introduzem um novo sistema chamado ScalableRAG, que vem em dois sabores: Zero-Ingestion (Zero-Ingestão) e Limited-Ingestion (Ingestão Limitada). A principal descoberta deles é que você não precisa pré-processar toda a biblioteca para responder a perguntas complexas. Em vez disso, o agente de IA deles atua como um detetive super organizado que carrega uma prancheta mágica e expansível. Quando o detetive precisa encontrar um fato específico, ele não apenas pesquisa por uma palavra-chave; ele cria um "grupo" temporário de documentos relevantes, filtra-os e até faz cálculos matemáticos sobre os resultados ali mesmo, no momento.
Veja como o método "Zero-Ingestion" deles funciona, usando uma metáfora simples: Imagine que você tem uma pilha de recibos bagunçados de um ano de compras. Um sistema tradicional exigiria que alguém se sentasse, lesse cada recibo e os organizasse em pastas rotuladas (Mercearia, Combustível, Eletrônicos) antes de você fazer uma pergunta como: "Quanto eu gastei com combustível em junho?". Essa organização leva uma eternidade. O ScalableRAG, no entanto, pula a organização inteira. Quando você faz a pergunta, a IA olha para a pilha, encontra todos os recibos que mencionam "combustível", depois filtra essa pilha menor para encontrar apenas os que são de "junho" e, finalmente, soma os valores. Ela faz isso criando e gerenciando "conjuntos" de documentos sobre a hora. É como ter um detetive que pode instantaneamente desenhar um círculo ao redor dos recibos relevantes, contá-los e fazer a conta, tudo sem nunca precisar arquivá-los primeiro.
O artigo mostra que essa abordagem "sobre a hora" é incrivelmente poderosa. Em testes realizados em seis coleções diferentes de documentos (variando de transcrições de audiências governamentais a relatórios financeiros e roteiros de filmes), seu sistema Zero-Ingestion superou facilmente todos os modelos de base (incluindo abordagens de grafo de conhecimento) em três dos seis conjuntos de dados (MuSiQue, Transcripts e Hotels). Nos outros três conjuntos de dados (2Wiki, FinanceBench e ComplexTR), ele apenas perdeu marginalmente para o desempenho máximo, ficando por uma diferença média de apenas 1,63% em relação ao melhor modelo de base para cada um (que foi o A-RAG). Apesar dessas perdas estreitas em metade dos conjuntos de dados, o sistema alcançou uma precisão média em todos os seis conjuntos de dados que foi cerca de 7,36% maior do que o próximo modelo de base mais competitivo. Isso é algo importante porque sugere que, para muitos tipos de perguntas, a etapa cara de pré-construir um banco de dados é, na verdade, desnecessária.
Para tornar o sistema ainda melhor para perguntas mais difíceis, eles também construíram uma versão "Limited-Ingestion". Isso é como dar ao detetive um índice pequeno e pré-fabricado para os tipos mais comuns de pistas, mas ainda permitindo que ele faça o trabalho pesado na hora. Esta versão usa um pouco de pré-processamento (apenas uma amostra dos documentos para encontrar padrões) e um pequeno banco de dados vetorial (uma ferramenta que ajuda a encontrar ideias semelhantes, não apenas palavras exatas). Essa abordagem híbrida elevou a precisão ainda mais, especialmente em conjuntos de dados onde a informação estava escondida em estruturas complexas, como encontrar uma instalação específica em uma descrição de hotel ou uma cláusula específica em um contrato jurídico.
O artigo argumenta explicitamente contra a ideia de que você deve construir um grafo de conhecimento massivo e pré-processado ou um banco de dados SQL completo para responder a perguntas complexas e de múltiplas etapas. Eles mostram que os métodos "pesados em ingestão", que exigem que um LLM leia cada documento e extraia dados antes mesmo do usuário perguntar, são frequentemente exagerados. Embora esses métodos sejam bons em agrupar dados, o ScalableRAG prova que um agente pode fazer esse mesmo agrupamento e matemática instantaneamente durante a conversa. Os autores estão muito confiantes nesses resultados, tendo medido-os através de diversos conjuntos de dados com um método de teste rigoroso, onde uma IA separada atua como um juiz para avaliar as respostas. Eles descobriram que seu sistema não apenas economiza dinheiro e tempo, mas muitas vezes obtém a resposta correta com mais frequência do que as alternativas caras, ou chega muito perto com significativamente menos esforço.
Em suma, o ScalableRAG muda o jogo ao mostrar que você não precisa construir um enorme armazém de conhecimento organizado para encontrar a agulha no palheiro. Em vez disso, você pode enviar um agente inteligente para dentro do palheiro com um conjunto de ferramentas mágicas para agarrar, separar e contar as agulhas exatamente onde elas estão. Quer você precise de um sistema que não custa nada para configurar (Zero-Ingestion) ou de um que adicione um pouco de pré-trabalho para precisão extra (Limited-Ingestion), esta pesquisa sugere que o futuro do esclarecimento de perguntas por IA pode ser muito mais simples, rápido e barato do que pensávamos.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.