Vector RAG vs LLM-Compiled Wiki: A Preregistered Comparison on a Small Multi-Domain Research
Este estudo pré-registrado que compara RAG vetorial e wikis compiladas por LLM para síntese de pesquisa multi-domínio conclui que, embora as wikis se destaquem em conexões entre artigos e suporte de citação ao nível de afirmações, o RAG é mais custo-efetivo para consultas de fatos únicos, demonstrando que nenhuma arquitetura única equilibra idealmente a organização de evidências, a precisão das citações e o custo operacional.
Imagine que você tem uma biblioteca massiva de 24 artigos de pesquisa sobre temas como ética da IA, mudanças climáticas e medicina. Você deseja fazer perguntas a um assistente de IA superinteligente que exigem ler todos esses artigos e conectar os pontos entre eles.
O artigo compara duas maneiras diferentes de construir esse assistente de IA:
O Sistema "RAG Vetorial" (O Bibliotecário com uma Lanterna): Este sistema funciona como um bibliotecário que, quando você faz uma pergunta, corre imediatamente para as estantes, pega algumas páginas específicas (trechos) que parecem relevantes e as entrega à IA para escrever uma resposta. É rápido e barato, mas ele só vê as páginas específicas que pegou. Se a resposta exigir conectar ideias de três livros diferentes, o bibliotecário pode perder a ligação.
A "Wiki Compilada por LLM" (O Escritor de Enciclopédia): Antes mesmo de você fazer uma pergunta, este sistema pega todos os 24 artigos e faz uma IA semelhante a um humano reescrevê-los em uma única, gigante enciclopédia estilo Wikipedia, com links cruzados. Quando você faz uma pergunta, a IA não olha os artigos brutos; ela navega por essa enciclopédia pré-escrita. A ideia é que, como a enciclopédia já está organizada e conectada, a IA pode fornecer uma resposta muito melhor e mais sintetizada.
A Grande Corrida: O Que Aconteceu?
Os pesquisadores montaram um teste justo e cego onde ambos os sistemas responderam às mesmas 13 perguntas difíceis. Aqui está o que eles descobriram, usando analogias simples:
1. O Teste do "Quadro Geral" (Conectando os Pontos)
A Expectativa: Esperava-se que a Wiki vencesse facilmente na conexão de ideias entre diferentes artigos.
O Resultado: A Wiki venceu, mas não tanto quanto se esperava. Ela foi ótima em tecer uma história unificada. No entanto, os pesquisadores encontraram um "código de trapaça" para o Bibliotecário (RAG): se você disser ao Bibliotecário para dividir a grande pergunta em subperguntas menores e pesquisar cada uma separadamente, o Bibliotecário alcança a Wiki quase totalmente.
A Lição: A vantagem da Wiki em "conectar pontos" vem principalmente de como ela divide a pesquisa, e não apenas de ser um livro pré-escrito.
2. O Teste de "Verificação de Fatos" (Eles mentiram?)
A Expectativa: A Wiki poderia perder pontos porque reescrever artigos em uma wiki poderia acidentalmente alterar os fatos (como um jogo de "Telefone").
O Resultado: Surpreendentemente, a Wiki foi na verdade melhor em apoiar suas alegações específicas com evidências. Quando a Wiki dizia "O Fato X é verdadeiro", ela apontava para uma página que continha claramente aquela frase. O Bibliotecário (RAG), no entanto, frequentemente pegava uma página que estava perto do fato, mas então a IA "alucinava" um detalhe minúsculo ou lia um número errado.
A Reviravolta: O sistema de pontuação padrão (que analisava a resposta completa) achou que o Bibliotecário era melhor porque suas respostas eram mais curtas e citavam o texto exato. Mas quando os pesquisadores olharam para cada frase individualmente, a Wiki foi mais precisa em suas citações específicas.
3. O Teste de "Custo" (Quem é mais barato?)
A Expectativa: A Wiki deveria ser cara de construir (escrever a enciclopédia leva tempo), mas barata de usar depois (navegar em um livro é rápido).
O Resultado: É aqui que a Wiki falhou estrepitosamente. Embora fosse pré-construída, pedir à IA para navegar na Wiki exigia que ela lesse muito mais texto do que o Bibliotecário.
A Analogia: Imagine que o Bibliotecário traz 5 páginas de anotações para você. O sistema Wiki traz um livro de 200 páginas, pede que você leia 150 páginas dele e, em seguida, escreva um resumo.
A Matemática: A Wiki custou cerca de 21 vezes mais por pergunta do que o Bibliotecário. A ideia de que "pagar adiantado economiza dinheiro depois" não funcionou aqui; o usuário acabou pagando um prêmio enorme toda vez que fazia uma pergunta.
O Veredito Final
O artigo conclui que não há um sistema "perfeito". É um trade-off de três vias:
O Bibliotecário (RAG de Rodada Única): Melhor se você se importa em economizar dinheiro e apenas precisa encontrar um fato único rapidamente.
O Bibliotecário "Inteligente" (RAG Decomposto): Se você dividir a pergunta em partes, esta versão fica quase tão boa em "conectar os pontos" quanto a Wiki, mas a um custo muito menor (cerca de 3,4 vezes mais barata que a Wiki).
A Wiki: Melhor se você precisa que a IA cite alegações específicas com muita precisão e não se importa com o alto custo. No entanto, é muito cara para operar.
A Conclusão: Você não pode ter tudo. Você pode ter um sistema que é barato, um que conecta ideias bem, ou um que cita evidências perfeitamente, mas neste experimento, nenhum sistema único foi o melhor em todos os três. A ideia da "Wiki" não é uma bala de prata; ela apenas desloca o problema de "encontrar as páginas certas" para "pagar uma conta enorme por ler texto demais".
Resumo Técnico: Vector RAG vs. Wiki Compilada por LLM
Declaração do Problema
O artigo aborda uma lacuna em comparações quantitativas entre duas arquiteturas distintas para responder a perguntas sobre um corpus de pesquisa: Vector RAG (Geração Aumentada por Recuperação) e Wikis Compiladas por LLM. Embora comentários informais (por exemplo, a "wiki de markdown agênica" de Andrej Karpathy) sugiram que compilar pesquisas em uma wiki interligada no momento da ingestão possa oferecer melhor síntese de múltiplos artigos e amortização de custos, nenhuma comparação quantitativa pré-registrada e direta contra o RAG padrão de vetores de blocos havia sido publicada.
O estudo investiga três trade-offs específicos:
Síntese: A arquitetura de wiki conecta melhor as descobertas entre múltiplos artigos?
Fidelidade: O processo de reescrever artigos em páginas de wiki degrada a fidelidade à fonte ou o ancoramento à fonte pontual?
Custo: O custo inicial de construir uma wiki resulta em custos mais baixos no momento da consulta, criando um ponto de equilíbrio após um certo número de perguntas?
Metodologia
O estudo é uma comparação cega, pré-registrada, com dois juízes conduzida em um corpus fixo de 24 artigos revisados por pares em três domínios (ética e direito da IA, ciência climática, medicina de precisão).
Sistemas Comparados:
Vector RAG: Um pipeline de recuperação-então-geração de rodada única. Utiliza fragmentação de markdown consciente de documentos, expansão de múltiplas consultas, recuperação híbrida (densa + esparsa), reclassificação pela Cohere e validação corretiva inspirada em CRAG. Não realiza recuperação durante a geração.
Wiki LLM: Um processo de compilação offline onde um LLM converte artigos em uma wiki persistente de markdown interligada (entidades, conceitos, fontes). No momento da consulta, um agente que usa ferramentas navega nesta wiki (listando páginas, lendo conteúdo) para gerar respostas.
Avaliação:
Perguntas: 13 perguntas de avaliação em seis níveis de dificuldade (cronológica, conflito, multi-hop, emergência, política, verificação de viés).
Modelos: Ambos os sistemas utilizaram Claude Opus 4.7 (xhigh) para geração de respostas.
Julgamento: As respostas foram pontuadas por GPT-5.4 (principal) e Gemini 2.5 Pro (confiabilidade entre juízes) usando uma ordem cega e aleatorizada.
Critério: Quatro critérios de 1 a 10: ancoragem (afirmações rastreáveis à fonte), integridade estrutural (narrativa unificada), consciência de conflito e mapeamento entre artigos (síntese multi-hop).
Hipóteses:
H1 (Síntese): Wiki > RAG por ≥2,0 pontos nos critérios de síntese para perguntas multi-hop/emergência.
H2 (Fonte Pontual): RAG ≥ Wiki na ancoragem para perguntas de verificação de viés.
H3 (Custo): Custo de ingestão da Wiki > Custo de ingestão do RAG E Custo de consulta da Wiki < Custo de consulta do RAG.
Principais Contribuições
Comparação Pré-registrada: A primeira comparação quantitativa e cega de uma wiki compilada por LLM contra RAG de vetores.
Descobertas da Metodologia de Avaliação: Demonstrou que juízes LLM comportam-se de forma diferente com base na concretude do critério. Os juízes concordaram estreitamente sobre mapeamento entre artigos (definição concreta), mas mostraram um desvio significativo de "juiz de teto" em critérios holísticos como integridade estrutural, onde um juiz (Gemini) frequentemente saturou as pontuações perto de 10/10 para a wiki.
Ablação Exploratória de Decomposição: Uma análise post-hoc de uma variante Decomposição-RAG (quebra de perguntas em subperguntas) para isolar se a vantagem da wiki decorre da cobertura de recuperação ou do alinhamento de representação.
Resultados
1. Síntese e Organização (H1)
Vantagem da Wiki: A wiki superou significativamente o RAG de rodada única em mapeamento entre artigos (síntese entre artigos), ultrapassando o limiar pré-registrado (+6,625 vs. +2,0).
Organização: A vantagem em integridade estrutural foi mais fraca após o ajuste de Confiabilidade entre Juízes (IRR) (+1,625), ficando logo abaixo do limiar de +2,0.
Efeito de Decomposição: Uma variante de RAG baseada em decomposição recuperou ~88% da vantagem de síntese da wiki, reduzindo a lacuna para abaixo do limiar registrado. Isso sugere que a vantagem de síntese da wiki deve-se em grande parte a uma melhor cobertura de recuperação entre documentos, o que pode ser mitigado pela decomposição de consultas no RAG.
2. Ancoragem e Fidelidade (H2)
Pontuação do Critério: O RAG atendeu ao teste pré-registrado para ancoragem de fato único no nível de verificação de viés (RAG > Wiki), satisfazendo H2.
Análise ao Nível de Afirmação (Post-hoc): Uma análise granular de afirmações atômicas revelou uma reversão no mecanismo. Embora o RAG tivesse pontuação mais alta no critério holístico, as afirmações citadas da wiki eram ~2x mais propensas a serem estritamente suportadas pelo texto citado e ~4–5x menos propensas a não serem suportadas em comparação com o RAG.
Interpretação: O RAG tende a recuperar um bloco e depois sintetizar/extrapolar além dele (levando a coerência holística, mas menor alinhamento estrito). A wiki posiciona previamente evidências em artefatos "formatados como afirmação", levando a maior precisão de citação, embora isso não garanta fidelidade ao PDF original (já que a wiki em si é uma compilação).
3. Assimetria de Custos (H3)
Custo de Consulta: A vantagem de custo esperada para a wiki falhou completamente. A wiki consumiu 21x mais tokens por consulta que o RAG (1,65M vs. 78k tokens).
Amortização: Como o custo por consulta é maior, o ponto de "equilíbrio" para amortizar o custo de ingestão é matematicamente impossível (N negativo). A intuição de custo de que "pré-compilação paga uma taxa por consultas mais baratas" foi refutada sob a configuração testada.
Custo de Ingestão: A razão de custo de ingestão não pôde ser adjudicada devido a um problema de contabilidade de cache de prompts na telemetria (agregando tokens em cache e sem cache), mas o resultado do lado da consulta sozinho refuta a hipótese conjunta H3.
4. Ablação Decomposição-RAG
Síntese: Decomp-RAG fechou a lacuna de síntese com a wiki, mas a um custo de tokens LLM 3,4x maior que o RAG de rodada única (embora ainda 3,4x mais barato que a wiki).
Alinhamento de Citação: Decomp-RAG não recuperou a vantagem da wiki no suporte de citação afirmação por afirmação (19,2% suportado vs. 40,2% da Wiki). Isso indica que a cobertura de recuperação e o alinhamento de representação são mecanismos separáveis.
Significado e Conclusões
O artigo conclui que a síntese de pesquisa ancorada não é uma única capacidade. Nenhuma arquitetura única se destacou nas três dimensões: organização, alinhamento de citação e custo.
RAG de Rodada Única: Melhor para recuperação de fonte pontual sensível a custos.
Decomposição-RAG: Um meio-termo viável para síntese de múltiplos artigos onde a estrutura importa, oferecendo ~88% do benefício de síntese da wiki a uma fração do custo de consulta, embora ainda fique atrás no alinhamento estrito de citação.
Wiki LLM: Superior para alinhamento de citação de afirmação de artefato de evidência (a página citada suporta diretamente a afirmação), mas a um custo proibitivo de tokens por consulta (~21x RAG) e aguardando validação da fidelidade da fonte.
O estudo enfatiza que as avaliações devem relatar estrutura de síntese, alinhamento de citação de afirmação e custo separadamente, em vez de colapsá-los em um único veredito de "ancoragem". As descobertas também destacam a fragilidade de avaliações com LLM como juiz em critérios holísticos, sugerindo que definições operacionais concretas são necessárias para um acordo confiável entre juízes. Trabalhos futuros são necessários para validar a fidelidade da fonte da wiki contra PDFs originais e explorar arquiteturas híbridas que combinem recuperação iterativa com reparo de citação ancorado em afirmações.