Vector RAG vs LLM-Compiled Wiki: A Preregistered Comparison on a Small Multi-Domain Research
Este estudio preregistrado que compara Vector RAG y wikis compiladas por LLM para la síntesis de investigación en múltiples dominios encuentra que, aunque las wikis destacan en las conexiones entre artículos y el soporte de citas a nivel de afirmación, RAG es más rentable para consultas de hechos individuales, demostrando que ninguna arquitectura única equilibra óptimamente la organización de la evidencia, la precisión de las citas y el costo operativo.
Imagina que tienes una biblioteca masiva de 24 artículos de investigación sobre temas como la ética de la inteligencia artificial, el cambio climático y la medicina. Quieres hacerle preguntas a un asistente de inteligencia artificial superinteligente que requieran leer todos estos artículos y conectar los puntos entre ellos.
El artículo compara dos formas diferentes de construir este asistente de inteligencia artificial:
El sistema "Vector RAG" (El bibliotecario con una linterna): Este sistema funciona como un bibliotecario que, cuando le haces una pregunta, corre inmediatamente a las estanterías, agarra algunas páginas específicas (fragmentos) que parecen relevantes y se las entrega a la inteligencia artificial para que escriba una respuesta. Es rápido y barato, pero solo ve las páginas específicas que agarró. Si la respuesta requiere conectar ideas de tres libros diferentes, el bibliotecario podría perderse el vínculo.
La "Wiki compilada por LLM" (El escritor de enciclopedias): Antes de que incluso hagas una pregunta, este sistema toma los 24 artículos y hace que una inteligencia artificial similar a un humano los reescriba en una sola, gigantesca enciclopedia estilo Wikipedia con enlaces cruzados. Cuando haces una pregunta, la inteligencia artificial no mira los artículos crudos; navega por esta enciclopedia preescrita. La idea es que, como la enciclopedia ya está organizada y conectada, la inteligencia artificial puede dar una respuesta mucho mejor y más sintetizada.
La gran carrera: ¿Qué sucedió?
Los investigadores organizaron una prueba justa y a ciegas donde ambos sistemas respondieron las mismas 13 preguntas difíciles. Esto es lo que encontraron, usando analogías simples:
1. La prueba de "La imagen completa" (Conectar los puntos)
La expectativa: Se esperaba que la Wiki ganara fácilmente conectando ideas entre diferentes artículos.
El resultado: La Wiki sí ganó, pero no tanto como se esperaba. Fue excelente tejiendo una historia unificada. Sin embargo, los investigadores encontraron un "código de trucos" para el bibliotecario (RAG): si le dices al bibliotecario que divida la gran pregunta en subpreguntas más pequeñas y busque cada una por separado, el bibliotecario casi iguala a la Wiki por completo.
La lección: La ventaja de la Wiki en "conectar puntos" proviene principalmente de cómo descompone la búsqueda, no solo de ser un libro preescrito.
2. La prueba de "Verificación de hechos" (¿Mintieron?)
La expectativa: La Wiki podría perder puntos porque reescribir artículos en una wiki podría cambiar accidentalmente los hechos (como un juego de "Teléfono").
El resultado: Sorprendentemente, la Wiki fue en realidad mejor apoyando sus afirmaciones específicas con evidencia. Cuando la Wiki decía "El hecho X es cierto", señalaba una página que contenía claramente esa oración. El bibliotecario (RAG), sin embargo, a menudo agarraba una página que estaba cerca del hecho, pero luego la inteligencia artificial "alucinaba" un detalle diminuto o malinterpretaba un número.
El giro: El sistema de puntuación estándar (que miraba la respuesta completa) pensó que el bibliotecario era mejor porque sus respuestas eran más cortas y citaban el texto exacto. Pero cuando los investigadores examinaron cada oración individualmente, la Wiki fue más precisa en sus citas específicas.
3. La prueba de "Costo" (¿Quién es más barato?)
La expectativa: Se suponía que la Wiki sería costosa de construir (escribir la enciclopedia toma tiempo) pero barata de usar después (navegar por un libro es rápido).
El resultado: Aquí es donde la Wiki falló estrepitosamente. Aunque estaba preconstruida, pedirle a la inteligencia artificial que navegara por la Wiki requería que leyera mucho más texto que el bibliotecario.
La analogía: Imagina que el bibliotecario te trae 5 páginas de notas. El sistema Wiki te trae un libro de 200 páginas, te pide que leas 150 páginas de él y luego escribas un resumen.
Las matemáticas: La Wiki costó aproximadamente 21 veces más por pregunta que el bibliotecario. La idea de que "pagar por adelantado ahorra dinero después" no funcionó aquí; el usuario terminó pagando una prima enorme cada vez que hacía una pregunta.
El veredicto final
El artículo concluye que no hay un sistema "perfecto". Es un intercambio de tres vías:
El bibliotecario (RAG de ronda única): Es lo mejor si te importa ahorrar dinero y solo necesitas encontrar un solo hecho rápidamente.
El bibliotecario "inteligente" (RAG descompuesto): Si divides la pregunta en partes, esta versión se vuelve casi tan buena conectando "los puntos" como la Wiki, pero a un costo mucho menor (aproximadamente 3.4 veces más barata que la Wiki).
La Wiki: Es lo mejor si necesitas que la inteligencia artificial cite afirmaciones específicas con mucha precisión y no te importa el alto costo. Sin embargo, es muy costosa de ejecutar.
La conclusión: No puedes tenerlo todo. Puedes tener un sistema que sea barato, uno que conecte ideas bien, o uno que cite evidencia perfectamente, pero en este experimento, ningún sistema individual fue el mejor en las tres cosas. La idea de la "Wiki" no es una bala mágica; solo traslada el problema de "encontrar las páginas correctas" a "pagar una factura enorme por leer demasiado texto".
Resumen Técnico: RAG Vectorial vs. Wiki Compilada por LLM
Enunciado del Problema
El artículo aborda una brecha en las comparaciones cuantitativas entre dos arquitecturas distintas para responder preguntas sobre un corpus de investigación: RAG Vectorial (Generación Aumentada por Recuperación) y Wikis Compiladas por LLM. Mientras que comentarios informales (por ejemplo, la "wiki de markdown agéntica" de Andrej Karpathy) sugieren que compilar la investigación en una wiki interconectada en el momento de la ingestión podría ofrecer una mejor síntesis de múltiples documentos y una amortización de costos, no se había publicado ninguna comparación cuantitativa, preregistrada y directa frente al RAG vectorial por trozos estándar.
El estudio investiga tres compensaciones específicas:
Síntesis: ¿La arquitectura wiki conecta mejor los hallazgos a través de múltiples documentos?
Fidelidad: ¿El proceso de reescribir documentos en páginas wiki degrada la fidelidad de la fuente o la anclaje a la fuente original?
Costo: ¿El costo inicial de construir una wiki resulta en costos de consulta más baratos, creando un punto de equilibrio después de cierto número de preguntas?
Metodología
El estudio es una comparación cegada, preregistrada y con dos jueces realizada sobre un corpus fijo de 24 artículos revisados por pares en tres dominios (ética y ley de IA, ciencia climática, medicina de precisión).
Sistemas Comparados:
RAG Vectorial: Una tubería de recuperación-entonces-generación de una sola ronda. Utiliza fragmentación en markdown consciente del documento, expansión de múltiples consultas, recuperación híbrida (densa + dispersa), reordenamiento por Cohere y validación correctiva inspirada en CRAG. No realiza recuperación durante la generación.
Wiki LLM: Un proceso de compilación fuera de línea donde un LLM convierte los documentos en una wiki persistente en markdown, interconectada (entidades, conceptos, fuentes). En el momento de la consulta, un agente que utiliza herramientas navega por esta wiki (listando páginas, leyendo contenido) para generar respuestas.
Evaluación:
Preguntas: 13 preguntas de evaluación en seis niveles de dificultad (cronológica, conflicto, multi-salto, emergencia, política, verificación de sesgo).
Modelos: Ambos sistemas utilizaron Claude Opus 4.7 (xhigh) para la generación de respuestas.
Calificación: Las respuestas fueron puntuadas por GPT-5.4 (principal) y Gemini 2.5 Pro (fiabilidad entre calificadores) utilizando un orden cegado y aleatorizado.
Rúbrica: Cuatro criterios de 1 a 10: anclaje (las afirmaciones rastrean a la fuente), integridad estructural (narrativa unificada), conciencia de conflicto y mapeo entre documentos (síntesis multi-salto).
Hipótesis:
H1 (Síntesis): Wiki > RAG por ≥2.0 puntos en los criterios de síntesis para preguntas de multi-salto/emergencia.
H2 (Fuente Puntual): RAG ≥ Wiki en anclaje para preguntas de verificación de sesgo.
H3 (Costo): Costo de ingestión de Wiki > Costo de ingestión de RAG Y Costo de consulta de Wiki < Costo de consulta de RAG.
Contribuciones Clave
Comparación Preregistrada: La primera comparación cuantitativa y cegada de una wiki compilada por LLM frente a un RAG vectorial.
Hallazgos de la Metodología de Evaluación: Demostró que los jueces LLM se comportan de manera diferente según la concreción de la rúbrica. Los jueces coincidieron estrechamente en mapeo entre documentos (definición concreta) pero mostraron una deriva significativa de "juez techo" en criterios holísticos como integridad estructural, donde un juez (Gemini) frecuentemente saturó las puntuaciones cerca de 10/10 para la wiki.
Ablación Exploratoria de Descomposición: Un análisis post-hoc de una variante RAG-Descomposición (dividir preguntas en subpreguntas) para aislar si la ventaja de la wiki proviene de la cobertura de recuperación o de la alineación de representaciones.
Resultados
1. Síntesis y Organización (H1)
Ventaja de la Wiki: La wiki superó significativamente al RAG de una sola ronda en mapeo entre documentos (síntesis entre documentos), superando el umbral preregistrado (+6.625 vs. +2.0).
Organización: La ventaja en integridad estructural fue más débil después del ajuste de Fiabilidad entre Calificadores (IRR) (+1.625), quedando justo por debajo del umbral de +2.0.
Efecto de Descomposición: Una variante de RAG basada en descomposición recuperó aproximadamente el 88% de la ventaja de síntesis de la wiki, reduciendo la brecha por debajo del umbral registrado. Esto sugiere que la ventaja de síntesis de la wiki se debe en gran medida a una mejor cobertura de recuperación a través de documentos, lo cual puede mitigarse descomponiendo las consultas en RAG.
2. Anclaje y Fidelidad (H2)
Puntuación de la Rúbrica: El RAG cumplió la prueba preregistrada para el anclaje de hechos únicos en el nivel de verificación de sesgo (RAG > Wiki), satisfaciendo H2.
Análisis a Nivel de Afirmación (Post-hoc): Un análisis granular de afirmaciones atómicas reveló una inversión en el mecanismo. Aunque el RAG obtuvo una puntuación más alta en la rúbrica holística, las afirmaciones citadas por la wiki tenían aproximadamente 2 veces más probabilidades de estar estrictamente respaldadas por el texto citado y 4–5 veces menos probabilidades de no estar respaldadas en comparación con el RAG.
Interpretación: El RAG tiende a recuperar un fragmento y luego sintetizar/extrapolar más allá de él (lo que lleva a una coherencia holística pero una alineación estricta más baja). La wiki posiciona previamente la evidencia en artefactos con "forma de afirmación", lo que lleva a una mayor precisión en las citas, aunque esto no garantiza la fidelidad al PDF original (ya que la wiki en sí misma es una compilación).
3. Asimetría de Costos (H3)
Costo de Consulta: La ventaja de costo esperada para la wiki falló completamente. La wiki consumió 21 veces más tokens por consulta que el RAG (1.65M vs. 78k tokens).
Amortización: Debido a que el costo por consulta es más alto, el punto de "equilibrio" para amortizar el costo de ingestión es matemáticamente imposible (N negativo). La intuición de costos de que "la pre-compilación paga una tarifa por consultas más baratas" fue refutada bajo la configuración probada.
Costo de Ingestión: La relación de costo de ingestión no pudo ser adjudicada debido a un problema de contabilidad de almacenamiento en caché de prompts en la telemetría (agregando tokens en caché y sin caché), pero el resultado del lado de la consulta por sí solo refuta la hipótesis conjunta H3.
4. Ablación de RAG-Descomposición
Síntesis: RAG-Descomposición cerró la brecha de síntesis con la wiki, pero a un costo de tokens LLM 3.4 veces mayor que el RAG de una sola ronda (aunque aún 3.4 veces más barato que la wiki).
Alineación de Citas: RAG-Descomposición no recuperó la ventaja de la wiki en el respaldo de citas afirmación por afirmación (19.2% respaldado vs. 40.2% de la Wiki). Esto indica que la cobertura de recuperación y la alineación de representaciones son mecanismos separables.
Significancia y Conclusiones
El artículo concluye que la síntesis de investigación con anclaje no es una única capacidad. Ninguna arquitectura individual destacó en las tres dimensiones: organización, alineación de citas y costo.
RAG de Una Sola Ronda: Mejor para recuperación de fuente puntual sensible al costo.
RAG-Descomposición: Una vía intermedia viable para la síntesis de múltiples documentos donde la estructura importa, ofreciendo aproximadamente el 88% del beneficio de síntesis de la wiki a una fracción del costo de consulta, aunque aún se queda atrás en la alineación estricta de citas.
Wiki LLM: Superior para la alineación de citas de afirmaciones en artefactos de evidencia (la página citada respalda directamente la afirmación), pero a un costo prohibitivo de tokens por consulta (~21 veces el RAG) y pendiente de validación de la fidelidad de la fuente.
El estudio enfatiza que las evaluaciones deben reportar estructura de síntesis, alineación de citas de afirmaciones y costo por separado en lugar de colapsarlos en un único veredicto de "anclaje". Los hallazgos también destacan la fragilidad de las evaluaciones LLM-como-juez en criterios holísticos, sugiriendo que son necesarias definiciones operativas concretas para un acuerdo confiable entre jueces. Se necesita trabajo futuro para validar la fidelidad de la fuente de la wiki frente a los PDF originales y para explorar arquitecturas híbridas que combinen la recuperación iterativa con la reparación de citas fundamentada en afirmaciones.