← Últimos artículos
💬 NLP

CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question Answering

CompactRAG es un marco de trabajo rentable para la respuesta a preguntas de múltiples saltos que minimiza las llamadas al LLM y la sobrecarga de tokens al desacoplar la reestructuración del corpus fuera de línea en una base de conocimientos de preguntas y respuestas atómica de una etapa de razonamiento en línea que depende de la recuperación densa y la extracción de respuestas, invocando al LLM solo dos veces independientemente de la complejidad del razonamiento.

Autores originales: Hao Yang, Zhiyu Yang, Xupeng Zhang, Wei Wei, Yunjie Zhang, Lin Yang

Publicado 2026-02-06
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Hao Yang, Zhiyu Yang, Xupeng Zhang, Wei Wei, Yunjie Zhang, Lin Yang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de resolver un misterio complejo, como averiguar quién es el director de una película específica, pero la respuesta no está en un solo lugar. Tienes que leer un libro sobre la película, encontrar el nombre del director, luego buscar la biografía de ese director para encontrar dónde nació y, finalmente, consultar un mapa para ver la ciudad.

Esto es lo que es la Respuesta a Preguntas de Multi-Salto (Multi-Hop Question Answering): resolver un rompecabezas que requiere saltar entre diferentes piezas de información (saltos) para obtener la respuesta final.

El Problema: El "Bibliotecario Excesivamente Trabajador"

Los sistemas actuales (llamados RAG o Generación Aumentada por Recuperación) intentan resolver esto pidiéndole a una IA súper inteligente (un Modelo de Lenguaje Grande o LLM) que haga el trabajo. Sin embargo, la forma en que lo hacen es ineficiente.

Piensa en el método actual como contratar a un bibliotecario muy caro y de altos ingresos para resolver tu misterio.

  1. Le haces una pregunta al bibliotecario.
  2. El bibliotecario corre hacia los estantes, agarra un libro, lo lee y escribe una nota.
  3. El bibliotecario regresa corriendo hacia ti, lee su nota y dice: "Está bien, ahora necesito saber dónde nació el director".
  4. Tú preguntas de nuevo. El bibliotecario corre hacia los estantes otra vez, agarra un libro diferente, lo lee y escribe otra nota.
  5. Repite este proceso por cada uno de los pasos del misterio.

¿El resultado? El bibliotecario se cansa, el proceso tarda una eternidad y tienes que pagar una cuenta enorme (en "tokens" o potencia de cómputo) porque el bibliotecario está haciendo tantos viajes de ida y vuelta. Además, a veces el bibliotecario se confunde sobre a quién se refiere "él" en el segundo paso, lo que lleva a respuestas erróneas.

La Solución: CompactRAG (La "Caja de Conocimiento Pre-Empaquetada")

Los autores de este artículo, CompactRAG, proponen una forma más inteligente. En lugar de hacer que el caro bibliotecario corra por la biblioteca cada vez que haces una pregunta, ellos reorganizan la biblioteca antes de que tú aparezcas.

Paso 1: La Preparación Offline (La "Configuración de Una Sola Vez")

Antes de que cualquier usuario haga una pregunta, el sistema utiliza una IA para leer la biblioteca entera de documentos una sola vez.

  • Descompone cada documento en pequeñas y perfectas "tarjetas de datos" autónomas.
  • En lugar de un párrafo completo que dice: "La película fue realizada en 1953 por Arthur Crabtree", crea una tarjeta específica que dice: "Pregunta: ¿Quién dirigió 'The Wedding of Lilli Marlene'? Respuesta: Arthur Crabtree."
  • Hace esto para cada dato en la biblioteca. Esto crea una Base de Conocimiento Compacta.

Analogía: Imagina que en lugar de tener una biblioteca desordenada, tienes una caja gigante de fichas bibliográficas perfectamente organizada. Cada ficha tiene una pregunta específica en el frente y la respuesta exacta en el reverso. Sin adornos, sin palabras extra.

Paso 2: El Razonamiento Online (La "Regla de los Dos Viajes")

Ahora, cuando un usuario hace una pregunta compleja, el sistema funciona así:

  1. La Descomposición (Viaje 1): Se llama al caro bibliotecario (LLM) una sola vez solo para descomponer el gran misterio en pasos pequeños y simples.
    • Usuario: "¿Dónde nació el director de la película?"
    • LLM: "Bien, Paso 1: ¿Quién dirigió la película? Paso 2: ¿Dónde nació esa persona?"
  2. La Búsqueda (Sin Necesidad de Bibliotecario): El sistema no llama al caro bibliotecario de nuevo. En su lugar, utiliza un robot rápido y barato para buscar las respuestas en la caja de "tarjetas de datos" pre-elaboradas.
    • El robot encuentra la tarjeta de "¿Quién dirigió...?" y obtiene "Arthur Crabtree".
    • El robot entonces reescribe la siguiente pregunta para que sea clara: "¿Dónde nació Arthur Crabtree?" (Esto evita la confusión con el "él").
    • El robot encuentra la tarjeta de "¿Dónde nació Arthur Crabtree?" y obtiene "Londres".
  3. La Respuesta Final (Viaje 2): Una vez que el robot tiene todas las pequeñas respuestas, se llama al caro bibliotecario una última vez para juntar las piezas y darte la respuesta final.

La Magia: El caro bibliotecario es llamado solo dos veces por pregunta, sin importar cuántos pasos (saltos) tenga el misterio. Ya sea que el rompecabezas tenga 2 pasos o 10 pasos, el costo se mantiene igual.

Por qué esto es importante

  • Ahorra Dinero: Dejas de pagar al caro bibliotecario por correr de ida y vuelta. Solo los pagas dos veces.
  • Ahorra Tiempo: El proceso es mucho más rápido porque las "tarjetas de datos" son fáciles de encontrar y leer.
  • Menos Errores: Al reescribir las preguntas para incluir nombres específicos (como "Arthur Crabtree" en lugar de "él"), el sistema no se confunde sobre de quién está hablando.

Los Resultados

El artículo probó esto en tres conjuntos de datos de rompecabezas difíciles (HotpotQA, 2WikiMultiHopQA y MuSiQue).

  • Precisión: CompactRAG fue tan bueno resolviendo los rompecabezas como los métodos antiguos y caros.
  • Eficiencia: Utilizó significativamente menos "tokens" (la moneda de la computación de IA). En algunos casos, utilizó menos de la mitad de los recursos de los otros métodos.

Resumen

CompactRAG es como convertir una investigación caótica, cara y de constantes idas y vueltas en una operación optimizada y pre-empaquetada. Realiza el trabajo pesado de organizar el conocimiento una vez por adelantado, de modo que resolver cualquier nuevo misterio se convierta en un proceso rápido, barato y de dos pasos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →