← Últimos artículos
🤖 AI

ScalableRAG: High-Quality RAG at Zero Ingestion Cost

El artículo presenta ScalableRAG, un enfoque de Generación Aumentada por Recuperación de alta calidad que logra una precisión superior en múltiples conjuntos de datos con costos de ingestión de cero al utilizar un espacio de trabajo dinámico para el razonamiento de agregación sobre la marcha, ofreciendo además una variante de Ingestión Limitada que mejora aún más el rendimiento a escala con un uso mínimo de la base de datos vectorial.

Autores originales: Hilaf Hasson, Aditya Chakravarty, Jayant Thomas, Krishna Gogineni

Publicado 2026-07-29
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Hilaf Hasson, Aditya Chakravarty, Jayant Thomas, Krishna Gogineni

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de resolver un misterio masivo leyendo una biblioteca de un millón de libros. En el mundo de la inteligencia artificial, esto se llama Generación Aumentada por Recuperación (RAG). Piensa en una IA estándar como un detective brillante que ha leído todo internet pero que no puede recordar detalles específicos de un archivo polvoriento. Para ayudar al detective, solemos construir un "catálogo de fichas" o un "grafo de conocimiento" antes de que comience a trabajar. Esto implica leer cada uno de los libros, resumirlos y organizarlos en una base de datos compleja para que la IA pueda encontrar la página adecuada rápidamente. Es como contratar a un equipo de bibliotecarios para que pasen semanas indexando la biblioteca antes de que el detective siquiera llegue. Este proceso es costoso, lento y requiere mucha potencia de cálculo solo para empezar. Pero, ¿qué pasaría si el detective pudiera entrar en la biblioteca, mirar los libros y resolver las dudas sobre la marcha sin necesidad de un catálogo preestablecido? Esa es la gran pregunta que aborda este artículo: ¿Podemos obtener los mismos resultados brillantes sin pagar el alto costo de "ingestión" de construir primero esa enorme base de datos?

Los investigadores de Cohesity, liderados por Hilaf Hasson y su equipo, dicen que la respuesta es un rotundo "sí". Presentan un nuevo sistema llamado ScalableRAG, que viene en dos variantes: Zero-Ingestion (Ingestión Cero) y Limited-Ingestion (Ingestión Limitada). Su principal descubrimiento es que no es necesario preprocesar toda la biblioteca para responder preguntas complejas. En su lugar, su agente de IA actúa como un detective súper organizado que lleva una tabla portapapeles mágica y expandible. Cuando el detective necesita encontrar un dato específico, no se limita a buscar una palabra clave; crea un "grupo" temporal de documentos relevantes, los filtra e incluso realiza cálculos matemáticos con los resultados allí mismo, en el momento.

Así es como funciona su método de "Zero-Ingestion", utilizando una metáfora sencilla: Imagina que tienes una pila de recibos mezclados de un año de compras. Un sistema tradicional requeriría que alguien se sentara, leyera cada recibo y los clasificara en carpetas etiquetadas (Comestibles, Gasolina, Electrónica) antes de que tú hagas una pregunta como: "¿Cuánto gasté en gasolina en junio?". Esta clasificación toma una eternidad. ScalableRAG, sin embargo, se salta la clasificación por completo. Cuando haces la pregunta, la IA mira la pila, encuentra todos los recibos que mencionan "gasolina", luego filtra esa pila más pequeña para encontrar solo los de "junio" y finalmente suma los números. Lo hace creando y gestionando "conjuntos" de documentos sobre la marcha. Es como tener un detective que puede dibujar instantáneamente un círculo alrededor de los recibos relevantes, contarlos y hacer la matemática, todo sin necesidad de haberlos archivado primero.

El artículo demuestra que este enfoque "sobre la marcha" es increíblemente poderoso. En pruebas realizadas en seis colecciones diferentes de documentos (que van desde transcripciones de audiencias gubernamentales hasta informes financieros y guiones de películas), su sistema Zero-Ingestion superó con creces a todos los modelos de referencia (incluyendo los enfoques de grafos de conocimiento) en tres de los seis conjuntos de datos (MuSiQue, Transcripts y Hotels). En los otros tres conjuntos de datos (2Wiki, FinanceBench y ComplexTR), solo perdió por un margen mínimo en cuanto al rendimiento máximo, quedando por debajo de un promedio de apenas un 1.63% respecto al mejor modelo de referencia para cada uno (que fue A-RAG). A pesar de estas estrechas pérdidas en la mitad de los conjuntos de datos, el sistema logró una precisión promedio en los seis conjuntos de datos que fue aproximadamente un 7.36% superior al siguiente modelo de referencia más competitivo. Esto es importante porque sugiere que, para muchos tipos de preguntas, el costoso paso de preconstruir una base de datos es en realidad innecesario.

Para hacer el sistema aún mejor para preguntas más complicadas, también construyeron una versión de "Limited-Ingestion". Esto es como darle al detective un índice pequeño y prefabricado para los tipos de pistas más comunes, pero permitiéndole seguir haciendo el trabajo pesado sobre la marcha. Esta versión utiliza un poco de preprocesamiento (solo una muestra de los documentos para encontrar patrones) y una pequeña base de datos vectorial (una herramienta que ayuda a encontrar ideas similares, no solo palabras exactas). Este enfoque híbrido elevó la precisión aún más, especialmente en conjuntos de datos donde la información estaba oculta en estructuras complejas, como encontrar una instalación específica en la descripción de un hotel o una cláusula específica en un contrato legal.

El artículo argumenta explícitamente en contra de la idea de que debes construir un grafo de conocimiento masivo y preprocesado o una base de datos SQL completa para responder preguntas complejas y de múltiples pasos. Demuestran que los métodos "pesados en la ingestión", que requieren que un LLM lea cada documento y extraiga datos antes de que el usuario pregunte algo, suelen ser excesivos. Aunque esos métodos son buenos agrupando datos, ScalableRAG demuestra que un agente puede realizar ese mismo agrupamiento y matemáticas de forma instantánea durante la conversación. Los autores están muy seguros de estos resultados, habiéndolos medido en diversos conjuntos de datos mediante un método de prueba riguroso donde una IA separada actúa como juez para calificar las respuestas. Encontraron que su sistema no solo ahorra dinero y tiempo, sino que a menudo obtiene la respuesta correcta con más frecuencia que las alternativas costosas, o se queda muy cerca con mucho menos esfuerzo.

En resumen, ScalableRAG cambia las reglas del juego al demostrar que no necesitas construir un almacén gigante de conocimiento organizado para encontrar la aguja en el pajar. En su lugar, puedes enviar a un agente inteligente al pajar con un conjunto de herramientas mágicas para agarrar, clasificar y contar las agujas justo donde están. Ya sea que necesites un sistema que no cueste nada configurar (Zero-Ingestion) o uno que añada un poco de trabajo previo para una precisión extra (Limited-Ingestion), esta investigación sugiere que el futuro de la resolución de preguntas por IA podría ser mucho más simple, rápido y económico de lo que pensábamos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →