← Derniers articles
🤖 AI

ScalableRAG: High-Quality RAG at Zero Ingestion Cost

L'article présente ScalableRAG, une approche de génération augmentée par récupération de haute qualité qui atteint une précision supérieure sur plusieurs jeux de données avec des coûts d'ingestion nuls en utilisant un espace de travail dynamique pour un raisonnement agrégatif à la volée, tout en proposant une variante à ingestion limitée qui améliore davantage les performances à grande échelle avec une utilisation minimale de base de données vectorielle.

Auteurs originaux : Hilaf Hasson, Aditya Chakravarty, Jayant Thomas, Krishna Gogineni

Publié 2026-07-29
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hilaf Hasson, Aditya Chakravarty, Jayant Thomas, Krishna Gogineni

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de résoudre un mystère colossal en lisant une bibliothèque d'un million de livres. Dans le monde de l'intelligence artificielle, cela s'appelle la Génération Augmentée par Récupération (RAG - Retrieval-Augmented Generation). Considérez une IA standard comme un détective brillant qui a lu l'intégralité d'Internet mais qui ne parvient pas à se souvenir de détails spécifiques provenant d'archives poussiéreuses. Pour aider le détective, nous construisons généralement un « catalogue » ou un « graphe de connaissances » avant qu'il ne commence son travail. Cela implique de lire chaque livre, de le résumer et de l'organiser dans une base de données complexe pour que l'IA puisse trouver rapidement la bonne page. C'est comme engager une équipe de bibliothécaires pour passer des semaines à indexer la bibliothèque avant même l'arrivée du détective. Ce processus est coûteux, lent et nécessite une grande puissance de calcul rien que pour démarrer. Mais et si le détective pouvait entrer dans la bibliothèque, consulter les livres et trouver les réponses à la volée sans avoir besoin d'un catalogue préétabli ? C'est la grande question que traite ce document : pouvons-nous obtenir les mêmes résultats brillants sans payer le coût élevé d'« ingestion » lié à la construction de cette base de données massive au préalable ?

Les chercheurs de Cohesity, dirigés par Hilaf Hasson et son équipe, affirment que la réponse est un « oui » retentissant. Ils présentent un nouveau système appelé ScalableRAG, qui se décline en deux versions : Zero-Ingestion (Zéro-Ingestion) et Limited-Ingestion (Ingestion Limitée). Leur principale découverte est qu'il n'est pas nécessaire de prétraiter l'intégralité de la bibliothèque pour répondre à des questions complexes. Au lieu de cela, leur agent d'IA agit comme un détective super organisé qui transporte un presse-papiers magique et extensible. Lorsque le détective a besoin de trouver un fait spécifique, il ne se contente pas de chercher un mot-clé ; il crée un « groupe » temporaire de documents pertinents, les filtre, et effectue même des calculs sur les résultats, là, sur le moment.

Voici comment fonctionne leur méthode « Zero-Ingestion », en utilisant une métaphore simple : Imaginez que vous avez une pile de reçus mélangés provenant d'une année entière de shopping. Un système traditionnel exigerait que quelqu'un s'assoie, lise chaque reçu et les trie dans des dossiers étiquetés (Alimentation, Essence, Électronique) avant que vous ne posiez une question telle que : « Combien ai-je dépensé en essence en juin ? » Ce tri prend un temps infini. ScalableRAG, cependant, saute l'étape du tri. Lorsque vous posez la question, l'IA regarde la pile, trouve tous les reçus qui mentionnent « essence », puis filtre cette pile plus petite pour ne trouver que ceux de « juin », et enfin additionne les montants. Elle fait cela en créant et en gérant des « ensembles » de documents à la volée. C'est comme avoir un détective capable de tracer instantanément un cercle autour des reçus pertinents, de les compter et de faire le calcul, tout cela sans jamais avoir besoin de les classer au préalable.

Le document montre que cette approche « à la volée » est incroyablement puissante. Lors de tests sur six collections différentes de documents (allant de transcriptions d'audiences gouvernementales à des rapports financiers et des scénarios de films), leur système Zero-Ingestion a largement surpassé toutes les références (y compris les approches par graphe de connaissances) sur trois des six ensembles de données (MuSiQue, Transcripts et Hotels). Sur les trois autres ensembles (2Wiki, FinanceBench et ComplexTR), il n'a manqué que très légèrement la performance maximale, perdant en moyenne de seulement 1,63 % par rapport à la meilleure référence pour chacun (qui était A-RAG). Malgré ces pertes étroites sur la moitié des ensembles de données, le système a atteint une précision moyenne sur les six ensembles de données environ 7,36 % supérieure à la référence la plus compétitive suivante. C'est un événement majeur car cela suggère que, pour de nombreux types de questions, l'étape coûteuse de la pré-construction d'une base de données est en réalité inutile.

Pour rendre le système encore plus performant pour les questions plus délicates, ils ont également conçu une version « Limited-Ingestion ». C'est comme donner au détective un petit index pré-établi pour les types d'indices les plus courants, tout en le laissant effectuer le gros du travail à la volée. Cette version utilise un peu de prétraitement (un échantillon des documents pour trouver des modèles) et une petite base de données vectorielle (un outil qui aide à trouver des idées similaires, pas seulement des mots exacts). Cette approche hybride a poussé la précision encore plus haut, particulièrement dans les ensembles de données où l'information était cachée dans des structures complexes, comme la recherche d'un établissement spécifique dans une description d'hôtel ou d'une clause spécifique dans un contrat juridique.

Le document argumente explicitement contre l'idée selon laquelle vous devez construire un graphe de connaissances massif et prétraité ou une base de données SQL complète pour répondre à des questions complexes et multi-étapes. Ils démontrent que les méthodes « lourdes en ingestion », qui nécessitent qu'un LLM lise chaque document et en extraie les données avant même que l'utilisateur ne pose une question, sont souvent excessives. Bien que ces méthodes soient douées pour regrouper les données, ScalableRAG prouve qu'un agent peut effectuer ce même regroupement et ces mêmes calculs instantanément pendant la conversation. Les auteurs sont très confiants dans ces résultats, l'ayant mesuré sur des ensembles de données diversifiés grâce à une méthode de test rigoureuse où une IA distincte agit comme juge pour noter les réponses. Ils ont constaté que leur système non seulement permet d'économiser de l'argent et du temps, mais obtient aussi plus souvent la bonne réponse que les alternatives coûteuses, ou s'en rapproche de très près avec nettement moins d'efforts.

En résumé, ScalableRAG change la donne en montissant que vous n'avez pas besoin de construire un immense entrepôt de connaissances organisées pour trouver l'aiguille dans la botte de foin. Au lieu de cela, vous pouvez envoyer un agent intelligent dans la botte de foin avec un ensemble d'outils magiques pour attraper, trier et compter les aiguilles là où elles se trouvent. Que vous ayez besoin d'un système qui ne coûte rien à mettre en place (Zero-Ingestion) ou d'un système qui ajoute un peu de travail préalable pour une précision accrue (Limited-Ingestion), cette recherche suggère que l'avenir de la réponse aux questions par l'IA pourrait être beaucoup plus simple, plus rapide et moins coûteux que nous ne le pensions.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →