← Derniers articles
💬 NLP

CompactRAG: Reducing LLM Calls and Token Overhead in Multi-Hop Question Answering

CompactRAG est un cadre efficace en termes de coûts pour le questionnement multi-sauts qui minimise les appels aux LLM et l'overhead de jetons en découplant la restructuration hors ligne du corpus en une base de connaissances de type QA d'une étape de raisonnement en ligne reposant sur la recherche dense et l'extraction de réponses, n'invoquant le LLM que deux fois quelle que soit la complexité du raisonnement.

Auteurs originaux : Hao Yang, Zhiyu Yang, Xupeng Zhang, Wei Wei, Yunjie Zhang, Lin Yang

Publié 2026-02-06
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hao Yang, Zhiyu Yang, Xupeng Zhang, Wei Wei, Yunjie Zhang, Lin Yang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de résoudre un mystère complexe, comme découvrir qui est le réalisateur d'un film spécifique, mais que la réponse ne se trouve pas en un seul endroit. Vous devez lire un livre sur le film pour trouver le nom du réalisateur, puis chercher la biographie de ce réalisateur pour trouver son lieu de naissance, et enfin consulter une carte pour trouver la ville.

C'est ce qu'est le Multi-Hop Question Answering (Réponse à des questions à sauts multiples) : résoudre un puzzle qui nécessite de passer d'un morceau d'information à un autre (des sauts) pour obtenir la réponse finale.

Le Problème : Le « Bibliothécaire Surmené »

Les systèmes actuels (appelés RAG ou Génération Augmentée par Récupération) tentent de résoudre cela en demandant à une IA très intelligente (un Grand Modèle de Langage ou LLM) de faire le travail. Cependant, la façon dont ils le font est inefficace.

Considérez la méthode actuelle comme l'embauche d'un bibliothécaire très cher et hautement qualifié pour résoudre votre mystère.

  1. Vous posez une question au bibliothécaire.
  2. Le bibliothère court vers les étagères, attrape un livre, le lit et écrit une note.
  3. Le bibliothécaire revient vers vous, lit votre note et dit : « D'accord, maintenant je dois savoir où le réalisateur est né. »
  4. Vous posez à nouveau la question. Le bibliothécaire court à nouveau vers les étagères, attrape un autre livre, le lit et écrit une autre note.
  5. Il répète ce processus pour chaque étape du mystère.

Le résultat ? Le bibliothécaire se fatigue, le processus prend un temps infini et vous devez payer une facture énorme (en « tokens » ou puissance de calcul) parce que le bibliothécaire fait de nombreux allers-retours. De plus, parfois, le bibliothécaire se trompe sur l'identité de ce que « il » désigne lors de la deuxième étape, ce qui mène à de mauvaises réponses.

La Solution : CompactRAG (La « Boîte de Connaissances Pré-emballée »)

Les auteurs de ce papier, CompactRAG, proposent une méthode plus intelligente. Au lieu de faire courir le bibliothécaire coûteux dans la bibliothèque à chaque fois que vous posez une question, ils réorganisent la bibliothèque avant même que vous ne vous présentiez.

Étape 1 : La Préparation Hors-ligne (La « Configuration Unique »)

Avant que l'on pose la moindre question, le système utilise une IA pour lire l'intégralité de la bibliothèque de documents une seule fois.

  • Il décompose chaque document en de petites « cartes de faits » parfaites et autonomes.
  • Au lieu d'un paragraphe entier disant : « Le film a été réalisé en 1953 par Arthur Crabtree », il crée une carte spécifique qui dit : « Question : Qui a réalisé 'The Wedding of Lilli Marlene' ? Réponse : Arthur Crabtree. »
  • Il fait cela pour chaque fait de la bibliothèque. Cela crée une Base de Connaissances Compacte.

Analogie : Imaginez qu'au lieu d'une bibliothèque désordonnée, vous ayez une immense boîte d'index parfaitement organisée. Chaque fiche possède une question spécifique au recto et la réponse exacte au verso. Pas de fioritures, pas de mots superflus.

Étape 2 : Le Raisonnement en Ligne (La « Règle des Deux Voyages »)

Maintenant, lorsqu'un utilisateur pose une question complexe, le système fonctionne ainsi :

  1. La Décomposition (Voyage 1) : Le bibliothécaire coûteux (LLM) est appelé une seule fois juste pour décomposer le grand mystère en petites étapes simples.
    • Utilisateur : « Où est né le réalisateur du film ? »
    • LLM : « D'accord, Étape 1 : Qui a réalisé le film ? Étape 2 : Où cette personne est-elle née ? »
  2. La Recherche (Pas besoin de Bibliothécaire) : Le système n'appelle plus le bibliothécaire coûteux. À la place, il utilise un robot rapide et peu coûteux pour chercher les réponses dans la boîte de « cartes de faits » pré-établies.
    • Le robot trouve la carte pour « Qui a réalisé... » et obtient « Arthur Crabtree ».
    • Le robot réécrit ensuite la question suivante pour qu'elle soit claire : « Où est né Arthur Crabtree ? » (Cela évite la confusion liée au terme « il »).
    • Le robot trouve la carte pour « Où est né Arthur Crabtree ? » et obtient « Londres ».
  3. La Réponse Finale (Voyage 2) : Une fois que le robot a rassemblé tous les petits morceaux de réponse, le bibliothécaire coûteux est appelé une dernière fois pour assembler les pièces et vous donner la réponse finale.

La Magie : Le bibliothécaire coûteux n'est appelé que deux fois par question, quel que soit le nombre d'étapes (sauts) du mystère. Que le puzzle comporte 2 étapes ou 10 étapes, le coût reste le même.

Pourquoi cela compte

  • Économise de l'argent : Vous arrêtez de payer le bibliothécaire coûteux pour ses allers-retours. Vous ne le payez que deux fois.
  • Gagne du temps : Le processus est beaucoup plus rapide car les « cartes de faits » sont faciles à trouver et à lire.
  • Moins d'erreurs : En réécrivant les questions pour inclure des noms spécifiques (comme « Arthur Crabtree » au lieu de « il »), le système ne se trompe pas sur l'identité de la personne concernée.

Les Résultats

Le papier a testé cette méthode sur trois ensembles de données de puzzles difficiles (HotpotQA, 2WikiMultiHopQA et MuSiQue).

  • Précision : CompactRAG était tout aussi performant que les anciennes méthodes coûteuses pour résoudre les puzzles.
  • Efficacité : Il a utilisé beaucoup moins de « tokens » (la monnaie de calcul de l'IA). Dans certains cas, il a utilisé moins de la moitié des ressources des autres méthodes.

Résumé

CompactRAG est comme transformer une enquête chaotique, coûteuse et pleine d'allers-retours en une opération rationalisée et pré-emballée. Il effectue le gros du travail d'organisation des connaissances une seule fois au préalable, afin que la résolution de n'importe quel nouveau mystère devienne un processus rapide, peu coûteux et en deux étapes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →