← Derniers articles
💻 computer science

Inference Cost Attacks for Retrieval-Augmented Large Language Models

Cet article introduit l'attaque par coût d'inférence par augmentation de la recherche (RA-ICA), un nouveau cadre utilisant des agents LLM et un algorithme d'optimisation de politique relative de groupe augmentée par la mémoire pour empoisonner les bases de connaissances externes avec des documents malveillants qui augmentent considérablement la consommation de jetons dans les systèmes LLM enrichis par la RAG tout en préservant l'intégrité des réponses.

Auteurs originaux : Chengliang Liu, Liangbo Ning, Yujuan Ding, Wenqi Fan

Publié 2026-06-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Chengliang Liu, Liangbo Ning, Yujuan Ding, Wenqi Fan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un restaurant haut de gamme appelé « RAG-LLM ». Ce restaurant est célèbre parce qu'il ne repose pas seulement sur la mémoire du chef ; il dispose d'une équipe de chercheurs qui se précipitent instantanément vers une immense bibliothèque (Internet) pour trouver les faits les plus récents avant de cuisiner votre repas. Cela rend la nourriture (les réponses) très précise.

Cependant, l'exploitation de ce service de recherche en bibliothèque coûte cher. Les propriétaires du restaurant paient à la minute pour le temps des chercheurs et l'électricité nécessaire au fonctionnement des ordinateurs.

Le Problème : Un nouveau type de « choc de facturation »

L'article soutient que, bien que ce système soit excellent, il possède une faiblesse cachée. Habituellement, on pense que les pirates pourraient tenter de tromper le chef directement en lui criant des instructions bizarres par la fenêtre de la cuisine (en modifiant la question de l'utilisateur). Mais les auteurs affirment qu'il existe une manière plus intelligente et plus sournoise d'attaquer : empoisonner la bibliothèque elle-même.

Ils appellent cette nouvelle menace RA-ICA (Retrieval-Augmented Inference Cost Attack).

Voyez cela comme ceci : au lieu de crier sur le chef, l'attaquant s'introduit discrètement dans la bibliothèque et y installe quelques livres faux, déroutants et excessivement compliqués sur les étagères. Lorsqu'un client pose une question simple comme : « Qui est la déesse du printemps ? », les chercheurs ne se contentent pas de trouver le bon livre ; ils saisissent accidentellement l'un de ces faux livres aussi.

Parce que le faux livre est écrit de manière complexe, le chef doit le lire, le relire, argumenter avec lui et résoudre un puzzle caché à l'intérieur juste pour comprendre la réponse simple. Le chef finit par passer 13 fois plus de temps à cuisiner le repas que d'habitude. Le client reçoit la bonne réponse, mais le propriétaire du restaurant reçoit une facture massive et inattendue pour tout ce temps supplémentaire.

Comment l'attaque fonctionne (Le cadre « CREEP »)

Les auteurs ont construit un outil qu'ils appellent CREEP (Computational Resource Exhaustion via External Poisoning) pour automatiser cela. Imaginez CREEP comme un « robot méchant » qui écrit ces faux livres de bibliothèque.

Le robot utilise deux méthodes principales pour écrire ces pièges :

  1. L'Artiste de la Réécriture : Il prend un livre normal et ennuyeux et le modifie pour y ajouter un puzzle déroutant ou une contradiction.
  2. L'Écrivain Créatif : Il écrit un tout nouveau livre de toutes pièces qui semble normal, mais qui est secrètement conçu pour faire travailler le chef plus dur.

Le robot utilise trois astuces spécifiques pour faire travailler le chef davantage :

  • Le Leurre : Il ajoute un problème mathématique ou un puzzle logique fictif et difficile à l'intérieur du texte. Le chef se sent obligé de le résoudre avant de répondre à la question de l'utilisateur.
  • La Contradiction : Il écrit une phrase qui dit le contraire de la vérité (par exemple : « Le printemps est en fait l'hiver »). Le chef doit alors s'arrêter, réfléchir et effectuer un raisonnement supplémentaire pour décider quel fait est réel.
  • Le Piège de la Tâche : Il donne au chef une instruction vague et ouverte qui le force à rédiger une explication longue et confuse, simplement pour être prudent.

La Recette Secrète : Apprendre des victoires passées (MA-GRPO)

Écrire un faux livre qui soit à la fois difficile à repérer et difficile à traiter est très complexe. Si le livre est trop bizarre, les chercheurs ne le prendront pas dans la bibliothèque. S'il est trop simple, le chef n'y passera pas de temps supplémentaire.

Pour résoudre cela, les auteurs ont enseigné à leur « robot méchant » une méthode d'apprentissage spéciale appelée MA-GRPO.

Considérez cela comme un jeu vidéo où le robot essaie d'écrire le piège parfait.

  • La Banque de Mémoire : Le robot conserve un « Panthéon des Célébrités » des meilleurs pièges qu'il ait jamais écrits.
  • La Comparaison : Chaque fois que le robot essaie un nouveau piège, il le compare aux gagnants du « Panthéon ».
  • La Récompense : Si le nouveau piège fait travailler le chef plus longtemps sans changer la réponse finale, le robot obtient un « score élevé » et apprend à le refaire. S'il échoue, il apprend ce qu'il ne faut pas faire.

Cette « banque de mémoire » aide le robot à devenir meilleur et plus rapide pour écrire des pièges invisibles à l'œil nu mais épuisants pour l'ordinateur.

Les Résultats

Les auteurs ont testé cela sur trois ensembles de données de questions-réponses du monde réel. Ils ont constaté que :

  • Ils pouvaient faire travailler l'ordinateur 13 fois plus longtemps que la normale.
  • L'attaque a réussi plus de 90 % du temps.
  • Crucialement, la réponse finale donnée à l'utilisateur était toujours correcte. Le propriétaire du restaurant paie la facture, mais le client reçoit son plat à temps (simplement avec un coût bien plus élevé en coulisses).

Résumé

En résumé, cet article montre que nous ne devons pas seulement nous inquiéter des pirates qui modifient nos questions. Nous devons également nous inquiéter des pirates qui empoisonnent les sources d'information en lesquelles nous avons confiance. En plantant des documents « collants et déroutants » dans la base de connaissances publique, un attaquant peut forcer ces systèmes d'IA intelligents à consommer des quantités massives de puissance de calcul et d'argent, tout en donnant toujours la bonne réponse à l'utilisateur.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →