← Derniers articles
💬 NLP

Adversarial Prompts for Acceptance Collapse in Speculative Decoding

Cet article présente ADSD, la première attaque par suffixe de prompt qui exploite une vulnérabilité du décodage spéculatif en utilisant un substitut de type Soft-Collapse pour générer des suffixes adverses qui augmentent considérablement la latence d'inférence tout en préservant la qualité de la tâche.

Auteurs originaux : Run Wang, Chaoyi Zhou, Xi Liu, Yi Zhu, Amir Salarpour, Pedram MohajerAnsari, Zhi-Qi Cheng, Feng Luo, Siyu Huang, Mert D. Pesé

Publié 2026-07-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Run Wang, Chaoyi Zhou, Xi Liu, Yi Zhu, Amir Salarpour, Pedram MohajerAnsari, Zhi-Qi Cheng, Feng Luo, Siyu Huang, Mert D. Pesé

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous dirigez un restaurant à grande vitesse où un chef principal (le « Modèle Cible ») est responsable de cuisiner chaque plat à la perfection. Mais le chef est lent, et les clients ont faim. Pour accélérer les choses, le restaurant engage un sous-chef rapide (le « Modèle Draft ») qui court en avance, coupant les légumes et devinant ce que le chef principal fera ensuite. Si les devinettes du sous-chef sont justes, le chef principal se contente de hocher la tête et sert la nourriture instantanément. Si le sous-chef se trompe, le chef principal doit s'arrêter, jeter la supposition et tout recommencer depuis le début. Ce système de « devine et vérifie » est appelé décodage spéculatif (speculative decoding), et c'est une astuce populaire pour permettre aux chatbots d'IA de parler plus vite sans perdre leur intelligence.

Pendant des années, tout le monde a supposé que ce système était sûr tant que l'IA ne disait rien de méchant ou d'étrange. L'idée était que le gain de vitesse n'était qu'un problème de mathématiques : si les deux chefs sont d'accord, on va vite ; s'ils ne le sont pas, on va lentement. Mais et si quelqu'un pouvait tromper le système pour qu'il soit toujours en désaccord, non pas en cassant l'IA, mais en murmurant un petit code secret dans la commande du client ? C'est la question à laquelle une équipe de chercheurs de l'Université de Clemson et d'autres ont décidé de répondre. Ils voulaient savoir si une phrase habilement construite pouvait forcer l'IA rapide à ralentir jusqu'à un pas de tortue, rendant le service coûteux et frustrant, tout en faisant en sorte que la réponse finale paraisse parfaitement normale.

Les chercheurs ont découvert que, oui, c'est possible. Ils ont créé un nouveau type d'attaque appelée ADSD (Adversarial Prompts for Acceptance Collapse - Prompts Adversaires pour l'Effondrement de l'Acceptation). Imaginez cela comme un « glitch dans la matrice » du flux de travail du restaurant. L'attaquant ne change pas les chefs ni la cuisine ; il ajoute simplement quelques mots spéciaux et invisibles à la fin d'une requête normale. Ces mots agissent comme une formule magique qui fait en sorte que le sous-chef rapide devienne incroyablement trop confiant mais systématiquement erroné. Le sous-chef commence à crier des suppositions comme « bizarre » ou « XX » avec une certitude totale, mais le chef principal sait que ce sont des erreurs et les rejette immédiatement.

Parce que le chef principal rejette les suppositions si souvent, le système se retrouve coincé dans une boucle de rejet de travail et de redémarrage. Dans leurs tests, ce petit tour a transformé une réponse rapide en une réponse lente. Sur un ensemble de données de problèmes mathématiques appelé GSM8K, le temps moyen pour obtenir une réponse est passé de 26,05 secondes à 42,29 secondes, soit un ralentissement de 62,3 %. C'est comme si un trajet de 10 minutes passait soudainement à 16 minutes juste à cause d'un signal de circulation étrange. Encore plus impressionnant (et effrayant), les chercheurs ont constaté que la réponse finale reçue par le client était presque aussi bonne qu'avant. Les problèmes mathématiques étaient toujours résolus correctement, et les histoires avaient toujours du sens. L'attaque n'a pas cassé le cerveau de l'IA ; elle a seulement cassé sa vitesse.

L'équipe a montré que cette astuce fonctionne même lorsque le restaurant utilise différentes méthodes de cuisine plus avancées. Que l'on utilise un système standard de vérification « un par un » ou un système sophistiqué « bloc par bloc », l'attaque ralentit toujours de la même manière. Ils l'ont même testée sur différents types de modèles d'IA, de la famille Qwen à la famille LLaMA, et le ralentissement s'est produit à chaque fois. Dans un cas extrême utilisant une architecture spécifique appelée EAGLE-3, la vitesse a chuté de façon massive de 76,9 %.

Les chercheurs ont également testé si cette « formule magique » pouvait fonctionner sur des tâches pour lesquelles elle n'avait pas été spécifiquement entraînée. Ils ont pris une formule conçue pour ralentir les problèmes mathématiques et l'ont utilisée sur des tâches de codage et de résumé d'actualités. Cela a fonctionné ! Sur les tâches de codage, le temps de génération de code a plus que doublé (augmentation de 141,8 %) et le code a commencé à faire plus d'erreurs. Sur les résumés d'actualités, cela a ralenti le processus de 30,4 %. Cela suggère que la vulnérabilité n'est pas un simple coup de chance lié à un test mathématique spécifique ; c'est une faiblesse fondamentale dans la manière dont ces systèmes d'IA rapides vérifient leur propre travail.

L'article conclut que, bien que les réponses finales de l'IA puissent encore paraître parfaites, le « coût » pour les obtenir a été détourné. L'attaque est furtive car elle ne déclenche pas les alarmes habituelles qui recherchent des mots déplacés ou des sorties étranges. C'est une attaque de « déni de portefeuille » (denial of wallet), où l'attaquant ne vole pas de données mais force le fournisseur de services à brûler une puissance informatique coûteuse juste pour livrer une réponse normale. Les auteurs suggèrent que le simple fait de vérifier l'entrée ou la sortie finale ne suffit pas pour arrêter cela ; nous devons surveiller le processus lui-même. Si le système remarque que la boucle de « devine et vérifie » échoue beaucoup trop souvent, il pourrait devoir arrêter de deviner et simplement cuisiner lentement pour économiser de l'argent. Pour l'instant, cette découverte sert d'avertissement : le fait qu'une IA soit rapide et précise ne signifie pas qu'elle est à l'abri d'être ralentie par quelques mots habiles.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →