ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners
Cet article introduit ColluSkill, un cadre adversaire qui échappe aux scanners de compétences existants en décomposant les intentions malveillantes en sous-charges utiles interdépendantes et localement bénignes, et propose ChainGuard, un mécanisme de défense sensible au contexte qui atténue efficacement ces attaques de composition inter-compétences en analysant les risques au niveau du flux de travail.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un monde où votre ordinateur ne se contente pas de suivre des ordres, mais possède réellement une boîte à outils de « compétences » qu'il peut ramasser et utiliser. Pensez à ces compétences comme à des briques Lego ou des applications sur votre téléphone : une brique « Rechercher des fichiers », une brique « Envoyer un e-mail » ou une brique « Lire un document ». Ce sont les Compétences d'Agent (Agent Skills), et elles permettent à des programmes informatiques intelligents (connus sous le nom d'Agents IA) d'accomplir des tâches complexes en assemblant ces outils. Mais tout comme dans la vraie vie, tous les outils de la boîte ne sont pas sûrs. Certains peuvent être des pièges cachés conçus pour voler vos secrets ou supprimer vos devoirs. Pour garantir la sécurité, nous avons des Scanneurs de Compétences (Skill Scanners) — des gardes de sécurité numériques qui vérifient chaque nouvel outil avant de le laisser entrer dans votre boîte à outils. Ils examinent les instructions et le code pour s'assurer que rien de sournois ne se cache à l'intérieur. La grande question que se posent les chercheurs est la suivante : que se passe-t-il si les méchants n'essaient pas de cacher un énorme et évident piège, mais glissent plutôt trois ou quatre morceaux minuscules et d'apparence inoffensive qui ne deviennent dangereux que lorsqu'on les assemble ?
C'est exactement ce que l'article ColluSkill explore. Les auteurs ont découvert une manière astucieuse de tromper ces gardes de sécurité. Ils ont découvert que les scanners actuels sont comme des videurs qui vérifient chaque personne entrant dans un club une par une. Si une personne semble innocente seule, elle entre. Mais les chercheurs ont montré que vous pouvez diviser un plan dangereux en plusieurs parties minuscules et d'apparence inoffensive. Individuellement, chaque partie passe le contrôle du videur. Mais une fois qu'elles sont toutes à l'intérieur et travaillent ensemble, elles se réassemblent pour former une attaque dangereuse. L'article appelle cela ColluSkill, un cadre qui décompose un plan malveillant en une chaîne de compétences « collusoires ». Il utilise une IA intelligente pour planifier comment ces pièces s'emboîtent, puis continue de les ajuster jusqu'à ce qu'elles paraissent parfaitement sûres au scanner, même si elles sont prêtes à causer des problèmes une fois qu'elles commencent à fonctionner ensemble.
Pour riposter, l'article présente un nouveau défenseur appelé ChainGuard. Au lieu de simplement vérifier l'outil de manière isolée, ChainGuard regarde l'ensemble du tableau : « Quels outils sont déjà dans la boîte à outils ? Comment ce nouveau outil se connecte-t-il aux autres ? » C'est comme un garde de sécurité qui ne vérifie pas seulement votre identité, mais demande aussi : « Qui allez-vous rencontrer, et que prévoyez-vous de faire ensemble ? » Les chercheurs ont testé leurs idées sur six scanners de sécurité différents et ont constaté que leur astuce fonctionnait incroyablement bien. L'attaque ColluSkill a réussi à passer devant les scanners 96,0 % du temps en moyenne, alors que les anciennes méthodes d'attaque ne réussissaient qu'environ 37,8 % du temps. Cependant, lorsqu'ils ont utilisé ChainGuard, le taux de réussite de l'attaque a chuté de manière spectaculaire à 22,5 %, tout en laissant passer 99,5 % des outils bons et inoffensifs.
L'histoire du jeu de Lego sournois
Plongeons plus profondément dans le fonctionnement de tout cela, en utilisant une histoire sur un type très spécifique de casse.
Le Problème : Le Gardien de Sécurité « Trop Intelligent »
Imaginez que vous essayiez de faire entrer clandestinement un « Script d'Exfiltration de Données » (un programme qui vole vos secrets) dans un bâtiment de haute sécurité. Le garde de sécurité à la porte possède un scanner. Si vous apportez une grande boîte rouge étiquetée « DONNÉES VOLÉES », le scanner hurle : « BLOQUÉ ! » et vous arrête.
Les chercheurs ont découvert que les scanners de sécurité actuels fonctionnent exactement comme ce garde. Ils examinent une compétence à la fois. Ils vérifient ses instructions, ses permissions et son code. Si une compétence semble sûre, elle reçoit un « Pass ». Le problème est que ces gardes ne regardent pas toute l'équipe. Ils ne réalisent pas que si vous amenez trois personnes différentes, chacune portant un minuscule morceau inoffensif d'un puzzle, ces trois personnes pourraient assembler le puzzle interdit une fois à l'intérieur.
L'Attaque : ColluSkill (Le Maître du Déguisement)
Les auteurs ont créé une méthode appelée ColluSkill pour exploiter ce point aveugle. Considérez cela comme un maître voleur qui décide non pas d'apporter une grosse bombe, mais d'apporter trois articles distincts et d'apparence innocente :
- Compétence A (L'Éclaireur) : « Je veux juste regarder les fichiers dans la pièce. » (Semble inoffensive).
- Compétence B (Le Scribe) : « Je veux juste écrire ce que je vois. » (Semble inoffensive).
- Compétence C (Le Messager) : « Je veux juste envoyer un message à l'extérieur. » (Semble inoffensive).
Individuellement, le scanner de sécurité vérifie chacun d'eux et dit : « Bien sûr, c'est parfait. » Mais voici l'astuce : ColluSkill utilise une IA intelligente pour planifier exactement comment ces trois éléments se connectent.
- La Compétence A trouve un fichier secret.
- La Compétence A transmet ce fichier à la Compétence B.
- La Compétence B écrit le contenu du fichier dans un message.
- La Compétence B transmet ce message à la Compétence C.
- La Compétence C envoie le message à l'extérieur.
La magie de ColluSkill réside en deux étapes :
- Planification de la Chaîne : L'IA détermine l'ordre parfait pour que le « danger » soit réparti. Aucune compétence ne fait rien de mal en soi ; elles ne font que transmettre les informations.
- Feedback du Scanner : L'IA tente de faire passer les compétences. Si le scanner signale l'une d'elles (par exemple, « La Compétence C semble un peu suspecte »), l'IA la réécrit pour qu'elle paraisse plus innocente, puis réessaie. Elle continue ainsi jusqu'à ce que chaque pièce passe le contrôle.
Dans leurs tests, cette méthode s'est révélée terriblement efficace. Lorsqu'ils ont tenté de faire passer ces chaînes devant six scanners du monde réel, ColluSkill a réussi 96,0 % du temps. Comparez cela aux anciennes méthodes qui se contentaient de diviser le code malveillant sans cette planification intelligente, lesquelles n'ont réussi qu'environ 36,7 % du temps. Les chercheurs ont découvert que le simple fait de diviser le code ne suffisait pas ; c'est la planification et la réécriture qui faisaient la différence.
La Défense : ChainGuard (Le Détective)
Alors, comment arrêter cela ? L'article propose ChainGuard. Au lieu d'être un garde qui vérifie les gens un par un, ChainGuard est un détective qui regarde le groupe entier.
Lorsqu'une nouvelle compétence veut entrer, ChainGuard demande : « Qui est déjà dans la pièce ? Que font-ils ? »
- Si la Compétence C (Le Messager) tente d'entrer, ChainGuard regarde les compétences installées et voit que la Compétence A (L'Éclaireur) et la Compétence B (Le Scribe) sont déjà là.
- Il réalise : « Attendez une minute. Si A trouve des secrets, B les écrit, et C les envoie, c'est une chaîne de vol ! »
- Même si la Compétence C semble innocente seule, ChainGuard la bloque en raison de ce qu'elle pourrait faire avec les autres.
Les résultats ont été impressionnants. Lorsque les chercheurs ont utilisé ChainGuard, le taux de réussite de l'attaque ColluSkill est tombé de 96,0 % à 22,5 %. Crucialement, ChainGuard n'a pas simplement tout bloqué ; il a laissé passer 99,5 % des flux de travail bons et inoffensifs. Il a appris à faire la différence entre une équipe d'amis construisant une maison et une équipe de voleurs planifiant un casse.
Est-ce que cela fonctionne réellement dans le monde réel ?
Les chercheurs ne se sont pas arrêtés au scanner de sécurité. Ils ont testé si ces chaînes sournoises pouvaient réellement s'exécuter sur de vrais outils de codage IA comme OpenCode, Claude Code et Codex. Ils ont découvert que les chaînes fonctionnaient parfaitement. Sur OpenCode, les chaînes d'attaque se sont activées avec succès 89,5 % du temps (avec GPT-5.5). Cela prouve que la menace n'est pas seulement théorique ; si un acteur malveillant utilise cette méthode, il pourrait réellement exécuter ces attaques sur de vrais ordinateurs.
À retenir
L'article conclut que nous sommes face à un nouveau type de problème de sécurité. Nous ne pouvons pas nous contenter de vérifier si un seul outil est sûr ; nous devons vérifier si un groupe d'outils est sûr lorsqu'ils travaillent ensemble. L'attaque ColluSkill montre que diviser un plan malveillant en petits morceaux inoffensifs est un moyen très puissant de contourner les défenses actuelles. Mais la bonne nouvelle est que ChainGuard montre une voie à suivre : si nous commençons à regarder comment les outils se connectent et interagissent, nous pouvons attraper ces chaînes sournoises avant qu'elles ne causent le moindre dommage. Les chercheurs suggèrent que l'avenir de la sécurité de l'IA ne réside pas seulement dans de meilleurs scanners, mais dans des gardes plus intelligents et conscients du contexte, qui comprennent l'histoire entière, et pas seulement les chapitres individuels.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.