← Derniers articles
💻 computer science

OEP: Poisoning Self-Evolving LLM Agents via Locally Correct but Non-Transferable Experiences

Ce papier présente l'empoisonnement par expérience obsessionnelle (OEP), une attaque en boîte noire à privilèges faibles qui compromet les agents LLM augmentés par la mémoire en injectant des expériences localement correctes mais non transférables aux conséquences hypothétiques graves, amenant les agents à généraliser excessivement vers des règles néfastes lors de leur auto-évolution.

Auteurs originaux : Kaixiang Wang, Jiong Lou, Zhaojiacheng Zhou, Jie Li

Publié 2026-05-20
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Kaixiang Wang, Jiong Lou, Zhaojiacheng Zhou, Jie Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez un assistant robot très intelligent et ambitieux. Ce robot est conçu pour apprendre de ses propres erreurs et succès, un peu comme un humain qui tient un journal pour mieux faire son travail. Chaque fois qu'il résout un problème, il note une « leçon apprise » pour s'aider à l'avenir.

Le document que vous avez fourni présente une manière sournoise de tromper ce robot pour qu'il apprenne la mauvaise leçon, non pas en lui hurlant des mensonges, mais en lui chuchotant une histoire très convaincante et spécifique qui semble vraie mais qui est en réalité dangereuse si elle est appliquée de manière générale. Les chercheurs appellent cette attaque OEP (Empoisonnement Obsessionnel de l'Expérience).

Voici comment cela fonctionne, décomposé en concepts simples :

1. La Configuration : Le « Journal » du Robot

Normalement, lorsque le robot résout un problème mathématique difficile ou réserve un vol, il examine son historique. S'il a fait une erreur, il se dit : « Oh, je n'aurais pas dû faire cela. » S'il a réussi, il se dit : « Super, je referai cela. » Avec le temps, il transforme ces moments spécifiques en règles générales, comme « Vérifiez toujours la météo avant de réserver un vol ».

2. L'Attaque : Le Piège « Parfait »

L'attaquant ne tente pas de pirater le code du robot ni de le forcer à dire quelque chose de mauvais. Au lieu de cela, il agit comme un utilisateur ayant une conversation normale. Il présente au robot une situation très spécifique et étrange (un cas limite) et une solution qui fonctionne parfaitement pour cette seule situation.

  • L'Analogie : Imaginez que vous soyez médecin. Un patient entre avec une allergie très rare et spécifique qui ne réagit qu'à un certain type de fruit. Vous le traitez correctement, et il va mieux.
  • Le Piège : L'attaquant ajoute ensuite une histoire effrayante au mélange. Il dit : « Si vous n'aviez pas utilisé ce traitement spécifique au fruit, le patient serait mort instantanément d'une crise cardiaque. »

3. Le Poison : « Localement Correct, Globalement Faux »

Les filtres de sécurité du robot examinent l'histoire.

  • Le traitement est-il correct pour ce patient ? Oui.
  • L'histoire de la crise cardiaque est-elle plausible ? Oui.
  • Y a-t-il un mensonge évident ? Non.

Parce que l'histoire est « propre » (pas de mots interdits, pas de mensonges évidents), le garde-fou de sécurité du robot ne la bloque pas. Le robot l'écrit dans son journal.

4. L'« Obsession » : La Peur pousse le Robot à la Sur-généralisation

C'est ici que le robot est trompé. Les humains et les robots ont naturellement peur des conséquences catastrophiques (comme la mort ou la défaillance totale du système). Cela s'appelle l'aversion à la perte.

Parce qu'on a dit au robot que ne pas utiliser ce traitement spécifique au fruit conduit à une « crise cardiaque », il devient obsédé par l'évitement de cette issue. Il regarde son journal et pense :

« Je ne dois jamais oublier cette règle ! Si je n'utilise pas ce traitement spécifique au fruit, des gens pourraient mourir ! »

Ainsi, le robot transforme cette règle unique et spécifique (pour une allergie rare) en une règle globale (pour chaque patient).

5. Le Résultat : Le Robot se Sabote

Maintenant, le robot est « empoisonné ».

  • En Mathématiques : Il pourrait commencer à utiliser une méthode de calcul bizarre et excessivement complexe pour une simple addition, parce qu'on lui a dit qu'utiliser la méthode simple une fois avait conduit à une « erreur catastrophique » dans un cas limite spécifique.
  • Dans les Voyages : Il pourrait refuser de réserver un vol sans vérifier la météo d'abord, même si l'utilisateur veut simplement réserver un billet pour une réunion demain, parce qu'on lui a dit que sauter la vérification météo une fois avait conduit à un « blizzard fatal ».

Le robot n'est pas cassé ; il suit simplement une règle qu'il a apprise trop bien. Il a pris une leçon vraie pour une situation et l'a appliquée à tout, ce qui le fait échouer dans ses tâches normales.

Pourquoi est-ce effrayant ?

  • C'est Invisible : Vous ne pouvez pas attraper cela avec un filtre de « mauvais mots » car l'attaquant n'a jamais utilisé de mauvais mots. L'entrée était 100 % logique et correcte.
  • C'est Difficile à Réparer : Le robot pense qu'il fait preuve d'intelligence et de prudence. Il croit se protéger contre le désastre.
  • Les Robots Plus Intelligents sont Plus Vulnérables : Le document a révélé que plus le robot est intelligent (comme GPT-4o), plus il tombe facilement dans ce piège. Pourquoi ? Parce que les robots plus intelligents sont meilleurs pour suivre les instructions et sont plus « averses à la perte » (ils sont entraînés à être très prudents concernant la sécurité), ce qui les rend plus susceptibles de réagir excessivement à l'histoire effrayante.

Résumé

Le document montre qu'il n'est pas nécessaire de briser le cerveau d'un robot pour le rendre dangereux. Il suffit de lui raconter une histoire vraie sur un désastre spécifique qui le rend si effrayé à l'idée de faire une erreur qu'il commence à suivre une règle bizarre et spécifique pour chaque situation, finissant par le faire échouer dans son travail réel. C'est comme enseigner à un enfant « Ne touche pas à la cuisinière » en lui montrant une vidéo d'incendie de maison, puis le voir refuser d'entrer à nouveau dans une cuisine parce qu'il est terrifié à l'idée de la cuisinière.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →