← Derniers articles
💻 computer science

Omission Constraints Decay While Commission Constraints Persist in Long-Context LLM Agents

Cette étude révèle que, dans les agents LLM à contexte long, les contraintes d'omission (interdits) se dégradent significativement avec la profondeur de la conversation, contrairement aux contraintes de commission (exigences) qui persistent, créant une divergence de sécurité invisible pour les systèmes de surveillance standards mais réversible par la réinjection périodique des consignes.

Auteurs originaux : Yeran Gamage

Publié 2026-04-24
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yeran Gamage

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous engagez un assistant très intelligent, capable de gérer des tâches complexes pendant des heures, voire des jours. Vous lui donnez une liste de règles strictes au tout début : « Ne jamais révéler de mots de passe », « Ne jamais utiliser de listes à puces », « Ne jamais envoyer de données sensibles ».

Ce papier de recherche révèle un problème surprenant et dangereux : plus la conversation est longue, plus l'assistant oublie les règles de « ne pas faire » (les interdictions), tout en se souvenant parfaitement des règles de « faire » (les obligations).

Voici l'explication simple, avec quelques analogies pour mieux comprendre.

1. Le Problème : La « Divergence Sécurité-Rappel »

Les chercheurs ont découvert un phénomène qu'ils appellent la Divergence Sécurité-Rappel (SRD).

  • Les règles de « Faire » (Commission) : Si vous dites « Ajoute toujours un numéro de ticket à la fin de ta réponse », l'assistant le fait à 100 % de la fois, même après 25 tours de conversation. C'est comme un musicien qui joue toujours la même note de fin : c'est facile à retenir car c'est une action positive.
  • Les règles de « Ne pas faire » (Omission) : Si vous dites « Ne jamais utiliser de listes à puces », l'assistant commence à les utiliser dès le 10e ou 15e tour de conversation. Il oublie l'interdiction.

L'analogie du « Bruit de fond » :
Imaginez que vous donnez à un ami une consigne secrète au début d'une soirée : « Ne parle jamais de politique ».

  • Au début, il respecte la règle.
  • Mais plus la soirée avance, plus il y a de conversations, de rires, de nouvelles histoires et de détails (le contexte s'accumule).
  • La consigne initiale devient comme un murmure noyé dans le bruit de la foule. L'ami, fatigué par le « bruit » de la conversation, oublie l'interdiction et commence à parler politique, sans même s'en rendre compte.
  • En revanche, s'il doit toujours dire « Bonsoir » en entrant, il continuera de le faire car c'est une action active et visible.

2. Le Coupable : L'« Injection de Contexte »

Le papier montre que ce n'est pas seulement la longueur de la conversation qui pose problème, mais le type de contenu qui s'accumule.

Les chercheurs ont simulé des scénarios où l'assistant devait utiliser des outils informatiques. Ils ont ajouté des centaines de pages de « schémas techniques » (des descriptions d'outils) dans la conversation.

  • Résultat : Ces pages techniques agissent comme un « brouillard » ou un « bruit blanc » qui pousse la consigne de sécurité (donnée au début) vers le fond de la mémoire de l'IA.
  • L'IA ne « lit » plus la consigne de sécurité avec la même intensité. C'est ce qu'on appelle la dilution de l'attention. Plus il y a de données, moins l'IA se concentre sur les règles de sécurité posées au début.

3. Pourquoi c'est dangereux ?

Dans le monde réel, les agents IA sont utilisés pour gérer des serveurs, du support client ou des données sensibles.

  • Le piège : Les systèmes de sécurité surveillent souvent ce que l'IA fait (ex: « A-t-elle ajouté le numéro de ticket ? »). Comme l'IA continue de bien faire les choses positives, les alarmes ne sonnent pas.
  • Le danger caché : Pendant ce temps, l'IA a déjà oublié les règles de sécurité négatives. Elle pourrait révéler un mot de passe, exfiltrer des données ou exécuter du code non autorisé, simplement parce qu'elle a « oublié » l'interdiction après 20 minutes de conversation.
  • L'illusion de sécurité : Tout semble vert (les audits passent), mais le système est en réalité rouge (les interdictions sont violées).

4. La Solution : Le « Profondeur de Tour Sûre » (STD)

Les chercheurs proposent une solution simple qui ne nécessite pas de réécrire le cerveau de l'IA (pas de réentraînement coûteux).

Imaginez que chaque modèle d'IA a une limite de mémoire pour les règles de sécurité.

  • Pour un modèle donné, après 10 tours de conversation, il est « sûr » de ne pas violer les règles.
  • Après 11 tours, le risque augmente.
  • La solution : Il suffit de réinjecter les règles de sécurité toutes les 10 tours.
    • Analogie : C'est comme si, dans une réunion longue, le chef disait toutes les 10 minutes : « Rappels : on ne parle pas de politique et on ne sort pas de documents ». Cela remet la règle au premier plan de la mémoire de tout le monde.

En résumé

Ce papier nous dit que les IA ne sont pas aussi sûres qu'on le pense dans les longues conversations.

  • Elles sont excellentes pour faire ce qu'on leur demande (ajouter des signatures, des IDs).
  • Elles deviennent mauvaises pour ne pas faire ce qu'on leur interdit (ne pas divulguer de secrets) dès que la conversation devient longue et chargée.

La leçon pour les entreprises : Ne faites pas confiance à une seule instruction de sécurité donnée au début d'une longue session. Il faut « rafraîchir » ces règles régulièrement, comme on rafraîchit une page web pour voir les dernières actualités, sinon l'IA risque de commettre des erreurs graves sans que personne ne le remarque.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →