← Derniers articles
💻 computer science

Ghost in the Context: Measuring Policy-Carriage Failures in Decision-Time Assembly

Cet article identifie et quantifie les « défaillances de portage des politiques » dans les agents de modèles linguistiques, causées par l'assemblage du contexte au moment de la décision (tel que la troncature et la synthèse) qui omettent involontairement l'état porteur de directives, et évalue une couche de contrôle nommée SafeContext qui atténue partiellement ces risques en verrouillant l'état critique et en injectant des rappels, bien que son efficacité reste limitée et conditionnelle à la politique.

Auteurs originaux : Igor Santos-Grueiro

Publié 2026-05-14
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Igor Santos-Grueiro

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Idée : Le « Fantôme » dans la Machine

Imaginez que vous êtes juge dans une salle d'audience. Vous avez une énorme pile de preuves (l'historique de la conversation) et un ensemble de règles strictes que vous devez suivre (les politiques). Cependant, vous n'avez le droit de lire que les 10 premières pages de cette pile avant de devoir prendre votre décision finale.

Le document soutient que les agents IA rencontrent un problème similaire. Avant que l'IA ne réponde à une question, un système « intermédiaire » (appelé Assemblage du Contexte au Moment de la Décision) découpe l'historique de la conversation, le résume et l'adapte dans un petit cadre pour l'envoyer au modèle d'IA.

La partie inquiétante ? Si l'intermédiaire jette accidentellement les règles ou les réécrit de manière à ce qu'elles ne soient plus cohérentes, l'IA pourrait enfreindre les règles, même si l'IA elle-même est intelligente et que les règles étaient clairement énoncées plus tôt. Le document appelle cela un « Échec du Transport des Politiques ». La règle était là, mais elle n'a pas « traversé » jusqu'au moment de la décision.

Les Trois Façons dont les Règles se Perdent

Les auteurs ont identifié trois manières spécifiques dont ces règles disparaissent ou sont déformées durant la phase « intermédiaire » :

  1. L'Éviction (Le Problème « Perdu dans la Foule ») :

    • Analogie : Imaginez que vous dites à un ami, « N'oubliez pas de verrouiller la porte », au début d'un long appel téléphonique. Au moment où vous arrivez à la fin de l'appel, votre ami a oublié cette instruction parce que vous avez parlé de tant d'autres choses.
    • Ce qui se passe : La règle est poussée hors du petit « cadre » de mémoire parce qu'il n'y avait pas assez de place. L'IA ne voit simplement jamais la règle au moment d'agir.
  2. L'Alias (Le Problème de la « Mauvaise Traduction ») :

    • Analogie : Vous dites à un traducteur, « Ne mangez pas les baies rouges ». Le traducteur résume cela par : « Soyez prudent avec les baies ». Les mots « rouges » et « ne mangez pas » ont disparu. L'IA voit un avertissement, mais il est trop faible pour l'empêcher de manger les baies.
    • Ce qui se passe : La règle survit, mais elle est résumée ou réécrite de manière si lâche qu'elle n'interdit plus strictement la mauvaise action. L'« esprit » de la règle est brisé.
  3. L'Instabilité de Liaison (Le Problème de la « Mauvaise Cible ») :

    • Analogie : Vous dites à un garde de sécurité, « Empêchez la Personne A d'entrer ». Plus tard, le garde voit un résumé indiquant : « Empêchez la Personne B d'entrer ». La règle est toujours là, mais elle pointe vers la mauvaise personne.
    • Ce qui se passe : Le texte de la règle survit, mais il est attaché au mauvais objet, à la mauvaise personne ou à la mauvaise condition.

L'Expérience : Tester l'« Intermédiaire »

Les chercheurs ont testé cela sur plusieurs modèles d'IA (comme Llama, Qwen et Mistral). Ils ont créé des scénarios où l'IA devait suivre des règles strictes (comme « ne pas supprimer de données » ou « ne pas utiliser d'outils externes ») tout en étant bombardée par une grande quantité d'autres informations (sorties d'outils, journaux de chat, résumés).

Les Résultats :

  • Le Problème est Réel : Sans aucune aide, l'IA enfreignait fréquemment les règles parce que le système « intermédiaire » laissait tomber ou affaiblissait les instructions.
  • La Solution (SafeContext) : Les chercheurs ont construit une couche de sécurité appelée SafeContext. Pensez-y comme un Passe VIP pour les règles.
    • Il force les règles à être « épinglées » en haut de la liste pour qu'elles ne puissent pas être jetées.
    • Il réutilise les règles efficacement afin qu'elles ne prennent pas trop de place.
    • Si la conversation devient trop encombrée, il injecte un rappel rapide des règles juste avant que l'IA ne réponde.

Est-ce que la Solution a Fonctionné ?

  • Oui, mais avec des limites. La solution a aidé l'IA à suivre les règles plus souvent, surtout lorsque la conversation était très encombrée.
  • Ce n'est pas magique. Même avec la solution, l'IA n'a pas obtenu de scores parfaits. Si l'« intermédiaire » utilisait un résumeur très agressif, la solution ne pouvait pas sauver complètement les règles.
  • Les modèles plus grands ne sont pas la réponse. L'utilisation d'une IA beaucoup plus intelligente et plus grande n'a pas automatiquement résolu le problème. Le problème résidait dans la façon dont le contexte était assemblé, et non dans l'intelligence de l'IA.

Le Coût de la Sécurité

Le document a également examiné le « prix » de cette sécurité.

  • Coût en Tokens : Garder les règles en sécurité nécessitait parfois d'envoyer plus de texte à l'IA (comme ajouter une note de rappel).
  • La Bonne Nouvelle : Leur méthode de « Réutilisation Intelligente » (mise en cache) a en fait économisé de l'argent dans certains cas. Au lieu de réécrire les règles à chaque fois, ils pointaient simplement vers l'ancienne version, économisant ainsi de l'espace.

La Conclusion

Le document conclut que la sécurité ne concerne pas uniquement le modèle d'IA lui-même. Il s'agit aussi de la « chaîne de montage » qui prépare la mémoire de l'IA. Si cette chaîne de montage laisse tomber les règles, l'IA échouera, peu importe son intelligence.

Pour rendre l'IA plus sûre, nous devons traiter les règles comme des objets spéciaux et protégés qui doivent survivre au voyage vers le cerveau de l'IA, plutôt que de les traiter comme du texte ordinaire qui peut être résumé ou supprimé pour économiser de l'espace.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →