← Derniers articles
💻 computer science

ContractBench: Can LLM Agents Preserve Observation Contracts?

Cet article présente ContractBench, un benchmark déterministe révélant que les agents LLM de pointe actuels échouent fréquemment à préserver la validité temporelle et l'intégrité au niveau des octets des contrats d'observation (tels que les jetons de session et les URLs), une capacité qui ne s'améliore pas de manière monotone avec la taille du modèle et qui nécessite un entraînement spécifique conscient des défaillances pour progresser.

Auteurs originaux : Jicheng Wang, Yifeng He, Zili Wang, Hanwen Xing, Arkaprava De, Hao Chen

Publié 2026-05-19
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jicheng Wang, Yifeng He, Zili Wang, Hanwen Xing, Arkaprava De, Hao Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Idée : Le Problème du "Passage de Relais Numérique"

Imaginez que vous embauchiez un assistant robot très intelligent, mais légèrement maladroit, pour faire des courses pour vous. Vous dites au robot : "Va à la banque, récupère une clé temporaire, et utilise cette clé pour ouvrir le coffre."

Dans le monde réel, si le robot fait tomber la clé, modifie sa forme, ou tente d'utiliser la clé après son expiration, le coffre ne s'ouvrira pas. Le robot a échoué, non pas parce qu'il ne savait pas quoi faire, mais parce qu'il a échoué à gérer les détails spécifiques du passage de relais.

Ce papier appelle ces détails des "Contrats d'Observation".

  • Le Contrat : Lorsqu'un outil (comme une API bancaire) donne au robot un morceau de données (comme un mot de passe temporaire ou un lien signé), ces données s'accompagnent de deux règles invisibles :
    1. La Date d'Expiration : Vous devez l'utiliser maintenant, sinon elle devient inutile.
    2. La Règle "Ne Pas Toucher" : Vous devez la copier exactement, lettre pour lettre. Si vous changez même une virgule ou un espace, cela brise le système.

Les auteurs ont constaté que même les agents IA les plus intelligents d'aujourd'hui sont terribles pour suivre ces règles. Ils laissent souvent tomber la clé, la font fondre, ou tentent de l'utiliser le lendemain.

Le Nouveau Test : CONTRACTBENCH

Pour le prouver, les chercheurs ont créé un nouveau test appelé CONTRACTBENCH. Imaginez-le comme un "examen de conduite" pour les agents IA, mais au lieu de conduire une voiture, ils doivent naviguer dans un parcours d'obstacles numérique où chaque étape nécessite de remettre un paquet fragile et sensible au temps à la personne suivante.

  • Le Parcours : Il comporte 33 scénarios différents (comme télécharger un fichier avec un lien qui expire dans 10 secondes, ou se connecter avec un code qui doit être tapé parfaitement).
  • Les Règles : Le test est exécuté par un programme informatique strict (pas de juges humains). Il utilise une "horloge virtuelle" pour voir si l'agent est trop lent, et un "scanner d'empreintes digitales numériques" pour voir si l'agent a changé une seule lettre dans le code.
  • Le Score : Si l'agent dépasse la limite de temps ou se trompe dans l'orthographe du code, il échoue.

Ce Qu'ils Ont Découvert (Les Résultats)

Les chercheurs ont testé 38 modèles d'IA différents (y compris les plus récents et les plus célèbres de OpenAI, Anthropic, Google et des équipes open-source). Voici ce qu'ils ont trouvé, traduit en termes quotidiens :

1. Même les Robots les plus "Intelligents" Échouent

Le Résultat : Aucun modèle n'a réussi 80 % du test. Le meilleur (Claude Opus 4.6) a obtenu environ 78 %.
L'Analogie : Imaginez l'étudiant le plus intelligent du monde passant un examen de mathématiques. Il peut résoudre des problèmes de calcul complexe, mais si vous lui demandez de copier un nombre à 10 chiffres parfaitement sans faire de faute de frappe, il se trompe encore 22 % du temps. Être "intelligent" ne signifie pas être "prudent".

2. La "Falaise Magique" (Qwen 3.5)

Le Résultat : Dans une famille spécifique de modèles (Qwen 3.5), il y a eu un bond soudain dans les capacités. Le petit modèle de 4 milliards de paramètres a obtenu 0 % de réussite. Le modèle légèrement plus grand de 9 milliards a bondi à 56 %.
L'Analogie : C'est comme un personnage de jeu vidéo qui est inutile jusqu'à ce qu'il atteigne le niveau 9. Au niveau 8, il ne peut même pas tenir la clé. Au niveau 9, il apprend soudainement à la tenir délicatement. Ce n'était pas une amélioration lente ; c'était un "éveil" soudain d'une compétence spécifique appelée retenue (savoir ne pas modifier les données).

3. Plus Grand N'est Pas Toujours Mieux (Le Manège GPT-5)

Le Résultat : Alors que la famille de modèles GPT-5 évoluait, leurs performances ont augmenté, puis chuté, puis remonté.
L'Analogie : Imaginez un chef qui reçoit un nouveau livre de recettes.

  • Chef A (GPT-5) : Fait un gâteau parfait.
  • Chef B (GPT-5.1) : Obtient une version "plus intelligente" du livre mais commence à ajouter trop de sucre et gâche la recette (spécifiquement, ils ont commencé à modifier les ingrédients au lieu de les copier).
  • Chef C (GPT-5.2) : Corrige la recette et revient à faire des gâteaux parfaits.
    Le papier suggère que rendre une IA "plus intelligente" ou "plus conversationnelle" peut parfois la rendre pire pour suivre des règles strictes et ennuyeuses.

4. Les Modèles "Base" Ne Peuvent Pas le Faire

Le Résultat : Les modèles qui n'ont pas été "entraînés" pour discuter ou suivre des instructions (modèles Base) ont obtenu 0 % au test. Seuls les modèles qui avaient appris à suivre des instructions (modèles Instruct) pouvaient réussir.
L'Analogie : Un bloc d'argile brut (modèle Base) ne peut pas tenir une forme. Vous devez le sculpter (post-entraînement) pour qu'il puisse tenir une tasse d'eau. La capacité à suivre ces contrats n'est pas naturelle ; elle doit être enseignée.

5. L'"Indice" Fonctionne

Le Résultat : Lorsque les chercheurs ont dit à l'IA exactement ce qu'elle avait fait de travers (par exemple : "Vous avez changé une lettre dans le code"), l'IA pouvait corriger son erreur et réussir le test.
L'Analogie : Si vous dites à un enfant : "Tu as laissé tomber le ballon", il pourrait réessayer et le rattraper. Mais si vous dites juste : "Réessaie", il pourrait le laisser tomber à nouveau. La rétroaction spécifique était la clé pour corriger l'erreur.

Pourquoi Cela Compte (Selon le Papier)

Le papier soutient que nous avons testé l'IA sur sa capacité à "résoudre une énigme" ou "écrire une histoire". Mais dans le monde réel, les agents IA sont souvent utilisés pour faire des emplois où la précision est tout.

Si un agent IA gère votre compte bancaire, il ne peut pas se permettre de changer un seul chiffre dans un code de transaction. S'il gère un serveur, il ne peut pas se permettre d'utiliser un mot de passe expiré.

La Conclusion : Les agents IA actuels sont comme des stagiaires brillants mais maladroits. Ils comprennent la vue d'ensemble, mais ils continuent de faire tomber les outils fragiles qu'on leur remet. Pour les rendre fiables pour des emplois réels, nous devons arrêter de simplement les rendre "plus intelligents" et commencer à leur apprendre à être plus prudents et plus précis avec les contrats numériques qu'ils reçoivent.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →