← Derniers articles
🤖 AI

Agentic Context Learning with Self-Discovered Specification

Cet article identifie que le principal défi de l'apprentissage en contexte pour les grands modèles de langage n'est pas simplement l'accès au contenu, mais l'acquisition de spécifications implicites et spécifiques à la tâche réparties à travers le contexte, et démontre qu'une intervention simple appelée PSCI, qui extrait et impose ces spécifications par une vérification adversaire, surpasse de manière significative les bases de référence existantes sur le benchmark CL-Bench.

Auteurs originaux : Jike Zhong, Ming Li, Yuxiang Lai, Ziyan Yang, Jingyu Xie, Jihyung Kil, Zheda Mai, Shao-Yuan Lo, Ren Xiang, Konstantinos Psounis, Yuanyuan Lei

Publié 2026-07-14
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jike Zhong, Ming Li, Yuxiang Lai, Ziyan Yang, Jingyu Xie, Jihyung Kil, Zheda Mai, Shao-Yuan Lo, Ren Xiang, Konstantinos Psounis, Yuanyuan Lei

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que l'on vienne de vous remettre un manuel d'instructions massif de 40 000 pages pour un tout nouveau jeu vidéo super complexe. Le manuel est rempli de lore, d'histoires de personnages et d'histoire du monde. Ensuite, un ami vous pose une question simple : « Que se passe-t-il si je saute un niveau ? »

Vous pourriez penser que la partie la plus difficile est de trouver la réponse dans ce livre géant. Vous vous diriez : « Si je cherche simplement "sauter un niveau", je trouverai la règle ! » Mais voici le rebondissement : l'article soutient que pour les modèles d'IA modernes, le vrai problème n'est pas de trouver la réponse (le contenu). Le vrai problème est de trouver les règles du jeu qui vous disent comment écrire cette réponse correctement (les spécifications).

Le mystère du « quasi-succès »

Les chercheurs ont testé cela sur un benchmark appelé CL-Bench, qui contient 1 899 tâches complexes où l'IA doit apprendre de nouvelles règles à partir de textes longs. Les résultats ont été surprenants. Même les modèles d'IA les plus intelligents (comme GPT-5.1) n'ont réussi parfaitement qu'environ 22,55 % des tâches.

Mais en examinant de plus près les erreurs, ils ont découvert quelque chose d'étrange. L'IA ne se trompait généralement pas sur les faits. Elle se trompait sur le format.

  • Le Fait : L'IA savait que l'ID manquant était « 404 ».
  • La Règle : Le manuel disait : « Si vous voyez un ID manquant, vous devez écrire l'indicateur exact Sequence_Gap_Warning ».
  • L'Erreur : L'IA a écrit « 404 » mais a oublié l'indicateur.

C'était un « quasi-succès ». L'IA connaissait le contenu mais avait manqué la spécification locale. En fait, l'article a révélé que 55,4 % de toutes les règles du test concernaient ces comportements spécifiques (formats, ordre, phrases exactes), alors que seulement 22,6 % concernaient le contenu factuel.

Pourquoi la « recherche » n'a pas fonctionné

Une hypothèse naturelle serait : « Peut-être que l'IA ne parvient pas à trouver la bonne page dans le manuel. » Ainsi, les chercheurs ont testé 12 méthodes différentes pour aider l'IA à mieux chercher, comme résumer le texte ou extraire des segments pertinents.

Le résultat ? Aucune de ces méthodes axées sur la recherche n'a bien fonctionné. La meilleure de ces méthodes riches en recherche n'a tout de même obtenu qu'environ 23 %. Cela suggère que le simple fait de trouver la bonne page n'est pas le problème. Le problème est que les règles sont souvent cachées en arrière-plan — comme une note de bas de page dans un paragraphe sur la « sémantique des événements » — et l'IA ne réalise pas qu'elle doit les suivre à moins de les chercher explicitement.

La solution du « contrat privé »

Pour prouver cela, les chercheurs ont conçu une astuce simple appelée PSCI (Private Specification-Contract Induction). Voyez cela comme ceci :

Avant que l'IA ne tente de répondre à la question, on la force à participer à une « réunion de pré-match ».

  1. Induire : L'IA lit l'intégralité du manuel et rédige un « Contrat Privé » de toutes les règles cachées qu'elle a trouvées (ex. : « Règle 1 : Toujours utiliser l'indicateur Sequence_Gap_Warning »).
  2. Générer : L'IA rédige sa réponse, mais elle doit suivre ce contrat.
  3. Vérifier : Un « arbitre » (une autre étape de l'IA) vérifie la réponse par rapport au contrat. Avez-vous utilisé l'indicateur ? Avez-vous respecté l'ordre ?
  4. Réparer : Si l'arbitre dit « Non », l'IA corrige la réponse avant de vous la montrer.

Le résultat ? Ce processus simple en quatre étapes a fait grimper le score de GPT-5.1 de 22,55 % à 28,14 %. C'est un bond de 5,59 points de pourcentage, ce qui est énorme dans ce domaine. Cela a également fonctionné sur d'autres modèles comme Qwen3.5-27B (passant de 14,14 % à 19,42 %) et Gemini 3 Pro (passant de 16,14 % à 22,31 %).

Ce que cela écarte

L'article est très clair sur ce qui ne fonctionne pas :

  • Chercher davantage : Jeter plus d'outils de recherche face au problème n'a pas aidé.
  • Réfléchir plus intensément : Utiliser le réglage « GPT 5.1 (High) » de l'évaluation originale de CL-Bench n'a permis au modèle d'atteindre que 23,7 %, ce qui reste inférieur aux 28,14 % obtenus par l'astuce PSCI.
  • Listes de contrôle génériques : Si vous demandez simplement à l'IA de « vérifier son travail » sans d'abord lui faire noter les règles spécifiques de ce contexte, cela n'aide pas. Les règles doivent être spécifiques à la tâche en cours.

À quel point sont-ils sûrs ?

Les auteurs sont assez confiants dans leurs conclusions car ils ont testé cela rigoureusement. Ils n'ont pas seulement deviné ; ils ont mené 17 différentes expériences d'« ablation » (décomposer la méthode pour voir ce qui fonctionne).

  • Ils ont prouvé que si l'on mélange les règles (donner le mauvais contrat à l'IA), le score s'effondre à 19,80 %, prouvant que les règles doivent correspondre à la tâche spécifique.
  • Ils ont prouvé que si l'on saute l'étape du « contrat » et que l'on demande simplement à l'IA de vérifier son propre travail plus tard, elle échoue. Le contrat doit être écrit avant la génération de la réponse.
  • Ils ont même fait vérifier 100 des réponses de l'IA par des experts humains. Les humains sont tombés d'accord avec le jugement de l'ordinateur 96 % du temps, confirmant que l'IA s'améliorait réellement, et qu'elle ne faisait pas que deviner.

L'essentiel

L'article suggère que pour que l'IA apprenne de nouvelles règles à partir de textes longs, elle ne peut pas se contenter d'être une bonne bibliothécaire qui trouve le bon livre. Elle doit être un bon avocat qui lit les petits caractères, rédige un contrat des règles, puis signe ce contrat avant d'effectuer tout travail.

Bien que le score de 28,14 % soit le meilleur à ce jour, les auteurs notent que le problème n'est pas encore « résolu ». Il reste beaucoup de place pour l'amélioration, notamment dans la partie « application » — s'assurer que l'IA suit réellement le contrat qu'elle a écrit pour elle-même. Mais l'idée principale est claire : l'apprentissage en contexte ne consiste pas seulement à trouver la réponse ; il s'agit de découvrir d'abord les règles du jeu.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →