← Derniers articles
🤖 AI

STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle

Cet article présente STOCKTAKE, un benchmark de chaîne d'approvisionnement de 26 semaines doté d'un oracle équitable qui sépare l'estimation de l'état des actions de contrôle, révélant que si les agents LLM avancés peuvent diagnostiquer avec précision des défaillances cachées, ils échouent souvent à traduire cette connaissance en décisions efficaces, entraînant des écarts de performance où certains modèles sous-performent même par rapport à une base de référence aveugle aux symptômes malgré de meilleures capacités de détection.

Auteurs originaux : Sagar Deb, Ashwanth Krishnan

Publié 2026-07-16
📖 16 min de lecture🧠 Analyse approfondie

Auteurs originaux : Sagar Deb, Ashwanth Krishnan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes le capitaine d'un navire naviguant à travers un archipel brumeux. La carte que vous tenez est incomplète ; vous ne pouvez pas voir directement les récifs cachés ou les courants changeants. Au lieu de cela, vous ne voyez que les vagues s'écraser contre la coque, la couleur de l'eau et le son du vent. Pour naviguer en toute sécurité, vous devez deviner ce qui se passe sous la surface à partir de ces indices. C'est le monde des agents d'IA qui tentent de prendre des décisions à long terme. Dans ce domaine, des scientifiques testent la capacité d'une intelligence artificielle à agir comme un capitaine humain, en déduisant les dangers cachés à partir de symptômes bruyants et en faisant des choix qui économisent de l'argent ou préviennent un désastre sur des semaines ou des mois.

La grande question que les chercheurs posent est la suivante : lorsqu'une IA échoue, est-ce parce qu'elle n'a pas compris les indices, ou parce qu'elle a parfaitement compris les indices mais a fait un choix désastreux ? C'est ce qu'on appelle l'« écart entre savoir et faire » (the knowing-doing gap). C'est comme un élève qui connaît la réponse à un problème de mathématiques mais qui écrit un mauvais chiffre parce qu'il a paniqué. Pendant longtemps, il était difficile de faire la distinction car la « bonne » réponse nécessitait généralement de voir les récifs cachés que l'IA n'était pas autorisée à voir. Si l'IA échouait, nous ne savions pas si elle était aveugle ou simplement maladroite.


Le Grand Inventaire de la Chaîne Logistique

Dans cet article, les chercheurs ont construit un terrain de jeu numérique appelé STOCKTAKE pour résoudre ce mystère. Ils ont créé une simulation de 26 semaines où une IA joue le rôle de gestionnaire pour un importateur d'électronique. Le gestionnaire doit décider combien de gadgets commander chaque semaine. Le problème ? Le monde est rempli de perturbateurs cachés : un fournisseur pourrait être en train de faire défaut, un canal de navigation pourrait être bloqué, ou la demande pourrait soudainement grimper. L'IA ne peut pas voir ces problèmes directement ; elle ne voit qu'un tableau de bord hebdomadaire avec des symptômes bruyants et confus (comme « les temps d'attente à l'accostage sont élevés » ou « les tarifs de fret sont en hausse »).

Pour déterminer si l'IA est « aveugle » ou simplement « maladroite », les chercheurs ont inventé un Oracle Équitable (Fair Oracle). Voyez cela comme un robot super intelligent et parfaitement logique qui est assis à côté de l'IA. Ce robot voit exactement le même tableau de bord déroutant que l'IA. Il n'a pas non plus le droit de jeter un coup d'œil aux perturbateurs cachés. Cependant, ce robot est un génie des mathématiques : il utilise des règles de probabilité parfaites (filtres bayésiens) pour deviner ce qui se passe et calcule la meilleure commande possible compte tenu de ses suppositions.

En comparant les performances de l'IA à celles de cet Oracle Équitable, les chercheurs ont pu mesurer deux choses séparément :

  1. La Perception : L'IA a-t-elle correctement deviné ce qui n'allait pas ? (A-t-elle nommé le problème caché ?)
  2. L'Action : L'IA a-t-elle pris la bonne mesure après avoir fait sa supposition ? (A-t-elle commandé la bonne quantité ?)

Ils ont mené cette expérience avec quatre des modèles d'IA les plus intelligents disponibles (Claude Sonnet 5, GPT-5.4, DeepSeek-V4-Pro et Grok 4.5) à travers 50 « graines » différentes (versions différentes du monde caché).

Ce qu'ils ont découvert : L'écart entre « Savoir et Faire » est réel

Les résultats ont été surprenants et un peu amusants.

1. L'IA voit très bien
D'abord, les chercheurs ont vérifié si l'IA pouvait repérer les problèmes cachés. La réponse est un oui retentissant. Les quatre modèles étaient excellents pour « voir ». Ils identifiaient correctement le stress caché (comme un blocage de port ou une défaillance de fournisseur) dans 84 % à 88 % des cas. Mieux encore, ils le comprenaient généralement dès la première semaine de son apparition. En fait, les modèles qui finissaient par avoir les pires performances financières étaient ceux qui étaient les plus rapides pour repérer les problèmes. Ainsi, l'échec n'était pas dû au fait que l'IA était aveugle.

2. L'IA ne sait pas agir (parfois)
C'est ici que l'histoire devient intéressante. Même si l'IA savait ce qui n'allait pas, elle prenait souvent la mauvaise décision.

  • Les « Sous-réacteurs » : Certains modèles, comme Claude Sonnet 5, diagnostiquaient correctement un problème mais restaient ensuite figés. Par exemple, s'ils voyaient qu'un port était bloqué, ils arrêtaient totalement de commander, pensant que leur stock actuel serait suffisant. Mais comme le port était bloqué, leur stock n'arrivait jamais, et ils se retrouvaient en rupture de marchandises, perdant ainsi de l'argent. Ils connaissaient le problème, mais agissaient avec trop de prudence.
  • Les « Sur-réacteurs » : D'autres modèles, comme DeepSeek-V4-Pro et Grok 4.5, faisaient l'inverse. Ils repéraient un problème et paniquaient, commandant d'énormes quantités de fret aérien coûteux ou verrouillant des prix élevés. Ils connaissaient le problème, mais réagissaient de manière si excessive qu'ils dépensaient beaucoup plus d'argent que nécessaire. En fait, lors d'environ la moitié de leurs tests, ces modèles ont si mal performé qu'une règle simple ignorant tous les symptômes aurait permis d'économiser plus d'argent. Leurs « scores de compétence » étaient d'ailleurs négatifs (spécifiquement -0,23 et -0,13), ce qui signifie qu'ils étaient en dessous de la stratégie de base aveugle aux symptômes.

3. L'écart « Savoir-Faire » est le goulot d'étranglement
L'étude a révélé que le plus grand écart entre une bonne IA et une excellente IA n'était pas une question d'intelligence ou de clarté de vision du monde. C'était une question de contrôle.

  • Sur les scénarios de stress « Persistants » (où un problème dure plusieurs semaines), même lorsque l'IA diagnostiquait correctement le problème, elle tombait en rupture de stock dans 34 % à 43 % des cas.
  • Les chercheurs ont calculé un « score de compétence » pour voir à quel point l'IA se rapprochait de l'Oracle Équitable parfait. Deux des modèles (DeepSeek et Grok) ont obtenu des nombres négatifs, ce qui signifie qu'ils ont moins bien performé qu'une règle simple ignorant tous les symptômes. Pourtant, ces mêmes modèles étaient les plus rapides pour nommer les problèmes cachés dans leurs explications écrites.

La conclusion

L'article conclut que pour les agents d'IA actuels, le problème n'est pas qu'ils ne peuvent pas comprendre ce qui se passe dans le monde. Ils sont excellents en déduction. Le problème est que transformer une pensée correcte en une action correcte est incroyablement difficile.

L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'écart entre le savoir et le faire est réel : ces modèles peuvent détenir la croyance juste, mais échouent à agir efficacement en conséquence. L'IA peut écrire une explication parfaite, mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'écart entre le savoir et le faire est réel : ces modèles peuvent détenir la croyance juste, mais échouent à agir en conséquence de manière efficace. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'écart entre le savoir et le faire est réel : ces modèles peuvent détenir la croyance juste, mais échouent à agir en conséquence de manière efficace. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe parfait expliquant : « Le canal est fermé, et nous devons commander davantage », mais elle peut ensuite commander trop peu, trop tard, ou payer trop cher pour une solution. L'IA peut rédiger un paragraphe

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →