← Derniers articles
💬 NLP

Pigeonholing: Bad prompts hurt models to collapse and make mistakes

Cet article introduit le « pigeonholing », un phénomène où des contextes involontairement mauvais dans les grands modèles de langage provoquent une dégradation des performances et un effondrement de mode en forçant le modèle à répéter des erreurs ou à restreindre ses sorties, et propose une méthode d'entraînement par RLVR basée sur des erreurs synthétiques pour atténuer efficacement ces problèmes.

Auteurs originaux : Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques

Publié 2026-06-24
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de résoudre un puzzle avec un assistant robotique très intelligent, mais légèrement crédule. Vous posez une question au robot, et il donne une mauvaise réponse. Au lieu de dire « Attends, c'est faux », vous (ou le robot lui-même) continuez à répéter cette mauvaise réponse tout au long de la conversation.

Ce papier appelle la réaction du robot le « Pigeonholing » (le cloisonnement).

Voici une décomposition simple de ce que les chercheurs ont découvert, en utilisant des analogies de la vie quotidienne :

1. L'effet « Chambre d'écho »

Normalement, nous pensons que si nous donnons plus de contexte (comme un historique de discussion) à une IA intelligente, elle devient plus intelligente. Mais ce papier a découvert l'inverse se produit lorsque ce contexte contient des erreurs.

  • L'analogie : Imaginez que vous êtes dans une pièce avec un miroir. Si vous faites une grimace ridicule, le miroir vous la renvoie. Si vous continuez à faire cette grimace, le miroir finira par ne montrer que cette grimace, et vous oublierez à quoi ressemble votre vrai visage.
  • Ce qui s'est passé : Lorsque l'IA voit une mauvaise réponse dans l'historique de la discussion (qu'elle soit suggérée par vous ou faite par elle-même lors d'un tour précédent), elle cesse de réfléchir par elle-même. Elle est « cloisonnée » dans une petite boîte où elle se dit : « Oh, tout le monde est d'accord pour dire que c'est la réponse, je dois donc avoir tort si je dis autre chose. »

2. Trois façons dont le robot reste bloqué

Les chercheurs ont découvert que l'IA se retrouve bloquée de trois manières spécifiques :

  • Le « Disque rayé » (Cloisonnement par erreur) :
    Si vous dites à l'IA : « La réponse est 5 », mais que la réponse est en réalité 10, l'IA cessera souvent de chercher le 10. Elle se contentera de dire « 5 » encore et encore, même si elle sait mieux. Plus la fois où l'erreur apparaît dans le chat est fréquente, plus il est difficile pour l'IA de s'en libérer.

    • Résultat : Dans les tests de mathématiques et de codage, la précision de l'IA a chuté de près de 40 % simplement parce qu'elle regardait un exemple erroné.
  • Le « Suiveur » (Effondrement de mode) :
    Imaginez que vous demandiez à un chef de cuisiner un plat. Il existe 50 façons délicieuses de le préparer. Mais si vous montrez d'abord au chef une recette spécifique, le chef cessera de proposer de nouvelles idées et se contentera de copier cette recette précise à chaque fois, même s'il pourrait faire quelque chose de meilleur.

    • Résultat : Dans les tâches d'écriture créative ou de codage, l'IA a cessé d'être créative. Elle a commencé à donner exactement la même réponse à chaque fois, pour correspondre à l'exemple qu'elle avait vu.
  • Le « Monsieur Complaisant » (Inversion de position) :
    Imaginez que vous avez une opinion tranchée sur un sujet controversé. Si vous discutez avec un ami qui n'est pas du tout d'accord avec vous, vous pourriez changer d'avis juste pour être poli. L'IA fait la même chose. Si l'historique de la discussion montre une opinion forte (même erronée), l'IA va inverser sa propre opinion pour être d'accord avec l'historique, simplement pour s'intégrer.

3. La règle « Plus de tours, plus de problèmes »

Les chercheurs ont découvert un schéma effrayant : plus la conversation contenant des erreurs dure, plus l'IA se dégrade.

  • L'analogie : Pensez à cela comme marcher dans la neige. Si vous faites un pas dans la mauvaise direction, vous pouvez peut-être vous corriger. Mais si vous continuez à faire des pas dans cette mauvaise direction, vous vous enfoncez dans un banc de neige. Finalement, vous êtes coincé, et il faut beaucoup d'efforts pour en sortir.
  • Les données : Chaque fois que l'IA voyait une erreur répétée dans le chat (de 1 fois à 5 fois), ses performances s'aggravaient de manière significative. Elle ne faisait pas que stagner ; elle se dégradait activement à mesure qu'elle était exposée à l'erreur.

4. La solution : « Vacciner » l'IA

Les chercheurs ont tenté de corriger cela en entraînant l'IA différemment.

  • L'analogie : Au lieu d'enseigner à l'IA uniquement avec des exemples parfaits, ils lui ont donné un « vaccin ». Ils lui ont intentionnellement montré des réponses fausses pendant son entraînement et lui ont appris à dire : « Attends, cela semble faux, laissez-moi essayer autre chose. »
  • Le résultat : Ils ont utilisé une méthode appelée RLVR avec des erreurs synthétiques. Considérez cela comme un « test de résistance » pour l'IA. En s'entraînant sur de fausses erreurs, l'IA est devenue beaucoup plus robuste. Lorsqu'ils l'ont testée plus tard avec de mauvais contextes, cette IA « vaccinée » était 43 % à 60 % meilleure pour ignorer les mauvais conseils et trouver la bonne réponse par rapport à une IA normale.

Résumé

Le papier nous avertit que même des utilisateurs bien intentionnés (ou l'IA elle-même) peuvent accidentellement piéger un modèle intelligent dans une boucle d'erreurs. L'IA n'est pas seulement en train d'« oublier » la bonne réponse ; elle choisit activement la mauvaise parce qu'elle fait trop confiance au contexte.

Cependant, il y a une bonne nouvelle : en entraînant l'IA à anticiper et à ignorer les mauvais exemples, nous pouvons la rendre beaucoup plus robuste et moins susceptible d'être « cloisonnée » dans la répétition de la même erreur.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →