← Derniers articles
💬 NLP

Do LLMs Adhere to Label Definitions? Examining Their Receptivity to External Label Definitions

Cette étude démontre que, bien que les définitions explicites d'étiquettes puissent améliorer la précision et l'explicabilité des grands modèles de langage, leur intégration réelle dans le processus de résolution de tâches reste inconstante et dépend fortement du contexte, les modèles ayant tendance à privilégier leurs connaissances internes, en particulier pour les tâches générales.

Auteurs originaux : Seyedali Mohammadi, Bhaskara Hanuma Vedula, Hemank Lamba, Edward Raff, Ponnurangam Kumaraguru, Francis Ferraro, Manas Gaur

Publié 2026-02-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Seyedali Mohammadi, Bhaskara Hanuma Vedula, Hemank Lamba, Edward Raff, Ponnurangam Kumaraguru, Francis Ferraro, Manas Gaur

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🧠 Le Grand Dilemme : Qui commande, le cerveau ou le manuel ?

Imaginez que vous avez un super-cuisinier (c'est le modèle d'IA, ou LLM) qui a passé des années à lire des millions de livres de cuisine. Il connaît par cœur comment faire une omelette, même si personne ne lui a jamais dit "fais-le". C'est sa mémoire interne.

Maintenant, imaginez que vous lui donnez un nouveau livre de recettes (les définitions de l'étiquette) pour un concours de cuisine très spécifique.

  • La question du papier : Est-ce que le cuisinier va vraiment lire et suivre votre nouveau livre ? Ou va-t-il ignorer vos instructions et continuer à cuisiner comme il l'a toujours fait, basé sur sa propre mémoire ?

Les chercheurs de cette étude ont voulu tester exactement cela : Les IA obéissent-elles vraiment aux règles qu'on leur donne, ou elles font juste semblant ?


🎭 L'expérience : Le jeu des étiquettes inversées

Pour le savoir, les chercheurs ont joué à un jeu un peu tordu avec l'IA (comme LLaMA-3 ou GPT-4).

L'analogie du "Dictionnaire Fou" :
Imaginez que vous donnez à l'IA un dictionnaire où les définitions sont mélangées :

  • Au lieu de dire "Rouge = couleur du feu", le dictionnaire dit "Rouge = couleur de l'herbe".
  • Au lieu de dire "Vert = couleur de l'herbe", il dit "Vert = couleur du feu".

Ensuite, on montre à l'IA une photo de feu et on lui demande : "Quelle est la couleur ?".

  • Si l'IA suit votre dictionnaire fou, elle dira "Vert".
  • Si l'IA suit sa propre mémoire, elle dira "Rouge".

Ce qu'ils ont découvert :
C'est un mélange surprenant !

  1. Parfois, l'IA vous écoute : Si la tâche est très spécifique (comme analyser la santé mentale ou détecter la haine), l'IA devient très docile. Elle prend votre "dictionnaire" et le suit à la lettre, même si c'est étrange. C'est comme un apprenti qui a besoin de votre manuel pour ne pas se tromper.
  2. Parfois, l'IA vous ignore : Pour des tâches générales (comme comprendre une phrase simple), l'IA préfère souvent sa propre mémoire. Si vous lui donnez une définition bizarre, elle peut se tromper ou même refuser de répondre (comme GPT-4 qui a dit : "Attends, ça ne colle pas, je ne vais pas répondre").

🏥 Deux mondes différents : Le Généraliste vs Le Spécialiste

L'étude a révélé une différence cruciale, comme si on comparait un médecin généraliste et un chirurgien spécialisé.

  • Le Généraliste (Tâches quotidiennes) : Pour des choses simples comme "Est-ce que cette phrase a du sens ?", l'IA est très sûre d'elle. Si vous essayez de lui donner une nouvelle définition, elle résiste. Elle dit : "Je sais déjà faire ça, pas besoin de me réexpliquer."
  • Le Spécialiste (Domaines pointus) : Pour des sujets complexes comme la détection de discours haineux ou l'analyse psychologique, l'IA est plus "faim" d'informations. Elle a besoin de votre définition précise pour bien travailler. Sans votre manuel, elle est perdue. Avec lui, elle devient excellente.

L'analogie de la boussole :

  • Dans une forêt connue (tâche générale), l'IA a sa propre boussole interne et n'a pas besoin de la vôtre.
  • Dans une jungle inconnue (tâche spécialisée), elle a besoin que vous lui donniez la boussole, sinon elle va se perdre.

🤖 La taille compte-t-elle ?

C'est là que ça devient drôle. On pensait que les plus gros modèles (comme GPT-4) étaient les plus intelligents et obéissants.

  • Les Gros Modèles (GPT-4) : Ils sont comme des experts très prudents. Parfois, ils sont si intelligents qu'ils se rendent compte que votre définition est contradictoire avec ce qu'ils savent, et ils disent : "Non, ça ne va pas, je ne peux pas répondre." Ils refusent de jouer le jeu si les règles sont trop bizarres.
  • Les Petits Modèles (Phi-3, Mistral) : Ils sont comme des apprentis très motivés. Ils sont plus petits, ont moins de souvenirs internes, donc ils vous écoutent beaucoup plus. Si vous leur donnez une définition, ils la suivent aveuglément, ce qui peut être très utile si vous leur donnez les bonnes instructions !

🗣️ Le grand secret : Expliquer ≠ Agir

C'est peut-être la découverte la plus surprenante.
Les chercheurs ont vu que l'IA pouvait expliquer parfaitement pourquoi elle a pris une décision en suivant vos règles, mais prendre la mauvaise décision quand même.

L'analogie du juge :
Imaginez un juge qui écrit un magnifique discours expliquant pourquoi un accusé est innocent (en suivant vos règles), mais qui, au moment de frapper le marteau, déclare le coupable.

  • L'IA peut générer de belles explications (le discours) en suivant vos définitions.
  • Mais sa décision finale (le marteau) reste parfois bloquée sur ses anciennes habitudes.

Cela signifie que même si l'IA semble comprendre vos instructions dans son explication, elle ne les applique pas toujours dans son choix final.


💡 En résumé : Que faut-il retenir ?

  1. Ne faites pas confiance aveuglément : Si vous donnez des définitions à une IA, elle ne les suit pas toujours. Ça dépend de la tâche.
  2. Soyez précis pour les tâches difficiles : Si vous travaillez sur des sujets sensibles (santé, sécurité), donnez des définitions très claires et précises. L'IA en a besoin pour bien faire son travail.
  3. Les petites IA sont parfois plus flexibles : Pour des tâches spécialisées, un petit modèle bien guidé peut parfois faire mieux qu'un géant qui refuse de changer ses habitudes.
  4. L'explication n'est pas la preuve : Juste parce que l'IA donne une belle explication, ne pensez pas qu'elle a pris la bonne décision.

En gros, les IA sont comme des étudiants brillants mais têtus : ils ont lu beaucoup de livres, mais s'ils ne comprennent pas bien votre livre, ils risquent de continuer à faire comme ils ont toujours fait !

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →