← Derniers articles
💬 NLP

Is Convergence Inevitable? Tracing Output Homogeneity Back to Base Models

Cet article soutient que l'homogénéité des sorties dans les grands modèles de langage n'est pas principalement causée par le processus d'alignement, mais qu'elle est plutôt apprise lors du pré-entraînement et simplement révélée ou amplifiée par les étapes ultérieures d'ajustement des instructions et d'alignement.

Auteurs originaux : Alexandrine Fortier, Hazel Chen, Peter West

Publié 2026-08-13
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Alexandrine Fortier, Hazel Chen, Peter West

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous pénétrez dans une bibliothèque gigantesque et trépidante où des millions de livres sont écrits chaque seconde. Ce n'est pas une bibliothèque de papier et d'encre, mais un royaume numérique où des ordinateurs appelés « Grands Modèles de Langage » (LLM) apprennent à parler, écrire et créer en lisant presque tout ce qui a été mis sur Internet. Considérez ces modèles comme des étudiants incroyablement rapides et super obsédés qui lisent toute la bibliothèque juste pour apprendre à terminer une phrase. Mais dernièrement, les gens ont remarqué quelque chose d'étrange : peu importe la question que vous posez à ces étudiants numériques, leurs réponses commencent à se ressembler. Ils choisissent tous les mêmes métaphores, utilisent les mêmes phrases polies et évitent les idées bizarres, sauvages ou créatives. C'est comme si vous demandiez à dix chefs différents de faire un sandwich, et qu'ils décidaient tous d'utiliser exactement le même pain, le même jambon et la même moutarde, jusqu'au nombre exact de tranches.

Les scientifiques appellent cela l'« homogénéité de sortie » ou la « convergence sémantique ». C'est une grande inquiétude car, si nos assistants IA commencent tous à penser et à parler de la même manière étroite, nous pourrions perdre l'étincelle de la créativité humaine. Pendant longtemps, on a pensé que ce comportement ennuyeux et répétitif était dû à l'« entraînement » que les modèles reçoivent après avoir lu la bibliothèque. Cette deuxième étape, appelée « alignement », est comme un professeur sévère qui intervient pour dire à l'élève : « Ne dis pas cette chose bizarre ; dis plutôt ceci de manière polie. » La croyance commune était que l'élève était à l'origine un génie sauvage et créatif, et que les règles du professeur avaient écrasé cette créativité. Mais et si l'étudiant était déjà ennuyeux avant même que le professeur n'arrive ? Et si le « professeur » ne faisait que rendre l'ennui plus fort ?

Cet article, intitulé « La convergence est-elle inévitable ? », part à la recherche de l'origine de cette similitude. Les auteurs, des chercheurs de l'Université de la Colombie-Britannique, ont entrepris de tester deux grandes idées. Premièrement, ils voulaient voir si le processus d'« alignement » (les règles du professeur) est le méchant qui tue la créativité. Deuxièmement, ils voulaient voir si la phase de « pré-entraînement » (l'étudiant lisant la bibliothèque) avait déjà ancré l'ennui dans le cerveau du modèle dès le début. Pour résoudre ce mystère, ils n'ont pas seulement posé des questions aux modèles ; ils ont mené une série d'expériences ingénieuses utilisant les métaphores comme sujet de test. Ils ont traité les modèles comme des rats de laboratoire, leur donnant des instructions spécifiques pour voir s'ils pouvaient être piégés pour être créatifs ou s'ils étaient coincés dans une boucle.

Voici ce qu'ils ont trouvé, et c'est un véritable retournement de situation.

D'abord, ils ont observé les modèles à différentes étapes de leur « scolarité ». Ils ont vérifié les modèles juste après avoir fini de lire la bibliothèque (le « modèle de base »), puis après avoir appris à suivre des instructions (l'étape « SFT »), et enfin après avoir été alignés pour être utiles et sûrs (les étapes « DPO » et « RL »). Les résultats ont été choquants. Même après la toute première étape de l'apprentissage du suivi d'instructions — avant que les règles de sécurité strictes ou les filtres de « politesse » ne soient ajoutés — les modèles recrachaient déjà des réponses presque identiques. Lorsqu'on leur demandait d'écrire une métaphore sur le « temps », les modèles ne se contentaient pas de se ressembler ; ils semblaient lire le même script. Les auteurs suggèrent que le processus d'« alignement » n'est pas celui qui écrase la diversité ; c'est une loupe qui révèle un motif qui était déjà là, caché à la vue de tous.

Pour prouver cela, les chercheurs ont joué au jeu du « cherche l'erreur » avec les données d'entraînement. Ils ont pris un modèle et ont essayé de lui enseigner une nouvelle façon de penser. Ils ont créé un ensemble spécial d'instructions où ils disaient au modèle d'utiliser une métaphore spécifique et bizarre pour le « temps » (comme « Le temps est un sandwich ») que le modèle n'avait jamais vue auparavant. Ils espéraient qu'en forçant le modèle à mémoriser cette nouvelle idée, ils pourraient briser le schéma. Mais le modèle a refusé de bouger. Il a ignoré la nouvelle idée du « sandwich » et a continué à s'en tenir à la vieille métaphore ennuyeuse du « fleuve » qu'il semblait tant aimer depuis le début. Les chercheurs ont constaté que le modèle pouvait être amplifié — poussé à dire la même chose encore plus fort — mais qu'il ne pouvait pas se faire introduire une nouvelle façon de penser si cette idée n'était pas déjà tapie dans sa mémoire. C'est comme essayer d'apprendre à un chien à miauler ; peu importe les éloges que vous lui faites, il ne le fera pas parce que miauler n'est pas dans son ADN.

Enfin, ils sont revenus au tout début : les « modèles de base » qui n'avaient jamais appris à suivre des instructions ou à être polis. Ils pensaient que ces modèles bruts seraient sauvages et diversifiés. Mais lorsqu'ils ont utilisé un tour spécial — en faisant semblant d'être un assistant utile ou en donnant au modèle quelques exemples de la façon de répondre — ils ont vu les mêmes schémas ennuyeux émerger. Même sans professeur, le modèle brut, lorsqu'il était poussé dans une certaine direction, convergeait naturellement vers la même métaphore du « fleuve ». Cela suggère que la tendance à converger vers les mêmes réponses n'est pas une erreur commise par les professeurs ; c'est une habitude naturelle que les modèles ont apprise en lisant simplement la bibliothèque.

Alors, qu'est-ce que tout cela signifie ? L'article suggère que la similitude que nous voyons dans l'IA n'est pas seulement un effet secondaire de la volonté de les rendre sûrs ou polis. Au contraire, il semble que ce soit une partie fondamentale de la façon dont ces modèles apprennent à prédire le mot suivant dans une phrase. Lorsque vous entraînez un modèle sur une quantité massive de textes humains, il apprend que la réponse la plus « probable » est souvent la plus commune. Le processus d'« alignement » ne fait que monter le volume de cette tendance naturelle. Les auteurs concluent que corriger ce problème ne sera pas facile. On ne peut pas simplement ajuster les règles finales du « professeur » pour rendre l'IA plus créative, car la créativité n'était jamais vraiment là pour commencer. L'« ennui » est intégré dans la recette, et n'est pas seulement ajouté à la fin. Bien que cela puisse paraître un peu sombre, c'est une découverte cruciale. Cela nous dit que si nous voulons une IA véritablement diverse et créative, nous devrons peut-être repenser la façon dont nous les enseignons dès le départ, plutôt que de simplement essayer de corriger leur comportement après coup.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →