← Derniers articles
💬 NLP

Post-training makes large language models less human-like

L'article présente le jeu de données Psych-201 pour démontrer que les processus de post-entraînement, qui optimisent les grands modèles de langage pour l'utilité, dégradent systématiquement leur capacité à simuler avec précision le comportement humain, un problème qui persiste et s'aggrave dans les générations de modèles plus récentes et ne peut être résolu par des techniques d'induction de persona.

Auteurs originaux : Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W. Burton, Nuno Busch, Frederick Callaway, Vanessa Cheung, Brian Christian, Julia
Publié 2026-05-11
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Marcel Binz, Elif Akata, Abdullah Almaatouq, Mohammed Alsobay, Oleksii Ariasov, Franziska Brändle, David Broska, Jason W. Burton, Nuno Busch, Frederick Callaway, Vanessa Cheung, Brian Christian, Julian Coda-Forno, Can Demircan, Vittoria Dentella, Maria K. Eckstein, Noémi Éltető, Michael Franke, Thomas L. Griffiths, Fritz Günther, Susanne Haridi, Sebastian Hellmann, Stefan Herytash, Linus Hof, Eleanor Holton, Isabelle Hoxha, Zak Hussain, Akshay Jagadish, Elif Kara, Valentin Kriegmair, Evelina Leivada, Li Ji-An, Tobias Ludwig, Maximilian Maier, Marcelo G. Mattar, Marvin Mathony, Alireza Modirshanechi, Robin Na, Mariia Nadverniuk, Antonios Nasioulas, Surabhi S. Nath, Helen Niemeyer, Kate Nussenbaum, Sebastian Olschewski, Thorsten Pachur, Stefano Palminteri, Aliona Petrenco, Camille V. Phaneuf-Hadd, Angelo Pirrone, Manuel Rausch, Laura Raveling, Shashank Reddy, Milena Rmus, Evan M. Russek, Tankred Saanum, Kai Sandbrink, Louis Schiekiera, Johannes A. Schubert, Luca M. Schulze Buschoff, Nishad Singhi, Leah H. Somerville, Mikhail S. Spektor, Xin Sui, Christopher Summerfield, Mirko Thalmann, Anna I. Thoma, Taisiia Tikhomirova, Vuong Truong, Polina Tsvilodub, Konstantinos Voudouris, Robert C. Wilson, Kristin Witte, Shuchen Wu, Dirk U. Wulff, Hua-Dong Xiong, Songlin Xu, Lance Ying, Xinyu Zhang, Jian-Qiao Zhu, Eric Schulz

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un apprenti brillant, chaotique et incroyablement créatif qui a lu presque tous les livres de la bibliothèque. Cet apprenti est un Modèle de Base. Il est brut, non filtré, et il parle exactement comme un humain le ferait : plein de singularités, d'erreurs, d'hésitations et de la logique désordonnée de la vie réelle. Si vous lui posiez une question, il pourrait trébucher, deviner, ou donner une réponse techniquement « fausse » mais qui semble très humaine.

Ensuite, vous décidez d'entraîner cet apprenti à devenir un Assistant Utile. Vous lui apprenez à suivre des règles strictes, à donner la réponse « correcte », et à agir de manière polie et logique. Ce processus s'appelle le Post-Entraînement.

L'article que vous avez partagé, intitulé « Le post-entraînement rend les grands modèles de langage moins humains », révèle une vérité surprenante et contre-intuitive : Plus vous entraînez ces modèles à être des assistants parfaits, moins ils ressemblent à de vraies personnes.

Voici la décomposition de leurs découvertes à l'aide d'analogies simples :

1. Le « Parfait Élève » contre la « Vraie Personne »

Les chercheurs ont construit un immense terrain d'essai appelé Psych-201. Imaginez cela comme une gigantesque bibliothèque contenant plus de 200 000 transcriptions de vraies personnes passant des tests de psychologie, jouant à des jeux et résolvant des énigmes. C'est comme avoir un « groupe témoin » de l'humanité avec lequel comparer.

Ils ont testé deux types d'IA :

  • Le Modèle de Base : L'apprenti brut qui a appris en lisant des livres.
  • Le Modèle Post-Entraîné : Le même apprenti après avoir été formé pour devenir un assistant serviable et respectueux des règles.

Le Résultat : À chaque fois, le « Parfait Élève » (Post-Entraîné) était moins bon pour prédire ce qu'une vraie personne dirait ou ferait que l'« Apprenti Brut » (Base). En essayant de rendre l'IA « meilleure » en tant qu'assistant, ils ont accidentellement éliminé les comportements très humains qui en faisaient un bon simulateur de personnes.

2. La « Vallée de l'Étrange » de la Logique

Pourquoi cela arrive-t-il ?

  • Les Modèles de Base sont comme un miroir du langage humain. Ils ont absorbé tous nos biais, nos raccourcis, nos « intuitions » et nos erreurs. Si un humain devine mal parce qu'il est fatigué ou confus, le Modèle de Base fait de même.
  • Le Post-Entraînement est comme mettre un filtre sur ce miroir. Il force l'IA à être « normativement correcte ». Il apprend à l'IA à ignorer les singularités humaines et à se concentrer sur la réponse « juste ».

L'article a découvert que cette « correction » est la plus dommageable dans deux domaines :

  • Psycholinguistique (Comment nous utilisons les mots) : Les humains utilisent le langage de manière désordonnée. Les modèles post-entraînés l'utilisent de manière trop parfaite.
  • Raisonnement : Les humains font souvent des erreurs logiques ou utilisent des raccourcis (heuristiques). Les modèles post-entraînés sont contraints d'être logiquement parfaits, ce qui les fait ressembler moins à un processus de pensée humain et plus à une calculatrice.

3. Le Paradoxe « Plus C'est Récent, Plus C'est Pire »

Vous pourriez penser que, à mesure que l'IA devient plus intelligente, elle devient meilleure pour imiter les humains. L'article dit : Pas tout à fait.

  • Les Modèles de Base (les apprentis bruts) s'améliorent pour imiter les humains à chaque nouvelle génération.
  • Cependant, le processus de Post-Entraînement (l'entraînement « assistant ») devient plus agressif. L'écart entre l'« Apprenti Brut » et l'« Assistant Parfait » s'élargit. Plus le modèle est récent, plus il devient « robotique » et moins humain une fois que vous activez les fonctionnalités « assistant ».

4. L'Astuce de la « Persona » Ne Fonctionne Pas

Il existe une astuce populaire appelée Induction de Persona. C'est lorsque vous dites à l'IA : « Fais semblant d'être un enseignant de 35 ans du Brésil », en espérant qu'elle agisse plus comme cette personne spécifique.

Les chercheurs ont testé cela à grande échelle. Ils ont donné à l'IA des profils détaillés de vraies personnes (âge, nationalité, éducation) et lui ont demandé de prédire comment ces personnes spécifiques répondraient.
Le Résultat : Cela n'a pas aidé. Connaître la « persona » n'a pas permis à l'IA de mieux prédire le comportement individuel des humains. C'est comme donner un thésaurus à un acteur ; cela ne fait pas de lui un meilleur improvisateur.

La Grande Conclusion

L'article conclut que les outils mêmes que nous utilisons pour rendre l'IA utile (l'ajustement par instructions, l'entraînement au raisonnement, les filtres de sécurité) sont les mêmes outils qui en font un mauvais outil pour simuler le comportement humain.

Si vous voulez qu'une IA agisse comme un assistant utile, vous devriez utiliser la version Post-Entraînée.
Mais si vous voulez qu'une IA agisse comme un humain (par exemple, pour simuler comment un patient pourrait réagir lors d'une séance de thérapie ou comment un élève pourrait apprendre), vous devriez en fait utiliser le Modèle de Base (la version brute, non entraînée), car elle se souvient encore de comment être désordonnée, imparfaite et humaine.

En bref : Pour rendre l'IA plus utile, nous l'avons rendue moins humaine. Pour la rendre à nouveau plus humaine, nous devrions peut-être arrêter de la « réparer » autant.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →