Are LLMs becoming similarly creative? Evidence from three years of models
Cet article analyse trois années de sorties de modèles de langage de grande taille et constate une diminution statistiquement significative de la diversité des résultats sur des tâches créatives ouvertes, suggérant une tendance à l'homogénéisation qui pourrait diminuer l'agentivité humaine dans le travail de co-création humain-IA.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Résumé technique : « Les LLM deviennent-ils également créatifs ? Évidences issues de trois années de modèles »
Énoncé du problème
Bien que de nombreux benchmarks évaluent la performance des grands modèles de langage (LLM) sur des tâches avec des réponses vérifiables, il existe un manque de données longitudinales concernant la performance des LLM sur des tâches ouvertes où la créativité, l'originalité et la diversité sont primordiales. La recherche actuelle suggère que, bien que les LLM puissent paraître individuellement créatifs, ils présentent souvent une homogénéité collective, produisant des contenus similaires les uns aux autres à travers différents modèles et au fil du temps. Cependant, il reste incertain de savoir si cette homogénéité est un artefact temporaire du développement technologique ou une caractéristique inévitable des modèles de langage statistiques. Les benchmarks actuels (par exemple, MMLU, HELM) se concentrent sur des critères explicites avec des réponses vérifiables et ne parviennent pas à capturer les tendances de la diversité ou de l'originalité des productions créatives au fil du temps.
Méthodologie
Les auteurs ont mené une analyse temporelle préliminaire de la diversité des sorties des LLM via un processus en quatre étapes :
- Sélection des prompts : Deux ensembles complémentaires de prompts ouverts ont été sélectionnés pour susciter un comportement créatif :
- Tâche des usages alternatifs (AUT) : Une évaluation psychométrique standardisée de la pensée divergente où les modèles génèrent des utilisations non conventionnelles d'objets communs.
- Infinity-Chat100 : Une collection de 100 requêtes d'utilisateurs réelles et ouvertes couvrant six catégories, incluant la génération de contenu créatif, le brainstorming et l'idéation.
- Collecte de données : Les prompts ont été exécutés sur 68 modèles publiés entre mars 2023 et juillet 2026, représentant 12 fournisseurs de modèles majeurs (33 à poids fermés et 34 à poids ouverts). Toutes les générations ont utilisé une température et un top-p de 1,0 pour conserver l'échantillonnage stochastique.
- Plongement sémantique (Embedding) : Les réponses ont été plongées dans l'espace vectoriel à l'aide du modèle de sentence-transformer
all-MiniLM-L6-v2. Pour l'AUT, tous les usages pour un objet unique ont été plongés comme un seul vecteur ; pour Infinity-Chat, chaque réponse a été plongée individuellement. - Analyse de régression : L'étude a calculé les distances cosinus entre les plongements de paires de modèles de familles différentes (modèles provenant de fournisseurs différents) pour mesurer la divergence sémantique. Ces paires ont été regroupées en neuf segments temporels basés sur les dates de sortie. Une régression par moindres carrés ordinaires (OLS) a été effectuée sur la distance cosinus moyenne par rapport à l'indice du segment. Pour atténuer le biais dû à la représentation inégale des familles, les auteurs ont effectué 1 000 itérations de rééchantillonnage équilibré par famille afin de générer une distribution d'estimations de pentes.
Principales contributions
- Cadre longitudinal : Ce document fournit le premier cadre pour suivre l'évolution des productions créatives des LLM au fil du temps, dépassant les instantanés statiques du comportement des modèles.
- Analyse à double tâche : En combinant une tâche psychométrique contrôlée (AUT) avec des requêtes d'utilisateurs réelles (Infinity-Chat100), l'étude évalue la créativité à travers des contextes à la fois structurés et non structurés.
- Preuve quantitative de convergence : L'étude offre une preuve empirique que les sorties des LLM deviennent de plus en plus similaires au fil du temps, remettant en question l'hypothèse selon laquelle les nouveaux modèles offrent intrinsèquement une plus grande diversité créative.
Résultats
L'analyse révèle une diminution statistiquement significative de la diversité des sorties des modèles sur la période d'observation de trois ans :
- Tendance : Les ensembles de données AUT et Infinity-Chat montrent tous deux une pente négative constante de la distance cosinus inter-familles au fil du temps, indiquant une homogénéité sémantique croissante.
- Magnitude : Le déclin est plus prononcé dans la tâche des usages alternatifs (AUT), où la distance cosinus moyenne inter-familles est passée d'environ 0,50 dans le premier segment de publication à moins de 0,40 dans le plus récent. L'ensemble de données Infinity-Chat a montré un déclin plus léger mais constant, passant d'environ 0,34 à 0,32.
- Robustesse : Les 1 000 itérations de rééchantillonnage ont produit des pentes négatives pour les deux ensembles de données, confirmant que la tendance est robuste à travers différentes combinaisons de modèles de chaque famille.
Signification et affirmations
L'article postule que les LLM deviennent moins créatifs dans les tâches exigeant des réponses ouvertes, suggérant une convergence de la substance créative entre les modèles. Les auteurs soutiennent que si cette tendance persiste, « l'homogénéisation pilotée par les LLM pourrait progressivement diminuer l'agence humaine dans le travail de co-création humain-IA ».
L'étude présente ces conclusions comme une analyse préliminaire qui exige une considération attentive du rôle des LLM dans le processus créatif humain. Elle met en lumière un potentiel « paradoxe de la créativité de l'IA » : alors que les modèles peuvent paraître individuellement créatifs, leurs sorties agrégées deviennent moins diverses, ce qui pourrait limiter l'éventail des idées rencontrées par les utilisateurs et impacter négativement la créativité humaine en aval. Les auteurs déclarent explicitement que leur travail est préliminaire et appellent à des recherches futures pour examiner les mécanismes sous-jacents (tels que les données d'entraînement partagées ou la distillation) et les facteurs spécifiques pilotant cette convergence.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.