← Derniers articles
🤖 AI

Assessing the Creativity of Large Language Models: Testing, Limits, and New Frontiers

Ce papier évalue systématiquement les tests existants de créativité humaine pour prédire les performances des grands modèles de langage (LLM) dans l'écriture, la pensée divergente et l'idéation scientifique, révélant leur validité limitée et présentant le Test d'Association Divergente à Distance (DRAT) comme le premier instrument robuste capable de prédire l'idéation scientifique en évaluant simultanément la pensée convergente et la pensée divergente.

Auteurs originaux : Samuel Schapiro, Alexi Gladstone, Jonah Black, Heng Ji

Publié 2026-05-14
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Samuel Schapiro, Alexi Gladstone, Jonah Black, Heng Ji

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédiez une bibliothèque géante de robots très intelligents (des Modèles de Langage à Grande Échelle, ou LLM). Vous voulez savoir lesquels sont véritablement « créatifs ». Mais comment mesurer la créativité chez une machine ?

Pendant longtemps, les scientifiques ont tenté d'utiliser les mêmes tests que ceux employés pour les humains afin de noter ces robots. C'est comme essayer de mesurer la capacité d'un poisson à grimper à un arbre parce que vous voulez savoir à quel point il est doué pour l'escalade. Cet article soutient que, bien que certains de ces anciens tests fonctionnent passablement, ils échouent souvent à raconter toute l'histoire, en particulier lorsqu'il s'agit d'idées scientifiques.

Voici une explication simple de ce que les chercheurs ont découvert et de ce qu'ils ont construit pour y remédier.

1. Le Problème : Utiliser les Mauvaises Règles

Les chercheurs ont examiné deux principaux types de « tests de créativité » que passent les humains :

  • La Pensée Divergente : Demander à quelqu'un de trouver beaucoup de réponses différentes et étranges à une question (comme « listez 10 choses totalement différentes les unes des autres »).
  • La Pensée Convergente : Demander à quelqu'un de trouver la seule réponse correcte qui relie trois choses sans rapport (comme « cottage », « suisse » et « gâteau » \rightarrow « fromage »).

L'équipe a testé des dizaines de modèles d'IA avec ces tests humains. Ils ont découvert quelques choses surprenantes :

  • Le Piège de la « Intelligence » : De nombreux tests qui semblaient mesurer la créativité mesuraient en réalité simplement à quel point le robot était « intelligent » ou instruit. Si un robot est doué en mathématiques et en lecture, il obtient naturellement de bons scores à ces tests, même s'il n'est pas réellement créatif. C'est comme noter un élève à un test de mathématiques et appeler cela un « test de créativité » simplement parce qu'il a obtenu un score élevé.
  • Le Point Aveugle « Scientifique » : La découverte la plus choquante a été qu'aucun des tests humains existants ne pouvait prédire de manière fiable si une IA pouvait générer de bonnes idées scientifiques. Vous pourriez avoir un robot excellent pour écrire des histoires ou lister des mots au hasard, mais terrible pour inventer une nouvelle théorie scientifique. Les anciennes règles ne fonctionnaient tout simplement pas pour ce travail.
  • Le Paradoxe des Modèles Plus Récents : À mesure que les modèles d'IA devenaient plus récents et plus puissants, ils sont en fait devenus moins bons en pensée divergente (trouver des idées uniques et étranges). Ils sont devenus plus rigides et standardisés, comme une usine produisant le même cookie encore et encore, plutôt qu'un chef inventant une nouvelle recette.

2. La Solution : Un Nouvel Test Hybride (DRAT)

Puisque les anciens tests échouaient à prédire la créativité scientifique, les auteurs ont inventé un nouveau test appelé le Test d'Association Divergente à Distance (DRAT).

Imaginez les anciens tests comme deux outils séparés :

  • Outil A (Divergent) : Un marteau-pilon qui fracasse les choses pour voir combien de pièces différentes vous obtenez.
  • Outil B (Convergent) : Un tournevis qui serre les choses ensemble pour trouver l'ajustement parfait unique.

Le problème avec la créativité scientifique est que vous avez besoin des deux en même temps. Vous devez fracasser les idées pour trouver quelque chose de nouveau, mais ensuite vous devez les visser ensemble pour vous assurer qu'elles ont du sens et correspondent au problème.

Comment fonctionne le DRAT :
Imaginez que vous donnez à l'IA trois « mots-ancres » très différents (comme « battement de cœur », « pipeline » et « topologie »).

  1. Le Défi : L'IA doit générer 10 mots qui sont tous différents les uns des autres (Divergent).
  2. La Contrainte : Mais, chacun de ces 10 mots doit également pouvoir se connecter métaphoriquement aux trois mots-ancres (Convergent).

C'est comme demander à un poète d'écrire 10 poèmes complètement différents, mais chaque poème doit secrètement parler d'une machine spécifique et complexe. Si l'IA peut faire cela, cela prouve qu'elle peut penser à la fois de manière sauvage et logique.

3. Les Résultats

Lorsqu'ils ont testé ce nouvel outil DRAT :

  • Ça a marché ! C'était le premier test capable de prédire avec succès quels modèles d'IA étaient bons pour générer des idées scientifiques.
  • Ce n'était pas une simple somme des parties : Les chercheurs ont essayé de combiner l'ancien test de « fracassage » et l'ancien test de « vissage » pour voir si cela fonctionnerait. Ça n'a pas marché. Le nouvel outil DRAT a fait quelque chose de spécial que les deux anciens outils ne pouvaient pas faire seuls. Il a prouvé que pour mesurer la créativité scientifique, vous devez tester la capacité d'être à la fois sauvage et logique simultanément.

La Grande Conclusion

L'article conclut que nous ne pouvons pas simplement utiliser les anciens tests humains pour noter la créativité de l'IA.

  • Si vous voulez savoir si une IA est bonne pour écrire des histoires, utilisez la « Tâche d'Association Divergente » (la liste de mots étranges).
  • Si vous voulez savoir si une IA est bonne en pensée divergente (listant de nombreuses options), utilisez la « Tâche d'Association Divergente Conditionnelle ».
  • Mais si vous voulez savoir si une IA peut inventer une nouvelle science, vous avez besoin du nouveau test DRAT, car il vérifie si la machine peut être à la fois sauvagement imaginative et logiquement connectée en même temps.

En bref : Pour mesurer le génie scientifique d'un robot, vous avez besoin d'un test qui le force à jongler avec du feu (divergence) tout en marchant sur un fil (convergence). Les anciens tests ne lui demandaient de faire que l'un ou l'autre.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →