Automated Creativity Evaluation of Language Models Across Open-Ended Tasks
Cet article introduit un cadre évolutif et agnostique du domaine qui quantifie la créativité des grands modèles de langage à travers des tâches ouvertes en combinant l'entropie sémantique pour mesurer la nouveauté divergente avec un juge multi-agents basé sur la recherche pour évaluer l'accomplissement convergent de la tâche.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous soyez un recruteur essayant de juger à quel point un groupe de nouveaux écrivains, inventeurs et solutionneurs de problèmes par IA est « créatif ». Par le passé, juger la créativité revenait à essayer de noter une peinture avec une règle : c'était désordonné, cela nécessitait un expert humain pour chaque œuvre, et cela ne fonctionnait que pour des types d'art spécifiques.
Ce document présente un nouvel « Évaluateur de Créativité » automatisé qui fonctionne pour n'importe quel type de tâche ouverte, qu'il s'agisse de résoudre un puzzle ou d'écrire une histoire. Les auteurs décomposent la créativité en deux superpouvoirs distincts et les mesurent séparément : la Pensée Divergente (la capacité d'imaginer de nombreuses idées différentes) et la Pensée Convergente (la capacité de choisir la meilleure idée et de la faire fonctionner).
Voici comment leur système fonctionne, en utilisant des analogies simples :
1. Mesurer le « Rêve » (Créativité Divergente)
Le Problème : Comment savoir si une IA ne fait que répéter la même idée avec des mots différents, ou si elle explore réellement de nouveaux territoires ?
L'Ancienne Méthode : Compter les mots ou vérifier si les phrases semblent différentes en surface. C'est comme juger un chef par le nombre de mots différents qu'il utilise pour décrire une « soupe », même si elles ont toutes le même goût.
La Nouvelle Méthode (Entropie Sémantique) : Les auteurs utilisent un concept appelé Entropie Sémantique.
- L'Analogie : Imaginez que vous demandiez à une IA : « Comment traverser une rivière ? »
- Une IA à faible créativité pourrait dire : « Construire un pont », « Faire un pont », « Édifier un pont ». Ces phrases semblent différentes mais signifient exactement la même chose. L'« entropie » (la variété) est faible.
- Une IA à haute créativité pourrait dire : « Construire un pont », « Faire voler un drone », « Nouer des lianes ensemble », « Attendre que l'eau gèle ». Ce sont des chemins véritablement différents. L'« entropie » est élevée.
- Le Résultat : Cette méthode agit comme un « compteur de variété ». Elle ignore les changements de surface des mots et mesure combien de directions conceptuelles différentes l'IA explore. Le papier a révélé que ce compteur correspond bien mieux à ce que les humains considèrent comme « créatif » que les méthodes précédentes.
2. Mesurer le « Faire » (Créativité Convergente)
Le Problème : Générer des idées folles est facile ; s'assurer que ces idées résolvent réellement le problème est difficile. Une IA pourrait suggérer de « voler sur un dragon » pour traverser une rivière, ce qui est créatif mais inutile.
L'Ancienne Méthode : Utiliser un seul juge IA ou un humain pour lire la réponse. C'est lent, coûteux et difficile à mettre à l'échelle.
La Nouvelle Méthode (L'Équipe Multi-Agents basée sur la Récupération) : Les auteurs ont construit une équipe de « juges » IA spécialisés qui travaillent ensemble, mais avec une nuance pour économiser du temps et de l'argent.
- L'Analogie : Imaginez un panel d'experts (un Responsable de la Sécurité, un Expert en Faisabilité et un Critique Littéraire) examinant un projet.
- Ancienne Méthode : Chaque fois qu'ils parlent, ils relisent l'intégralité de l'historique de la conversation depuis le début. C'est comme une réunion où tout le monde relit les 100 dernières pages de notes avant de prendre la parole. Cela devient énorme et coûteux.
- Nouvelle Méthode : L'équipe utilise un « système de classement intelligent ». Au lieu de tout relire, ils ne sortent que les notes spécifiques pertinentes pour le point actuellement discuté.
- Le Résultat : Cette approche « basée sur la récupération » réduit les coûts de calcul de 63 % tout en étant aussi précise que des experts humains. Elle garantit que l'IA ne se contente pas de rêver de non-sens, mais qu'elle remplit réellement les exigences de la tâche.
3. La Grande Découverte : Deux Compétences Différentes
La découverte la plus surprenante de ce papier est que ces deux compétences — Rêver et Faire — ne croissent pas ensemble automatiquement.
- L'Analogie : Pensez à une voiture. Vous pouvez avoir un moteur très puissant (Convergente/Exécution de la tâche) qui vous amène parfaitement à destination, mais cela ne signifie pas que le conducteur est doué pour l'exploration hors-piste (Divergente/Créativité).
- La Découverte : À mesure que les modèles d'IA deviennent plus grands et plus intelligents pour suivre des instructions (Convergente), ils ne deviennent pas nécessairement meilleurs pour explorer des idées nouvelles et sauvages (Divergente). En fait, les modèles les plus grands et les plus « corrects » explorent parfois moins que les plus petits. Le papier suggère que l'entraînement actuel rend les IA meilleures pour être « correctes », mais pas nécessairement plus « créatives ».
4. Tester le Système
Les auteurs ont testé ce cadre sur trois « terrains de jeu » très différents :
- MacGyver : Résoudre des problèmes physiques avec des objets du quotidien (ex : « Comment réparer une fuite avec une chaussette ? »).
- HypoGen : Proposer de nouvelles idées de recherche scientifique.
- BookMIA : Écrire des histoires créatives avec des points de départ et de fin spécifiques.
Dans ces trois cas, leur système a réussi à mesurer comment les idées de l'IA étaient « larges » et à quel point les solutions finales étaient « bonnes », prouvant ainsi son efficacité à travers différents types de créativité.
Résumé
Ce papier fournit une règle universelle et automatisée pour la créativité. Il sépare la capacité de générer de nombreuses idées uniques de la capacité de résoudre le problème correctement. Il démontre que, bien que l'IA devienne meilleure pour résoudre des problèmes, elle ne devient pas automatiquement plus imaginative, et que nous avons besoin de nouveaux outils pour mesurer et encourager cette « étincelle créative » spécifique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.