← Derniers articles
💬 NLP

Playing with Words, Improving with Rewards: Training Language Models for Creative Association

Ce papier propose d'entraîner des modèles de langage de grande taille sur le jeu d'association de mots Codenames en utilisant l'apprentissage par renforcement avec des récompenses vérifiables pour améliorer la créativité, révélant que si les modèles plus grands (8B) obtiennent des gains créatifs cohérents avec une perte de raisonnement minimale, les modèles plus petits (1,7B et 4B) privilégient la précision du raisonnement au détriment de la créativité.

Auteurs originaux : Vijeta Deshpande, Namrata Shivagunde, Sherin Muckatira, Hadrien Glaude, Mikhail Gronas, Claire Stevenson, Roger Beaty, Anna Rumshisky

Publié 2026-05-28
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Vijeta Deshpande, Namrata Shivagunde, Sherin Muckatira, Hadrien Glaude, Mikhail Gronas, Claire Stevenson, Roger Beaty, Anna Rumshisky

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un groupe d'étudiants en IA, chacun avec un cerveau de taille différente : un petit (1,7 milliard de paramètres), un moyen (4 milliards) et un grand (8 milliards). Les chercheurs voulaient enseigner à ces étudiants en IA comment être créatifs.

Le problème est que la créativité est comme l'art ; il est difficile de la noter. Si vous demandez à un humain : « Est-ce que ce poème est créatif ? », il pourrait répondre oui, tandis qu'un autre répondra non. Cela rend l'entraînement d'une IA difficile, car l'IA a besoin de retours clairs pour apprendre.

La Solution : Le Jeu de Mots « Codenames »

Pour résoudre ce problème, les chercheurs ont transformé la créativité en un jeu appelé Codenames.

Imaginez un plateau couvert de mots aléatoires comme « Pomme », « Rivière », « Chaise » et « Nuage ».

  • L'Objectif : Un joueur (le « Maître Espion ») voit une liste secrète de mots cibles (par exemple, « Pomme » et « Rivière »). Il doit donner un seul mot indice (comme « Fruit ») qui se connecte à ses cibles mais ne se connecte pas accidentellement aux autres mots du plateau (comme « Chaise »).
  • Le Défi : Cela nécessite deux types de pensée :
    1. Pensée Divergente : Regarder « Pomme » et « Rivière » et se demander : « Qu'ont-ils en commun ? Ah, peut-être « Nature » ou « Croissance » ? » (Étendre l'esprit).
    2. Pensée Convergente : Choisir le seul meilleur mot qui correspond parfaitement sans faire trébucher l'équipe. (Rétrécir le focus).

Comme le jeu a une condition de victoire/défaite claire (avez-vous deviné les bons mots ?), l'IA peut apprendre en jouant des millions de parties et en obtenant un score simple de « Bien joué » ou « Réessayez ». Aucun juge humain n'est nécessaire.

L'Expérience : Enseigner par Récompenses

Les chercheurs ont utilisé une méthode appelée Apprentissage par Renforcement avec Récompenses Vérifiables (RLVR).

  • Imaginez que l'IA est un chien. Chaque fois qu'elle fait un bon coup dans le jeu, elle reçoit une friandise (une récompense). Chaque fois qu'elle fait un mauvais coup, elle ne reçoit rien.
  • Ils ont entraîné les trois modèles d'IA (Petit, Moyen, Grand) à jouer à ce jeu encore et encore jusqu'à ce qu'ils deviennent vraiment bons.

La Découverte Surprenante : La Taille Compte

Voici la retournement. Les chercheurs s'attendaient à ce que toutes les IA s'améliorent dans tout. Au lieu de cela, ils ont découvert que la taille du cerveau de l'IA changeait ce qu'elle apprenait.

1. Les IA Petites et Moyennes (1,7B et 4B) : Les « Spécialistes de la Précision »

  • Ce qui s'est passé : Ces modèles plus petits sont devenus significativement meilleurs dans les problèmes de logique et de mathématiques (comme résoudre des énigmes ou faire de l'arithmétique).
  • Le Compromis : Ils sont en fait devenus moins créatifs. Ils sont devenus très stricts et précis, comme un comptable robot. Ils ont arrêté de prendre des risques et ont commencé à chercher la réponse « sûre ».
  • Analogie : C'est comme enseigner un jeu de société complexe à un petit enfant. Il apprend les règles parfaitement et cesse de faire des erreurs, mais il arrête de jouer avec son imagination.

2. La Grande IA (8B) : L'« Explorateur Créatif »

  • Ce qui s'est passé : Le plus grand modèle est devenu significativement meilleur dans les tâches créatives (écrire des histoires, trouver des légendes drôles, créer des métaphores).
  • Le Compromis : Il est devenu légèrement moins bon en mathématiques et en logique strictes. Il a commencé à prendre plus de risques et à faire des connexions plus uniques, ce qui a parfois conduit à de petites erreurs de calcul.
  • Analogie : C'est comme enseigner le même jeu de société à un artiste brillant. Il apprend les règles mais commence à voir des motifs cachés et à faire des connexions sauvages et créatives que les joueurs plus petits manquent.

La Grande Image

L'article conclut que vous ne pouvez pas simplement « activer » la créativité de la même manière dans tous les modèles d'IA.

  • Si vous voulez un penseur précis et logique, l'entraînement sur ce jeu de mots aide les modèles plus petits à devenir plus affûtés.
  • Si vous voulez un penseur créatif et imaginatif, l'entraînement sur ce jeu aide les modèles plus grands à devenir plus diversifiés et inventifs.

Les chercheurs ont montré qu'en utilisant un jeu simple et objectif, ils pouvaient « régler » les modèles d'IA pour qu'ils soient soit meilleurs en logique, soit meilleurs en créativité, selon la taille du modèle. C'est une manière pratique de façonner le comportement de l'IA sans avoir besoin que des humains notent constamment leur travail.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →