← Derniers articles
💬 NLP

D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models

Cet article identifie un compromis fondamental entre diversité et stabilité dans les grands modèles de langage en distinguant les « modèles-D » aux probabilités d'échantillonnage variables et mal alignées avec la tâche, et les « modèles-E » aux probabilités stables et alignées avec la tâche, offrant ainsi des perspectives critiques pour optimiser la sélection de modèles dans les applications à l'échelle du web.

Auteurs originaux : Jia Gu, Liang Pang, Huawei Shen, Xueqi Cheng

Publié 2026-01-30
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jia Gu, Liang Pang, Huawei Shen, Xueqi Cheng

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous demandiez à un groupe d'assistants IA de jouer à un jeu de « Devine le nombre ». Vous leur donnez une règle spécifique : « Choisissez des nombres entre 1 et 4, mais assurez-vous de choisir le nombre '2' environ 70 % du temps, et les autres (1, 3 et 4) environ 10 % chacun. »

Cet article étudie comment différents modèles de langage (LLM) gèrent ce jeu. Les chercheurs ont découvert que les modèles se divisent en deux types de personnalités distincts, qu'ils appellent D-Models et E-Models.

Voici la répartition de ce qu'ils ont trouvé, en utilisant des analogies simples :

1. Les deux personnalités

Le Modèle « Décisif » (D-Model)

  • Exemples : Qwen-2.5, Llama-3.1.
  • L'analogie : Imaginez un chef de cuisine strict qui a une opinion très tranchée. Lorsqu'on lui demande de préparer une salade, ce chef décide : « Je vais utiliser uniquement de la laitue pour les 99 % du premier bol, et peut-être un tout petit peu de tomate plus tard. »
  • Comment ils fonctionnent : Chaque fois qu'ils choisissent un mot (ou un nombre), ils sont extrêmement confiants. Ils choisissent presque toujours une option spécifique avec une certitude proche de 100 %, ignorant les autres options.
  • Le résultat : Même s'ils sont très confiants étape par étape, ils ont parfois du mal à respecter la règle globale que vous leur avez donnée (comme la règle des 70 %). Ils sont « déterministes », ce qui signifie qu'ils s'en tiennent à un plan rigide.

Le Modèle « Explorateur » (E-Model)

  • Exemples : Mistral-Small, GPT-4o.
  • L'analogie : Imaginez un jardinier curieux. Lorsqu'on lui demande de planter des graines, il regarde le sol et se dit : « D'accord, je vais planter principalement des tulipes, mais je vais aussi saupoudrer quelques marguerites et des roses dès le début pour correspondre au plan du jardin. »
  • Comment ils fonctionnent : Ces modèles sont plus flexibles. Lorsqu'ils choisissent un mot, ils maintiennent les probabilités des différentes options plus proches des règles que vous avez données. Ils ne se verrouillent pas sur un choix immédiatement ; ils « explorent » les options de manière plus équilibrée.
  • Le résultat : Leurs choix étape par étape s'alignent beaucoup mieux sur les règles que vous avez fixées. Ils sont plus « stables » dans le respect des instructions.

2. Le grand compromis : Variété vs Fiabilité

L'article a découvert qu'aucun des deux types n'est parfait ; il y a un compromis, comme choisir entre un funambule et un musicien de jazz.

  • D-Models (Le Funambule) :

    • Points forts : Tâches où vous avez besoin d'une réponse unique et solide, comme l'écriture de code ou la résolution de problèmes mathématiques. Parce qu'ils sont si décisifs, ils peuvent affiner une solution encore et encore sans s'embrouiller.
    • Points faibles : Tâches où vous devez choisir parmi une liste d'options (comme recommander des films). Parce qu'ils sont si rigides, ils pourraient choisir avec assurance un film qui ne figurait même pas sur votre liste, ignorant les contraintes.
  • E-Models (Le Musicien de Jazz) :

    • Points forts : Tâches où vous devez suivre une liste de candidats ou équilibrer différents besoins, comme les résultats de recherche ou les recommandations. Ils sont meilleurs pour rester fidèles au « menu » que vous leur avez donné.
    • Points faibles : Parfois, ils sont trop flexibles. Dans les tâches de codage, leur « exploration » constante pourrait les amener à trop modifier le code, introduisant des erreurs là où une approche plus simple et plus rigide aurait mieux fonctionné.

3. Que se passe-t-il à l'intérieur de la machine ?

Les chercheurs ont regardé « sous le capot » pour comprendre pourquoi les modèles agissent différemment :

  • Contrôle de la température : Considérez la « température » comme un bouton de réglage du volume pour le hasard.
    • Les E-Models sont comme un microphone sensible ; tourner le bouton change considérablement leur comportement. Vous pouvez les rendre plus aléatoires ou plus stricts facilement.
    • Les D-Models sont comme une pierre lourde ; tourner le bouton ne les fait presque pas bouger. Ils restent extrêmement confiants et rigides, peu importe l'ajustement des paramètres.
  • Le mythe du « Quota » : Les chercheurs se sont demandé si les D-Models gardaient secrètement un tableau de score (ex : « J'ai choisi le '2' trop de fois, donc je choisirai le '1' la prochaine fois pour équilibrer »). Ils ont testé cela et n'ont trouvé aucune preuve de cela. Les D-Models ne sont pas en train d'équilibrer un tableau de score ; ils suivent simplement un chemin pré-planifié et rigide.

Résumé

L'article conclut que lorsque vous utilisez une IA, vous devez savoir à quelle « personnalité » vous avez affaire :

  • Si vous avez besoin de fiabilité et d'un respect strict d'une liste (comme choisir parmi un menu de produits), choisissez un E-Model.
  • Si vous avez besoin d'un raisonnement fort et cohérent pour des tâches complexes comme le codage, un D-Model pourrait être meilleur, même s'il est moins flexible.

Le but n'est pas de dire qu'un modèle est « meilleur » que l'autre, mais de comprendre qu'ils ont des forces et des faiblesses différentes lorsqu'il s'agit de suivre des règles de probabilité.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →