← Derniers articles
💬 NLP

Quantifying non deterministic drift in large language models

Cet article quantifie empiriquement la dérive comportementale de base dans les grands modèles de langage en démontrant que la variabilité des sorties persiste même à une température de zéro à travers différents modèles et types de prompts, établissant ainsi un point de référence systématique pour évaluer les futures stratégies d'atténuation.

Auteurs originaux : Claire Nicholson

Publié 2026-01-29
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Claire Nicholson

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez un assistant robotique très intelligent et créatif. Vous lui posez exactement la même question, « Quel temps fait-il ? » et vous lui dites : « Soyez aussi précis et ennuyeux que possible. » Vous vous attendriez à ce qu'il donne exactement la même réponse à chaque fois, n'est-ce pas ?

Ce document, écrit par Claire Nicholson, étudie ce qui se passe lorsque vous essayez réellement cela avec des robots d'IA modernes (appelés Grands Modèles de Langage ou LLM). La conclusion surprenante est la suivante : Même quand vous dites au robot d'être parfaitement cohérent, il ne l'est souvent pas.

Voici une décomposition simple de ce que l'étude a découvert, en utilisant des analogies de la vie quotidienne :

1. Le « Fantôme dans la machine » (Non-déterminisme)

Les chercheurs ont traité deux modèles d'IA comme s'ils étaient des jumeaux identiques :

  • Le Robot du Cloud : Un modèle appelé gpt-4o-mini qui vit sur une grande ferme de serveurs (comme une cuisine de restaurant que vous ne pouvez pas voir).
  • Le Robot Local : Un modèle appelé llama3.1-8b qui fonctionne sur un seul ordinateur dans un laboratoire (comme un chef cuisinant dans votre propre cuisine).

Ils ont posé les mêmes questions à ces robots encore et encore, avec les paramètres réglés sur la « cohérence maximale » (Température 0.0).

  • Le Résultat : Le Robot du Cloud a donné une réponse différente environ 1 fois sur 4. Le Robot Local était plus cohérent, mais changeait tout de même sa réponse environ 1 fois sur 10.

L'Analogie : Imaginez demander à un boulanger de faire un gâteau au chocolat en utilisant exactement la même recette et les mêmes ingrédients. Vous vous attendriez à ce que le gâteau soit identique à chaque fois. Mais dans cette étude, le boulanger (l'IA) ajoute parfois une pincée de sel supplémentaire, ou dispose les vermicelles différemment, même si vous lui avez dit de suivre la recette à la perfection.

2. Pourquoi cela arrive-t-il ?

Le document suggère deux raisons principales à cette « dérive » :

  • Le Modèle lui-même : Les modèles plus gros et plus complexes semblent être plus « agités » et moins cohérents que les plus petits.
  • La Cuisine (Infrastructure) : Pour le Robot du Cloud, la façon dont la requête voyage à travers Internet, la manière dont l'ordinateur traite les données, ou même la façon dont le serveur est organisé peuvent modifier le résultat. C'est comme si le four du boulanger avait une légère fluctuation de température ou si le bol de mélange était légèrement de taille différente à chaque fois, même si la recette était la même.

3. Le bouton de « Température »

Les chercheurs ont également testé ce qui se passe lorsque l'on augmente la « Température » (un paramètre qui rend l'IA plus créative et aléatoire).

  • Basse Température (0.0) : Le robot essaie d'être ennuyeux et cohérent, mais il fait quand même des erreurs occasionnelles.
  • Haute Température (0.7) : Le robot devient incontrôlable. Dans ce mode, chaque réponse était différente. C'était comme demander au boulanger de faire un gâteau, mais en lui disant de « faire preuve de créativité ». Soudain, chaque gâteau avait un aspect complètement différent.

4. Le contrôle du « Nombre de mots » et de la « Similitude »

Comment ont-ils mesuré cela ? Ils n'ont pas seulement lu les réponses ; ils ont utilisé les mathématiques pour les comparer.

  • Fraction Unique : Ils ont compté combien de fois le robot donnait une réponse totalement nouvelle.
  • Similitude de Jaccard : C'est une façon sophistiquée de demander : « Combien de mots sont les mêmes ? »
    • Quand le robot était « ennuyeux » (0.0), les réponses étaient environ 90 % similaires.
    • Quand le robot était « créatif » (0.7), les réponses étaient moins de 50 % similaires.

5. Ce que cela signifie pour vous (Le « Budget de Variance »)

Le document ne vous dit pas comment résoudre ce problème. Il dit plutôt : « Vous devez savoir que cela se produit avant d'essayer de le corriger. »

Voyez cela comme un « Budget de Variance ».

  • Si vous construisez un système qui génère des chiffres financiers, vous pourriez dire : « Je ne peux tolérer qu'une différence de 5 % dans le résultat. »
  • Si l'IA dérive plus que cela, vous savez que vous devez intervenir.
  • Mais d'abord, vous devez savoir à quoi ressemble la dérive « normale » sans aucune aide. Ce document fournit cette carte de référence.

Résumé

Cette étude est un « rapport de mesure ». Elle n'a pas inventé une nouvelle façon d'empêcher les robots de changer d'avis. Au lieu de cela, elle a mesuré précisément à quel point ils changent d'avis lorsqu'ils sont laissés à eux-mêmes.

L'idée principale : Même quand vous pensez avoir verrouillé un robot pour qu'il soit 100 % prévisible, il est en réalité en train de s'agiter un peu. Si vous vous reposez sur une seule réponse d'une IA, vous pourriez passer à côté du fait qu'elle aurait pu dire quelque chose de légèrement différent la prochaine fois que vous l'auriez interrogée. Pour obtenir une image complète, vous devrez peut-être poser la même question plusieurs fois et regarder la moyenne.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →