States Hidden in Hidden States: Implicit Discrete State Representations Emerge in LLMs' Hidden States
Cet article étudie comment les grands modèles de langage effectuent des calculs étendus sans raisonnement explicite par chaîne de pensée en formant et en utilisant des représentations d'états discrets implicites imparfaites au sein de leurs états cachés, tout en caractérisant leur formation et en identifiant leur contribution aux erreurs de calcul.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous regardez un magicien sortir un lapin d'un chapeau. Vous savez que le lapin n'est pas apparu par magie de nulle part, mais vous ne voyez pas le tour. Pendant longtemps, les scientifiques qui étudient l'intelligence artificielle (IA) ont été dans une situation similaire. Ils savent que ces cerveaux informatiques géants, appelés modèles de langage étendus (LLM), peuvent faire des choses incroyables comme écrire des poèmes, résoudre des problèmes mathématiques et discuter comme des humains. Mais comment ils font cela à l'intérieur de leur « esprit » (qui n'est qu'une immense collection de nombres et de couches) est resté une boîte noire.
Pour comprendre cet article, vous devez savoir deux choses simples. Premièrement, les LLM fonctionnent en prédisant le mot suivant dans une phrase, un mot à la fois. Deuxièmement, lorsqu'ils font cela, ils créent un « bloc-notes » temporaire d'informations appelé état caché. Considérez cet état caché comme une note mentale que l'IA prend pendant qu'elle réfléchit. Habitéralement, nous supposons que l'IA lit simplement toute la question puis devine la réponse. Mais et si, en lisant une longue liste de nombres, l'IA gardait secrètement un total progressif dans sa tête, tout comme vous le feriez lorsque vous additionnez votre facture d'épicerie de tête sans rien écrire ? Cet article demande : l'IA est-elle réellement en train de faire ce calcul mental, ou est-elle simplement en train de deviner ?
Le tour de magie du calcul mental
Imaginez que vous êtes à une fête, et que quelqu'un vous tend une longue liste de nombres : 17, 38, 32, 87... et vous demande de les additionner instantanément, sans rien écrire ni dire les étapes à voix haute. La plupart des gens auraient du mal, mais les IA les plus intelligentes du monde commencent à devenir très douées pour cela. Elles peuvent regarder une suite allant jusqu'à 15 nombres et recracher le total correct immédiatement, sans montrer leur raisonnement.
Cet article, intitulé « States Hidden in Hidden States » (Des états cachés dans les états cachés), étudie précisément comment ces modèles d'IA réussissent ce tour de force. Les chercheurs de l'Université Tsinghua ont émis l'hypothèse que ces modèles ne sont pas simplement en train de deviner ; ils construisent secrètement des Représentations d'États Discrets Implicites (IDSRs).
Décortiquons ce terme savant. Imaginez que l'IA est une équipe de travailleurs passant un seau d'eau le long d'une ligne.
- Implicite : Ils ne crient pas le nombre à voix haute (génération de texte).
- État Discret : Ils tiennent un nombre spécifique, exact, entre leurs mains (comme « 37 » après avoir ajouté 17 et 20).
- Représentation : Ce nombre existe sous la forme d'un motif à l'intérieur des couches internes de l'IA.
Les chercheurs voulaient prouver que l'IA conserve réellement ces nombres intermédiaires pendant qu'elle lit la liste, plutôt que d'attendre la toute fin pour tenter de calculer le tout d'un coup.
Le travail de détective : Jeter un œil dans le cerveau
Pour voir si ce « bloc-notes mental » existe réellement, les chercheurs ont joué à un jeu de « 20 questions » avec les couches internes de l'IA. Ils ont utilisé un outil appelé sonde. Considérez une sonde comme un petit détective super rapide qui peut jeter un coup d'œil aux notes internes de l'IA à un moment précis et demander : « Quel nombre es-tu en train de penser en ce moment ? »
Ils ont testé cela sur une variété de modèles, des plus petits (comme Llama2-7B) aux géants (comme GPT-4 et Qwen-72B). Ils ont demandé aux modèles de résoudre des problèmes d'addition avec des listes comprenant de 2 à 14 nombres.
Ce qu'ils ont trouvé :
- Plus c'est grand, plus ça grandit : La capacité de faire ce calcul mental « émerge » à mesure que les modèles deviennent plus grands. Les petits modèles peuvent additionner deux ou trois nombres, mais dès que la liste atteint huit nombres, ils s'effondrent. Les modèles les plus imposants, cependant, peuvent gérer des listes de 11 ou même 15 nombres avec une précision surprenante.
- La note cachée est réelle : Lorsque les chercheurs ont utilisé leurs « sondes de détective » sur les couches cachées de l'IA, ils ont découvert que les modèles tenaient effectivement les totaux progressifs. Par exemple, après que l'IA a lu « 17 + 24 », l'état interne du modèle contenait une représentation de « 41 », même si elle n'avait pas encore prononcé le mot « 41 » à voix haute.
- Ce n'est pas parfait : La mauvaise nouvelle est que cette note mentale n'est pas parfaite. À mesure que la liste de nombres s'allonge, la « note » devient un peu floue. Les chercheurs ont constaté que si l'IA peut maintenir le nombre parfaitement pour les premières étapes, au moment où elle arrive au 15e nombre, la représentation interne commence à perdre de sa précision. Cette compression « avec perte » est la raison pour laquelle même les modèles les plus intelligents se trompent parfois dans la réponse finale.
Comment l'IA construit le nombre
L'article explique également comment l'IA construit ces nombres, ce qui est étonnamment similaire à la façon dont les humains le font.
- Un chiffre à la fois : L'IA ne calcule pas le nombre entier d'un seul coup. Elle construit la réponse chiffre par chiffre, en commençant par la droite (les unités), puis les dizaines, puis les centaines. C'est comme aligner des colonnes sur papier, mais cela se passe entièrement à l'intérieur du cerveau de l'IA.
- Les couches « superficielles » vs « profondes » : L'IA possède de nombreuses couches de traitement. Les chercheurs ont découvert que les 10 premières couches sont comme la partie « calculatrice » du cerveau — elles effectuent simplement le calcul brut. Mais à mesure que l'information se déplace vers les couches plus profondes (autour de la couche 10 et au-delà), l'IA commence à mélanger le contexte de la phrase. C'est comme si la calculatrice était distraite par la conversation environnante. Ce mélange est ce qui cause le caractère « flou » ou les erreurs dans la réponse finale.
- Linéaire, pas magique : L'IA ne fait pas le calcul de manière magique et instantanée. Elle traite la liste de manière linéaire. Si vous avez les nombres A, B, C et D, elle calcule (A+B), puis prend ce résultat et ajoute C, puis ajoute D. Elle ne fait pas (A+B) et (C+D) séparément pour ensuite les combiner.
L'expérience du « Pont »
Pour prouver que l'IA utilisait réellement ces notes cachées et ne se contentait pas de deviner, les chercheurs ont utilisé un tour astucieux. Ils ont construit un « pont » dans le mécanisme d'attention de l'IA. Imaginez que l'IA lit une longue phrase, et ils l'empêchent de regarder en arrière vers le début de la phrase, la forçant à ne regarder que la toute dernière chose qu'elle a lue.
Si l'IA se contentait de deviner en se basant sur l'ensemble de la phrase, ce blocage la briserait complètement. Mais l'IA pouvait toujours résoudre le problème mathématique si elle pouvait « voir » le pont (le signe plus le plus récent). Cela a prouvé que l'IA transportait le total progressif d'une étape à la suivante, tout comme un humain le ferait.
Ce qu'il faut retenir
Cet article suggée que lorsque les modèles d'IA géants font des mathématiques sans montrer leur raisonnement, ils font réellement le travail. Ils créent des « post-its » invisibles et internes qui retiennent le total progressif au fur et à mesure de leur lecture.
Cependant, il y a un bémol. Ces post-its ne sont pas parfaits. À mesure que la liste de nombres s'allonge, les notes deviennent un peu tachées, et l'IA commence à commettre des erreurs. Les chercheurs pensent que si nous parvenons à rendre ces notes internes plus claires et moins « avec perte », nous pourrions rendre l'IA bien meilleure dans les tâches de raisonnement complexe, et pas seulement en mathématiques.
Pour l'instant, nous savons que l'IA n'est pas magique ; elle est simplement très douée pour tenir un compte mental, même si ce compte devient parfois un peu flou à la fin d'une longue liste.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.