Are Arithmetic Heuristic Neurons Form-Invariant? A Mechanistic Analysis of Symbols, Text, and Code in LLMs
Cet article démontre que le calcul arithmétique dans les LLM repose sur un ensemble partagé et invariant en forme de « neurones heuristiques » à travers les formats symboliques, le langage naturel et le code, révélant que les échecs interformats découlent d'états d'activation plutôt que de circuits internes distincts.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez d'apprendre les mathématiques à un robot super intelligent. Vous pourriez penser que si le robot apprend à additionner des nombres en utilisant une équation simple comme « 4 + 5 = 9 », il saurait automatiquement résoudre le même problème si vous lui racontiez une histoire (« Tom a 4 pommes, Alice lui en donne 5... ») ou si vous lui demandiez d'écrire un programme informatique pour le faire. Mais voici le revers de la médaille : ces robots, connus sous le nom de grands modèles de langage (LLM), sont étonnamment capricieux. Ils peuvent trouver la bonne réponse dans une histoire, mais échouer lamentablement lorsqu'on leur demande le code, même si le calcul est exactement le même. Ce n'est pas seulement un bug ; c'est un mystère sur la façon dont ces modèles « réfléchissent » à l'intérieur de leurs cerveaux numériques.
Pour comprendre cela, nous devons regarder sous le capot. Ne voyez pas un LLM comme un seul cerveau géant, mais comme une immense ville de petits travailleurs appelés « neurones ». Lorsqu'un modèle résout un problème, des groupes spécifiques de ces travailleurs s'activent pour effectuer le travail de force. Les scientifiques appellent cela l'« interprétabilité mécaniste » — concrètement, l'ingénierie inverse de la machine pour voir quels engrenages spécifiques tournent pour la faire fonctionner. La grande question que les chercheurs se posent est la suivante : lorsque le robot passe du calcul avec des symboles au calcul avec des mots ou du code, recrute-t-il une toute nouvelle équipe de travailleurs ? Ou est-ce la même équipe de travailleurs, qui est simplement confuse parce que les instructions semblent différentes ?
Cet article s'efforce de résoudre ce mystère en traitant le cerveau du robot comme une affaire de détective. Les chercheurs ont pris trois versions différentes du même problème mathématique — l'une écrite sous forme d'équation standard, l'une sous forme de programme informatique Python et l'une sous forme de problème textuel en langage naturel — et ont observé quels neurones s'activaient dans trois modèles Llama-3 différents. Ils ont découvert que le robot n'utilise pas d'équipes différentes pour les différents formats. Au lieu de cela, il existe une petite « équipe de base » compacte d'environ 50 à 100 neurones par couche qui effectue réellement le calcul, peu importe la manière dont vous posez la question.
Voici la partie la plus passionnante de leur découverte : lorsque le robot ne parvient pas à résoudre un problème dans un format (comme le code) mais réussit dans un autre (comme un problème textuel), ce n'est pas parce qu'il manque d'outils appropriés. C'est simplement parce que l'« équipe de base » ne reçoit pas le bon signal pour commencer à travailler. Les chercheurs l'ont prouvé en effectuant une « transplantation cérébrale » numérique. Ils ont pris les signaux d'activation de la session réussie du problème textuel et les ont collés sur la session de code ratée. Soudain, le robot qui était bloqué a commencé à résoudre le problème de code correctement plus de 97 % du temps pour l'addition et la soustraction !
Cela suggère que l'échec du robot n'est pas dû à un manque de connaissances ou à un circuit cassé ; c'est simplement une question de neurones étant dans la mauvaise humeur. L'étude montre que ces « neurones heuristiques arithmétiques » sont « invariants de forme », ce qui signifie qu'ils sont les mêmes travailleurs fiables, que les mathématiques soient présentées sous forme de symboles, d'histoires ou de code. Ils appartiennent systématiquement aux mêmes « familles » de stratégies, comme vérifier si les nombres se situent dans une certaine plage ou chercher des motifs spécifiques. Ainsi, bien que le robot puisse sembler confus par les différentes façons de poser la même question, son moteur mathématique interne est en réalité remarquablement cohérent et robuste, attendant seulement l'étincelle appropriée pour accomplir sa tâche.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.