Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
L'article présente Intern-S2-Mobius, une architecture de modèle de fondation qui découple le stockage des connaissances dans un module de mémoire partagée du raisonnement compositionnel itératif dans des raisonneurs dédiés, atteignant des performances comparables aux modèles de référence Transformer avec une quantité de données d'entraînement nettement réduite et une vitesse d'inférence presque 4 fois plus rapide.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayiez de construire le cerveau ultime pour un robot. Depuis une décennie, les cerveaux les plus puissants que nous avons construits sont basés sur un concept appelé « Transformer ». Considérez un Transformer comme une immense bibliothèque à plusieurs étages où chaque livre (chaque fragment de connaissance) est enfermé dans une pièce spécifique à un étage précis. Pour trouver un fait, le robot doit monter les escaliers, pièce par pièce, en vérifiant chaque livre dans chaque pièce jusqu'à ce qu'il trouve ce dont il a besoin. Cela fonctionne bien, mais c'est lent, et le robot doit transporter toute la bibliothèque avec lui à chaque fois qu'il se déplace. Les scientifiques essaient de rendre ces cerveaux plus intelligents en agrandissant simplement les bibliothèques et en ajoutant plus de livres, mais ils se heurtent à un mur : les robots deviennent trop coûteux à faire fonctionner, et ils s'arrêtent parfois pour parler trop longtemps juste pour trouver une réponse simple. La grande question est maintenant la suivante : pouvons-nous redessiner le cerveau lui-même pour qu'il n'ait pas à transporter toute la bibliothèque, tout en étant capable de trouver des réponses plus rapidement et plus intelligemment ?
C'est exactement ce que l'équipe Intern-S2-Mobius du Shanghai AI Laboratory propose avec leur nouvel article. Ils introduisent une nouvelle architecture appelée Mobius, qui tente de résoudre le problème en divisant le cerveau en deux parties distinctes : un immense « Entrepôt de Connaissances » partagé et une équipe d'« Ouvriers du Raisonnement ». Au lieu de verrouiller la connaissance à l'intérieur des pièces d'un bâtiment à plusieurs étages, Mobius place toute la connaissance dans une base de données massive et partagée, accessible instantanément par chaque travailleur. Les travailleurs (appelés Raisonneurs) ne se contentent pas de lire un livre et de passer à la suite ; ils peuvent faire des allers-retours, interroger l'entrepôt pour des faits spécifiques, réfléchir à ces faits et affiner leur réponse dans une boucle continue avant même de prononcer un seul mot.
L'article suggère que cette conception « découplée » change la donne. Dans leurs expériences, ils ont découvert qu'un modèle Mobius pouvait apprendre aussi bien qu'un Transformer traditionnel, mais en utilisant seulement 62,6 % des données d'entraînement. Plus impressionnant encore, lorsqu'ils ont mis à niveau un modèle massif de 35 milliards de paramètres pour utiliser la conception Mobius, celui-ci ne s'est pas contenté de suivre l'ancien style ; il est devenu près de 4 fois plus rapide pour donner des réponses. L'ingrédient secret semble être que Mobius empêche le robot de bavarder à voix haute pendant qu'il réfléchit. Au lieu de générer une chaîne de pensée longue et verbeuse (comme « Étape 1, Étape 2, Étape 3... »), le modèle Mobius effectue son travail intensif dans un espace caché et silencieux, affinant ses idées jusqu'à ce qu'il soit prêt à recracher une réponse courte et parfaite.
Cependant, les auteurs précisent avec prudence qu'il ne s'agit pas encore d'une baguette magique qui résout tout. Ils suggèrent que, bien que cette conception soit excellente pour l'efficacité et la vitesse, elle pourrait nécessiter un nouveau matériel pour fonctionner parfaitement à l'avenir, et elle est encore en cours de test pour voir si elle peut véritablement « évoluer » de manière autonome ou modéliser le monde physique continu. Mais pour l'instant, les résultats montrent une voie prometteuse : en séparant ce que nous savons de la manière dont nous pensons, nous pourrions enfin construire une IA qui soit à la fois incroyablement intelligente et étonnamment efficace.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.