Intern-S2-Preview: Scientific Agentic Foundation Model
Le document présente Intern-S2-Preview, une série de modèles de fondation agentiques scientifiques entraînés via un pipeline spécialisé de pré-entraînement multimodal et de post-entraînement unifié, caractérisé par un apprentissage par renforcement avancé et des architectures à mémoire augmentée, afin d'atteindre des performances de pointe en matière de raisonnement scientifique, d'interaction avec des outils et de tâches à long horizon.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez d'apprendre à un robot à être un scientifique. Par le passé, nous donnions aux robots de vastes bibliothèques de textes et leur demandions de répondre à des questions comme des candidats à un jeu télévisé. Mais la vraie science n'est pas un quiz ; c'est une aventure longue et désordonnée. Elle implique d'observer des images étranges de cellules, de lire des graphiques qui ondulent comme des battements de cœur, d'utiliser des outils informatiques pour mener des expériences, et de réfléchir à un problème pendant des heures sans s'y perdre. Ce document traite de la construction d'un nouveau type de « super-cerveau » pour les robots qui ne se contente pas de mémoriser des faits, mais qui fait réellement de la science. Il est conçu pour comprendre des images complexes, prédire des chiffres futurs et agir comme un détective capable d'utiliser des outils pour résoudre des mystères sur une longue période. L'idée principale est que pour être un véritable assistant scientifique, une IA doit être capable de jongler avec différents types d'informations (comme le texte, les images et les chiffres) et continuer à travailler avec constance sur un problème difficile sans abandonner ou s'embrouiller.
L'équipe derrière ce projet, provenant du Shanghai AI Laboratory, présente une nouvelle famille de modèles d'IA appelée Intern-S2-Preview. Voyez ce modèle comme un « généraliste » scientifique massif de 397 milliards de paramètres qui a lu presque tous les articles scientifiques jamais écrits. Mais au lieu de simplement rester là à connaître des choses, ce modèle est construit pour agir. Il peut regarder un diagramme scientifique, comprendre l'histoire qui se cache derrière, puis utiliser des outils informatiques pour lancer des simulations ou écrire du code pour tester une hypothèse.
Voici comment ils ont construit ce super-scientifique :
D'abord, ils ont enseigné au modèle en lui montrant des millions de documents scientifiques, mais pas seulement du texte. Ils lui ont montré les pages réelles, avec toutes les images, les graphiques et les équations dans leur mise en page originale. C'est comme enseigner à un étudiant en lui tendant le manuel entier, incluant les diagrammes, plutôt que de simplement lui lire le texte à haute voix. Cela aide le modèle à comprendre comment les scientifiques présentent réellement leurs idées.
Ensuite, ils ont donné au modèle une compétence spéciale de « voyage dans le temps ». La plupart des modèles d'IA sont mauvais pour prédire ce qui se passe ensuite dans une séquence de nombres (comme les modèles météorologiques ou les cours de la bourse). Intern-S2-Preview a reçu une mise à niveau dédiée pour gérer ces données de « séries temporelles ». Il peut désormais regarder une longue ligne de chiffres et prévoir avec précision ce qui va se passer ensuite, ce qui est crucial pour des choses comme la prédiction du changement climatique ou l'analyse des signaux cérébraux.
L'un des trucs les plus cool qu'ils ont utilisés s'appelle le Décodeur de Mémoire (Memory Decoder). Imaginez que le cerveau principal de 397 milliards de paramètres est un brillant généraliste qui sait un peu tout sur tout. Mais et si vous avez besoin d'un expert dans un domaine minuscule, comme la biologie ? Au lieu de réentraîner tout le cerveau géant (ce qui serait lent et pourrait lui faire oublier d'autres choses), ils ont attaché un petit « carnet de notes » spécialisé appelé le Décodeur de Mémoire. Ce carnet contient des connaissances spécifiques en biologie. Lorsque l'IA doit répondre à une question de biologie, elle consulte ce carnet. Le résultat ? Les scores de biologie du modèle sont passés de 56,92 à 60,32, tandis que ses connaissances générales sont restées exactement les mêmes. C'est comme avoir un ami génie qui peut instantanément sortir un manuel spécialisé dès que vous posez une question spécifique, sans avoir besoin de retourner à l'école pour obtenir un nouveau diplôme.
L'équipe a également appris au modèle à être un agent à long horizon (long-horizon agent). Cela signifie que l'IA peut planifier une mission à plusieurs étapes. Au lieu de simplement répondre à « Quelle est la capitale de la France ? », on peut lui demander de « Concevoir un nouveau médicament ». Elle pourrait alors : 1) rechercher les recherches existantes, 2) écrire du code pour simuler le comportement du médicament, 3) lancer la simulation, 4) réaliser qu'elle a échoué, 5) ajuster le code, et 6) réessayer. Le document montre qu'en utilisant une méthode d'entraînement spéciale appelée « apprentissage par renforcement », le modèle a appris à gérer ces flux de travail longs et complexes sans rester bloqué ou commettre des erreurs stupides.
Lorsqu'ils ont testé Intern-S2-Preview-397B, il s'est révélé incroyablement performant. Sur des tests mesurant sa compréhension de la biologie, de la chimie et de la physique, il a battu de nombreux autres modèles de haut niveau. Il était particulièrement bon pour lire des graphiques scientifiques et prédire des données de séries temporelles, surpassant souvent des modèles beaucoup plus grands et spécialisés uniquement pour ces tâches. Par exemple, sur un test appelé Biology-Instructions, il a obtenu 56,92, et avec le Décodeur de Mémoire attaché, il est monté à 60,32. Sur des tests de raisonnement général comme MMLU-Pro, il a obtenu 89,75, ce qui est le meilleur score parmi les modèles open-source.
Cependant, les auteurs prennent soin de préciser qu'il s'agit d'une « Preview » (aperçu). C'est un nouvel outil puissant, mais il n'est pas encore parfait. Ils notent que, bien que le modèle soit excellent pour connecter le raisonnement à l'action, il reste du travail pour le rendre encore plus fiable pour des flux de travail scientifiques très longs et complexes. Ils soulignent également que ce modèle est une fondation — un point de départ qui peut être adapté avec différents « carnets de mémoire » pour différents domaines scientifiques sans avoir besoin de reconstruire tout le cerveau.
En résumé, ce document présente un nouveau type d'IA qui est prête à dépasser le simple stade de la réponse aux questions pour commencer à accomplir le travail réel de la découverte scientifique, de la lecture de graphiques complexes à la conduite de longues expériences, tout en gardant ses connaissances générales intactes et ses compétences spécialisées aiguisées.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.