Intern-S2-Preview: Scientific Agentic Foundation Model
本論文は、高度な強化学習とメモリ拡張アーキテクチャを特徴とする特化したマルチモーダル事前学習および統一された事後学習パイプラインを通じて訓練され、科学的推論、ツール操作、および長期間のタスクにおいて最先端の性能を達成する一連の科学的エージェント基盤モデルであるIntern-S2-Previewを紹介する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに科学者になってもらう方法を教えていると想像してみてください。かつて、私たちはロボットに膨大なテキストのライブラリを与え、クイズ番組の出場者のように質問に答えるよう求めてきました。しかし、本当の科学はクイズではありません。それは、混沌とした、長い冒険なのです。それは、細胞の奇妙な画像を見たり、心拍のように揺れ動くグラフを読んだり、実験を行うためにコンピュータツールを使用したり、迷うことなく数時間問題を考え抜いたりすることを伴います。この論文は、単に事実を暗記するのではなく、実際に「科学を行う」ための、ロボットのための新しい種類の「スーパーブレイン」を構築することについて書かれています。これは、複雑な画像を理解し、将来の数値を予測し、謎を解くためにツールを使いこなすことができる探偵のように振る舞うように設計されています。大きなアイデアは、真の科学的アシスタントになるためには、AIが異なる種類の情報(テキスト、画像、数値など)を操り、諦めたり混乱したりすることなく、困難な問題に対して着実に作業を続ける必要があるということです。
このプロジェクトの背後にいるチーム(上海人工知能研究所)は、Intern-S2-Previewと呼ばれる新しいAIモデルのファミリーを紹介しています。このモデルを、ほぼすべての科学論文を読んできた、3,970億パラメータを持つ巨大な「ジェネラリスト」の科学者だと考えてください。しかし、このモデルはただ知識を持っているだけでなく、行動するために構築されています。科学的な図解を見て、その背後にあるストーリーを理解し、仮説を検証するためにシミュレーションを実行したりコードを書いたりするためのコンピュータツールを使用することができます。
彼らがどのようにしてこのスーパー科学者を構築したかを説明します。
まず、彼らはモデルに対し、単なるテキストではなく、何百万もの科学文書を見せることで学習させました。それらは、図、チャート、数式が元のレイアウト通りに含まれた実際のページです。これは、テキストを読み上げるのではなく、図解を含む教科書全体を学生に手渡して教えるようなものです。これにより、モデルは科学者が実際にどのようにアイデアを提示するかを理解できるようになります。
次に、彼らはモデルに特別な「タイムトラベル」のスキルを与えました。ほとんどのAIモデルは、数値のシーケンス(天候パターンや株価など)の次に何が起こるかを予測するのが苦手です。Intern-S2-Previewは、これらの「時系列」データを扱うための専用のアップグレードを受けました。これにより、モデルは長い数値の列を見て、次に何が起こるかを正確に予測できるようになりました。これは、気候変動の予測や脳信号の分析において極めて重要です。
彼らが使った最もクールなトリックの一つは、**メモリーデコーダー(Memory Decoder)**と呼ばれるものです。メインの3,970億パラメータの脳を、あらゆることを少しずつ知っている博識なジェネラリストだと想像してください。では、もし生物学のような非常に小さな分野の専門家が必要になったらどうでしょう?巨大な脳全体を再学習させる(それは時間がかかる上に、他のことを忘れてしまう可能性がある)代わりに、彼らは「メモリーデコーダー」と呼ばれる小さな専門的な「ノート」を取り付けました。このノートには特定の生物学の知識が保持されています。AIが生物学の質問に答える必要があるとき、モデルはこのノートを参照します。その結果、モデルの生物学のスコアは56.92から60.32へと跳ね上がりましたが、一般的な知識は全く変わりませんでした。これは、まるで天才的な友人が、新しい学位を取るために学校に通う必要もなく、特定の質問をされた瞬間に専門的なマニュアルを取り出すようなものです。
チームはまた、モデルに**ロングホライゾン・エージェント(long-horizon agent)**としての方法も教えました。これは、AIが多段階のミッションを計画できることを意味します。単に「フランスの首都は何ですか?」と答えるのではなく、「新しい薬を設計せよ」と命じられた場合、モデルは次のような行動をとります:1) 既存の研究を検索する、2) 薬の挙動をシミュレートするためのコードを書く、3) シミュレーションを実行する、4) 失敗したことに気づく、5) コードを調整する、6) 再試行する。論文では、「強化学習」と呼ばれる特別なトレーニング手法を用いることで、モデルが迷ったり愚かな間違いをしたりすることなく、これらの長く複雑なワークフローを処理することを学んだことが示されています。
Intern-S2-Preview-397Bをテストした際、それは驚異的な成果を上げました。生物学、化学、物理学の理解度を測るテストにおいて、多くのトップモデルを打ち負かしました。特に科学的なチャートの読み取りや時系列データの予測に優れており、より大規模なモデルや、それらのタスクに特化したモデルをも凌駕することがよくありました。例えば、Biology-Instructionsというテストでは56.92を記録し、メモリーデコーダーを装着することで60.32に向上しました。MMLU-Proのような一般的な推論テストでは89.75を記録し、これはオープンソースモデルの中で最高値です。
しかし、著者たちはこれを「プレビュー(試作品)」と呼ぶことに慎重です。これは強力な新しいツールですが、まだ完璧ではありません。彼らは、モデルが推論と行動を結びつけることには長けているものの、非常に長く複雑な科学的ワークフローにおいて、さらに信頼性を高めるための作業が残されていると指摘しています。また、このモデルは「基盤」であり、脳全体を再構築することなく、異なる科学分野に合わせて異なる「メモリ・ノートブック」を適応させることができる出発点であることを強調しています。
要約すると、この論文は、単に質問に答えることを超えて、複雑なグラフの読み取りから長期的な実験の実行に至るまで、一般的な知識を維持しながら、実際の科学的発見の仕事を遂行する準備ができている、新しい種類のAIを提示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。