✨ 要約🔬 技術概要
あなたは、ロボットのための究極の脳を構築しようとしていると想像してみてください。過去10年間、私たちが作り上げてきた最も強力な脳は、「トランスフォーマー(Transformer)」と呼ばれる設計に基づいています。トランスフォーマーを、あらゆる本(知識の断片)が特定の階の特定の部屋に閉じ込められた、巨大な多層階の図書館だと考えてみてください。ある事実を見つけ出すために、ロボットは階段を上がり、必要なものが見つかるまで、あらゆる部屋にあるあらゆる本を一つずつ確認して回らなければなりません。これはうまく機能しますが、速度が遅く、ロボットは移動するたびに図書館全体を抱えて歩かなければなりません。科学者たちは、単に図書館を大きくし、本を増やすことでこれらの脳をより賢くしようとしてきましたが、壁に突き当たっています。つまり、ロボットの運用コストが高くなりすぎ、単純な答えを見つけるためだけに、言葉を出しすぎてしまうことがあるのです。今、大きな問いがあります。知識をすべて持ち運ぶ必要がなく、かつ、より速く、よりスマートに答えを見つけられるように、脳のデザイン自体を再設計できるでしょうか?
これこそが、上海人工知能研究所(Shanghai AI Laboratory)の Intern-S2-Mobius チームが、新しい論文で提案していることです。彼らは、脳を2つの明確な部分に分割することでこの問題を解決しようとする、Mobius という新しいアーキテクチャを紹介しています。Mobiusは、知識を多層階の建物の中の部屋に閉じ込めるのではなく、すべての知識を、すべてのワーカー(作業員)が即座にアクセスできる一つの巨大で共有されたデータベースに配置します。ワーカー(「リーズナー(推論者)」と呼ばれます)は、ただ本を読んで次に進むのではありません。彼らはウェアハウス(倉庫)に対して特定の事実を問いかけ、それについて考え、答えを洗練させるというプロセスを、言葉を発する前に連続的なループの中で何度も往復しながら行います。
この論文は、この「デカップリング(分離)」された設計がゲームチェンジャーになると示唆しています。実験において、彼らはMobiusモデルが、従来のトランスフォーマーと同等の学習能力を持ちながら、わずか 62.6% のトレーニングデータで学習できることを見出しました。さらに驚くべきことに、350億パラメータを持つ大規模なモデルをMobius設計にアップグレードしたところ、旧来のスタイルに追いつくだけでなく、回答の生成速度がほぼ 4倍 に向上しました。その秘訣は、Mobiusがロボットが思考している間に声に出して喋り続けるのを防ぐことにあります。長い、言葉数の多い思考の連鎖(例:「ステップ1、ステップ2、ステップ3...」)を生成する代わりに、Mobiusモデルは隠れた、静かな空間の中で重労働を行い、完璧で短い答えを吐き出す準備ができるまでアイデアを洗練させるのです。
しかし、著者たちは、これがまだすべてを解決する魔法の杖ではないことにも注意を払っています。彼らは、この設計が効率性と速度においては優れているものの、将来的に完璧に動作させるためには新しいハードウェアが必要になる可能性があり、また、自律的に「進化」できるか、あるいは連続的な物理世界をモデル化できるかについても、まだテスト段階にあると述べています。しかし現時点では、その結果は有望な道を示しています。すなわち、「知っていること」と「考え方」を切り離すことで、私たちは、驚くほど知的で、かつ驚くほど効率的なAIをようやく構築できるかもしれないということです。
技術要約: Intern-S2-Mobius: 知識と推論を分離した基盤モデル
1. 問題提起
基盤モデルの開発は、現在二重のボトルネックに直面している。第一に、既存の**スケーリング則(Scaling Law)**が収穫逓減の局面に近づいていることである。単にモデルパラメータ、学習データ、または推論チェーンの長さを増やすだけでは、指数関数的に高いコストを要する一方で、得られる能力向上は次第に小さくなっている。第二に、長い思考の連鎖(Chain of Thought: CoT)は数学やコードなどの領域で性能を向上させたものの、多くの場合、冗長で過剰な出力を招き、推論効率を低下させている。
逆に、効率性を高めるためにアーキテクチャの複雑さを削減しようとする試み(線形アテンションやSSMなど)は、しばしば大幅な能力低下を伴い、商用展開には不向きとなっている。特定された核心的な問題は、トランスフォーマーの階層的かつ一方向的な構造内において、知識の蓄積(フィードフォワードネットワーク:FFN)と推論演算子(自己アテンション:Self-Attention)が密結合している ことである。この結合により、モデルは深い層の知識にアクセスするために、トークンを介した反復的な生成に依存せざるを得なくなり、計算の非効率性とトークンの過剰な冗長性を引き起こしている。
2. 手法: Mobius アーキテクチャ
これらの制限に対処するため、著者らは知識と推論を分離するアーキテクチャであるMobius を提案する。この設計は、主に2つの革新に基づいている。
2.1. 知識と推論の分離
FFNが特定の層に拘束されているトランスフォーマーとは異なり、Mobiusは以下を導入する:
グローバル共有メモリ (FFN): すべての層で共有される、単一の巨大な知識ベクトルデータベース。これは、知識ベクトルの水平方向の連結(および、より大規模なMoEに類似したブロック単位の分割)によって構築される。これは知識ベクトルのリポジトリとして機能する。
複数の推論器 (Self-Attention): 共有メモリに対して反復的にクエリを実行する複数の自己アテンション・モジュール。
メカニズム: 推論器は隠れ状態をキャッシュおよびキャリアとして使用し、必要な知識ベクトルを繰り返しメモリに照会する。知識は推論演算子へと伝達され、これにより、トランスフォーマーのような厳格な層ごとの制約を受けることなく、構成的な推論が可能となる。
2.2. 本来備わったアーキテクチャ上の才能
この分離により、2つの特定の能力が可能になる:
後方残差接続 (Backward Residual Connection): 標準的なトランスフォーマーでは、残差接続は一方向的(浅い層から深い層へ)である。Mobiusの共有メモリは、フォワードプロパゲーション中に、深い層が浅い層の知識にアクセスすること(およびその逆)を可能にする。これは、すべての層に同一のグローバル・リポジトリへのアクセス権を与えることで間接的に実現され、構成的な汎化性能を高め、情報の合成を加速させる。
動的な潜在的推論 (Dynamic Latent Reasoning): Mobiusは、離散的なトークンではなく、連続的なベクトルの最適化の中に、熟考、試行錯誤、および洗練を内在化させる。
より高いループ頻度: 従来の潜在的推論と比較して、より少ない層数の中で反復が行われる。
高密度潜在表現: モデルは、コンパクトで連続的なベクトルを介して、複数のトークンの結合表現を同時に獲得する。
動的な割り当て: 計算予算は異なるトークンに対して動的に割り当てられ、高情報密度の潜在表現を洗練させた後、モデルは一度のバーストで複数のトークンをデコードできる。
2.3. 実装の詳細
知識リポジトリの構築: FFNは、知識ベクトルの水平方向の連結によって構築される。パラメータ規模と活性化効率を管理するため、著者らは、フォワードプロパゲーション中のスパースな活性化を伴う、ブロック単位の分割手法(MoEに類似)を採用している。
学習戦略: 著者らは、以下の2つの経路でMobiusを評価した:
スクラッチからの学習 (Training-from-Scratch: TFS): 1TBのトークンを用いて学習された7Bモデル。
継続的事前学習 (Continual Pre-Training: CPT): Qwen3.5-35Bのチェックポイントから開始し、1TBのトークンで継続的な事前学習を行い、続いて教師あり微調整(SFT)および強化学習(RL)を行う。
3. 主な結果
3.1. データ効率 (スクラッチからの学習)
スクラッチで学習された7BのMobiusモデルは、7Bのトランスフォーマー・ベースラインと同等のMMLUスコアを達成した。
極めて重要なことに、Mobiusはトランスフォーマー・ベースラインが必要とする学習データのわずか**62.6%**のデータのみを使用してこの性能に到達しており、1.6倍のデータ効率向上 を示した。
3.2. 推論効率と性能 (継続的事前学習)
性能の同等性: 継続的に事前学習されたIntern-S2-Mobius-35Bは、一般的および科学的なベンチマーク(例:MMLU Pro, GPQA Diamond, IMO Bench, AIME 2026)において、Qwen3.5-35Bベースラインと同等または優れたダウンストリーム・スコアを達成した。
推論の高速化: Intern-S2-Mobiusは、同等のパラメータ数を持つトランスフォーマー・ベースラインと比較して、エンドツーエンドで約4倍の推論高速化 を実現した。
出力長の短縮: この高速化は、主に推論チェーンの大幅な短縮によるものである。様々なベンチマークにおいて、Mobiusはトランスフォーマー・ベースラインよりも平均して1.2倍から5.0倍少ないトークン を生成した(例:MMLU Proでは4.6倍短い)。
トークン効率: 線形代数の問題におけるステップ整合比較において、Mobiusは、トランスフォーマーが2,364トークンを必要としたのに対し、516トークンで同じ推論ステップを完了した。これは主に、繰り返しの導出や冗長なチェックを排除したことによるものである。
4. 意義と主張
本論文は、MobiusがAIのスケーリングに対する代替経路を提示していると主張している。すなわち、アーキテクチャの複雑さを高めることで、モデルの知能の天井を引き上げ、それによってエンドツーエンドのオーバーヘッドを削減する という道である。
密度による効率化: トークンベースの推論から潜在ベースの高密度推論へと移行することで、Mobiusは能力を犠牲にすることなく、大幅な効率向上を実現している。
双方向の知識アクセス: 共有メモリを介した「後方残差接続」の導入は、トランスフォーマーの単方向的な情報フローの制限を解決し、より柔軟で効率的な知識検索を可能にする。
将来の可能性: 著者らは、知識と推論の分離が、以下をサポートする予備的な特性を提供すると述べている:
自己進化システム: モデルが以前の知識の破滅的忘却を起こすことなく新しいスキルを獲得することを可能にする(ただし、基盤モデル、エージェントシステム、および環境フィードバックの共同設計が必要である)。
世界モデル (World Models): トランスフォーマーと比較して、連続空間の入力をモデリングするためのより強力な事前知識を提供する(ただし、潜在的推論の事前知識は「極めて不十分である可能性があり」、アテンション・メカニズムの再設計が必要となる)。
科学的発見: 知識の構成と汎化を促進して破壊的な仮説を生成する(ただし、現実世界の性能には、データ、インフラストラクチャ、およびアルゴリズムの共同最適化が必要である)。
ハードウェア・ソフトウェアの協調設計: 推論パラメータはGPUメモリに配置し、知識パラメータはSSDに保存してオンデマンドでロードするというデプロイ戦略の可能性を開く(ただし、著者らはこのビジョンは「まだ実現されていない」ものであり、「多大な努力」を要すると述べている)。
結論として、Mobiusは効率性と能力において有望な結果を示しているものの、現実世界のシナリオ(自己進化、世界モデリング、科学的発見)におけるその真のポテンシャルを引き出すには、データ、インフラストラクチャ、および学習アルゴリズムのさらなる共同最適化が必要であるとしている。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×