← 最新の論文
🤖 AI

Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interactio

本論文は、強力な汎用知能と特化した身体的インタラクション能力を統合することに成功した、マルチステージのポストトレーニング・パイプラインを活用する80億パラメータのオンデバイス・ロボットブレインであるAthena-Brain-8Bを紹介しており、これはより簡潔な応答を維持しつつ、汎用的な推論性能においてより大規模なモデルと同等の性能を維持しながら、エンボディード(身体性)ベンチマークにおいてそれらを凌駕するものである。

原著者: Jialian Li, Junhong Liu, Yuchen Cao, Weiran Guo, Jiaming Song, Xutao Wang, Yi Zhao, Jiangpin Liu, Jie Chen

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Jialian Li, Junhong Liu, Yuchen Cao, Weiran Guo, Jiaming Song, Xutao Wang, Yi Zhao, Jiangpin Liu, Jie Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが単なる「もし〜ならば、〜する」という厳格な命令に従うだけの無骨な機械ではなく、散らかった部屋を理解し、計画を立て、作業しながらあなたと会話できる賢い相棒になれる世界を想像してみてください。これは「エンボディド・インテリジェンス(身体化された知能)」の夢、つまりロボットに現実世界で考え、行動できる脳を与えるという夢です。長い間、科学者たちは難しい選択を迫られてきました。あらゆることを知っているが、ロボットに搭載するには遅くて重すぎる巨大で超スマートな脳を使うか、あるいは、素早く動けるが複雑な指示を理解するにはあまりに愚かな、小さくて高速な脳を使うかという選択です。それは、一ページを探すのに1時間かかる図書館の蔵書を選ぶのか、それとも手の中に収まるが数行のメモしか書かれていないポケットノートを選ぶのか、というようなものでした。大きな問いはこうでした。デバイスに収まるほど小さく、人間のように推論できるほど賢く、そしてリアルタイムの会話についていけるほど速い「ロボットの脳」を作れるのだろうか?

そこで登場したのが、XPENG Roboticsが開発した新しい「ロボットの脳」、Athena-Brain-8Bです。これは、巨大なクラウドサーバーに頼るのではなく、ロボット自身のコンピュータ上で動作するように設計された、コンパクトな80億パラメータの言語モデル(AIの一種で、テキストを理解し生成するもの)だと考えてください。研究者たちは単に巨大なモデルを縮小したわけではありません。特別なトレーニングのレシピを用いて、ゼロから新しいモデルを構築しました。彼らはまずスマートなベースとなるモデルから始め、効率的に推論する方法を教え、次に「エンボディド(身体化)」スキルを叩き込みました。つまり、仮想の美術館やスーパーマーケットをナビゲートし、アイテムを拾い上げ、ステップバイステップで問題を解決する方法を学ばせたのです。その結果はどうでしょうか? このモデルは、より大規模で低速なモデルと同等の複雑な推論タスクをこなすことができますが、それをはるかに少ない言葉数で、かつ遥かに速く実行できるのです。これは、スマートなロボットを持つためにスーパーコンピュータは必要ではなく、小さな脳を最大限に働かせ、かつ高速に機能させるための「正しい種類のトレーニング」が必要であることを証明しています。

問題点:ロボットの脳の「大きすぎる」対「小さすぎる」

あなたがロボットの執事を作りたいと考えているとしましょう。その脳には2つの選択肢があります。オプションAは、巨大なスーパーコンピュータの脳です。驚くほど賢く、インターネット上のあらゆる知識を持ち、複雑な数学の問題も解けます。しかし、あまりに重くて遅いため、壁のコンセントに接続されている必要があり、「鍵はどこ?」といった単純な質問に答えるのにも長い時間がかかります。オプション Bは、小さくて軽量な脳です。高速でロボットの頭部に収まりますが、あまり賢くありません。混雑した店の中を通り抜けるルートを計画したり、蛇口の修理方法を考えたりすると、混乱してしまうかもしれません。

長い間、科学者たちはどちらか一方を選ばなければならないと考えてきました。動けないスマートなロボットか、考えることができない速いロボットか、のどちらかです。しかし、Athena-Brain-8Bの開発チームはこう問いかけました。「もし、小さな脳に『賢さ』と『速さ』の両方を教えることができたらどうだろうか?」

解決策:4段階のトレーニングキャンプ

研究者たちは単に推測したのではなく、ロボットの脳のための「4段階のブートキャンプ」のような、特定のトレーニング・パイプラインを構築しました。

ステップ1:一般知識の基盤(General SFT)
まず、標準的でスマートな言語モデル(「ベース」モデル)を取り上げ、膨大な量の宿題を与えました。これは単に事実を暗記させることではなく、指示に従う方法、数学の問題を解く方法、コードを書く方法、そして世界を理解する方法を学ぶためのものです。これは、ロボットを普通の学校に送り込み、一般科目のしっかりとした教育を受けさせるようなものだと考えてください。

ステップ2:簡潔さを学ぶ(General Reinforcement Learning)
ここからが非常に興味深いところです。チームは、スマートなロボットは喋りすぎる傾向があることに気づきました。もしあなたがロボットに鍵を探すよう頼んだとき、ロボットが「見つけました」と言う前に500語もの思考を声に出してしまったら、実世界のロボットとしては遅すぎます。そこで、彼らは「強化学習」と呼ばれる手法を用いました。正解に対してだけでなく、「最も短い正解」に対しても金メダルを与える先生を想像してください。ロボットは、問題を正しく解くだけでなく、より少ない言葉を使うことで報酬を与えられました。これにより、脳は効率的になることを学び、「無駄な言葉」を削ぎ落とし、核心に直結するようになりました。

ステップ3:「現実世界」のシミュレーション(Embodied Expert Training)
これで脳は賢く、効率的になりましたが、まだ実際に「何かをした」ことはありません。博物館が何であるかは知っていますが、その中をどう歩くかは知りません。研究者は、美術館スーパーマーケットという2つの仮想世界を作成しました。

  • 美術館では、ロボットは訪問者を恐竜の化石へと案内しなければなりません。看板を読み、曲がる方向を決め、正しい場所にいるかどうかを確認する必要があります。
  • スーパーマーケットでは、牛乳のボトルを見つけ、カートに入れ、会計を済ませなければなりません。
    ロボットはこれらのタスクについて単に読むだけでなく、何度も練習しました。もしボトルを掴もうとして失敗したら、諦めるのではなく、別の角度から試すべきであることを学びました。ルートを計画し、ミスに対処し、継続する方法を学んだのです。これは、ロボットが物理的な環境(たとえそれがシミュレーションであっても)と相互作用する方法を学んでいるため、「エンボディド(身体化)」トレーニングと呼ばれます。

ステップ4:脳の統合(Model Merge)
これらすべてのトレーニングの後、研究者たちはいくつかの異なるバージョンの脳を手にしました。一般知識に優れたもの、簡潔さに優れたもの、そして美術館やスーパーマーケットのナビゲーションに優れたものです。彼らはどれか一つを選ぶのではなく、特別な数学的トリックを使って、これらすべてを一つの「スーパー脳」へと「マージ(統合)」しました。これは、学者、速読家、そして探検家の最高の特性を取り出し、その3つすべてを完璧にこなせる一人の人物へと組み合わせるようなものです。

分かったこと:小さくとも強力であること

結果は目覚ましいものでした。Athena-Brain-8Bをテストした際、このモデルは一般的な推論タスク(数学や論理など)において、より大規模で低速なモデルと同等の能力を発揮できることが分かりました。しかし、本当の魔法はそのスピードと効率性にありました。

  • 言葉が少ない: 長々と「思考」を声に出す他のスマートなモデルと比較して、Athena-Brain-8Bは大幅に短い回答を生成しました。時間を浪費してとりとめもなく話すのではなく、即座に行動に移りました。
  • 行動が優れている: 仮想の美術館やスーパーマーケットにおいて、Athena-Brain-8Bは他の小型ロボットよりもはるかに優れたタスク完了率を示しました。実際、そのパフォーマンスは、より大きく強力な高価な巨大モデルをも凌駕するほどでした。
  • 効率的である: チームは、モデルが仕事を遂行するために使用した「トークン(言葉の塊)」の数を測定しました。Athena-Brain-8Bは、最高スコアを得るために最も少ないトークンを使用しました。これは、単にスマートであるだけでなく、エネルギー効率が高いことを意味します。これは、バッテリーで動くロボットにとって極めて重要です。

なぜこれが重要なのか

この論文は、スマートなロボットを持つために、巨大でクラウドに依存した脳を構築する必要はないということを示唆しています。コンパクトなモデルを効率的に訓練し、現実的でインタラクティブな環境で練習させることで、デバイス自体に搭載できる「ロボットの脳」を作ることができるのです。これにより、ロボットはより速く、より応答性が高く、インターネット接続が遅い場所や存在しない場所でも作業できるようになります。

研究者たちは、80億パラメータという小さなモデルが、汎用的な能力(多くのことに精通していること)と専門的な能力(動きや行動に長けていること)を同時に学習できることを示しました。彼らは単に話せるロボットを作ったのではありません。次に何をすべきかを考え、それを迅速に実行できるロボットを作ったのです。未来のロボティクスは、より大きな脳を作ることではなく、小さな脳がいかに効率的に機能するかを教えることにあるのかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →