MiMo-Embodied: X-Embodied Foundation Model Technical Report
本論文は、多段階学習、精選されたデータ、および CoT/RL 微調整を活用して自動運転と具現化 AI の間で強力な正の転移を示し、両分野で最先端のパフォーマンスを達成する初のオープンソースのクロス・エンボディメント基盤モデルである MiMo-Embodied を紹介する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
教室に、非常に異なる 2 人の生徒がいると想像してください。
- 生徒 A はロボット執事です。彼らは散らかった台所を移動すること、コップのどの部分を掴めるか判断すること、シワにならずにシャツを畳む方法を計画することに長けています。彼らは「具現化 AI(部屋の中の物体と相互作用する AI)」の専門家です。
- 生徒 B は自動運転車です。彼らは道路を監視し、歩行者が横断歩道を渡らないで渡るかどうかを予測し、混雑する交差点でブレーキをかけるか左折するかを決定することに長けています。彼らは「自動運転」の専門家です。
通常、学校ではこれらの生徒を別々に教えています。ロボット執事は運転の仕方を知らず、自動運転車はスプーンを掴む仕方を知らないのです。
MiMo-Embodied の登場です。
この論文は、小米(Xiaomi)によって作成された新しい「スーパー生徒」を紹介しています。これは、ロボット執事と自動運転車の両方の頭脳を単一のパッケージに成功裏に統合した、初のオープンソースモデルです。ワインの瓶を開けることと高速道路を走行することの両方で同等に優れている、まさに万能ナイフのようなものです。
このスーパー生徒はどのように作られたのでしょうか?
研究者たちは単に 2 つを混ぜ合わせただけではありません。生徒が混乱することなくすべてを学べるように、4 段階のトレーニングレシピを使用しました。
- ステップ 1:「部屋」のクラス:まず、モデルに部屋、物体、そして家の中を移動する方法についてすべて教えました。ロボットが物を掴んだり、3 次元空間内で物体の位置を理解したりするデータを使用しました。
- ステップ 2:「道路」のクラス:次に、同じ生徒を運転シミュレーターに入れました。信号機、他の車、そして前方のトラックがどのように行動するかを予測する方法について教えました。
- ステップ 3:「声に出して考える」クラス:これが秘密の武器です。単に答えを与えるのではなく、モデルに声に出して考える(思考の連鎖)ように教えました。「左折する」と言う前に、「赤信号が見えるので止まらなければならない。車が曲がっているのが見えるので待たなければならない」と言うように学習させます。これにより、モデルはなぜその決定を下しているのかを理解するようになります。
- ステップ 4:「コーチ」クラス:最後に、強化学習技術(コーチが良いプレーにはポイントを与え、悪いプレーにはペナルティを与えるようなもの)を使用しました。これによりモデルをさらに精密に微調整し、単に推測するのではなく、最も安全で論理的な動きを計算するようにしました。
このスーパー生徒は何ができるのでしょうか?
この論文は、MiMo-Embodied を29 種類の異なる課題(ベンチマーク)でテストし、専門的なロボットや専門的な自動車、そして大手の商用 AI モデルの両方を凌駕し、ほぼすべての課題で最高性能を発揮したことを発見しました。
「ロボット執事」の世界(具現化 AI)において:
- アフォードアンス予測:椅子の写真を示すと、単に「椅子」と見ているだけではありません。「座れるもの」や「腕掛けを掴めるもの」として見ています。物体を掴むためにどこを触ればよいかを正確に知っています。
- タスク計画:「お腹が空いたからおやつを持ってきて」と言うと、それを分解できます。「台所へ行く -> 冷蔵庫を開ける -> リンゴを見つける -> ここへ持ってくる」。
- 空間理解:「窓」は遠く、「テーブル」は近く、「猫」は椅子の下にあることを知っています。物にぶつかることなく部屋を移動できます。
「自動運転車」の世界(自動運転)において:
- 環境知覚:混沌とした街の風景を見て、赤い信号機、歩道から降りる歩行者、路肩に駐車しているトラックを瞬時に検出できます。
- 状態予測:他のドライバーが何を考えているかを推測できます。「あの車は減速している。おそらく曲がりたいのだろう」「あの歩行者は待っている。横断しようとしている」。
- 運転計画:単に運転するだけでなく、安全に運転します。スムーズな車線変更や穏やかな停止を計画し、人間ドライバーのようにその理由を説明できます。
大きな発見:「クロストレーニング」が機能する
この論文で最も興奮すべき部分は、一つのスキルを学ぶことがもう一つのスキルを助けるという発見です。
通常、運転データで訓練されたモデルはコップを掴む方法を忘れ、ロボットで訓練されたモデルは運転する方法を忘れると考えられていました。しかし、MiMo-Embodied は、これらのスキルが実際には互いに強化し合うことを証明しました。
- 車がどこへ向かうかを予測することを学ぶことは、モデルが部屋の中で物体がどのように動くかを理解するのに役立ちます。
- 取っ手を掴む方法を考えることを学ぶことは、モデルがステアリングホイールの物理的な制約を理解するのに役立ちます。
結論
MiMo-Embodied は、物理的な機械のための汎用脳として機能する「基盤モデル」です。その機械がロボット掃除機であれ、ヒューマノイドロボットであれ、自動運転車であれ、この単一のモデルは世界を理解し、行動を計画し、それを安全に実行することができます。
この論文は、これが「屋内ロボット」と「屋外自動車」の間の壁を崩し、単一の統合された AI が物理世界全体の複雑さを処理できることを示すため、大きな前進であると主張しています。彼らはさらに、コードとモデルを誰でも使用して研究できるように公開しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。