← 最新の論文
💬 NLP

Beyond English: Uncovering the Multilingual Gap in Vision-Language-Action Models

本論文は、多言語対応の言語バックボーンを備えているにもかかわらず、非英語の指示を処理する際にVision-Language-Actionモデルに顕著な性能差が生じることを明らかにする初の系統的な研究を提示し、この問題を効果的に軽減するためのMultilingual Principal Component Alignmentファインチューニング戦略を提案するものである。

原著者: Hanyang Chen, Hongliang Li, Jiarui Cao, Yang Li, Yang Jiang, Haonan Wen, Kaiyu Huang, Shengnan Guo, Huaiyu Wan

公開日 2026-06-16
📖 1 分で読めます☕ さくっと読める

原著者: Hanyang Chen, Hongliang Li, Jiarui Cao, Yang Li, Yang Jiang, Haonan Wen, Kaiyu Huang, Shengnan Guo, Huaiyu Wan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ビッグアイデア: 「英語しか話せない」ロボット

あなたがロボットに料理を教えているところを想像してください。そこには、非常に賢いロボットの脳(Vision-Language-Actionモデル、またはVLA)があります。この脳はキッチンを見ることができ、あなたの言葉を理解し、スプーンを掴んだりストーブのスイッチを入れたりするために腕を動かすことができます。

研究者たちは、重大な問題を発見しました。これらのロボットの多くは、英語だけで勉強した学生のような状態であるということです。たとえロボットの「脳」(基礎となる言語モデル)がフランス語、中国語、あるいはアラビア語を知っていたとしても、ロボット自身はその言語に基づいて「行動する」方法を知りません。

英語でコマンド(例:「Pick up the cup(コップを手に取って)」)を与えると、完璧に動作します。しかし、全く同じことをフランス語("Prends la tasse")で言った途端、ロボットはしばしばフリーズしたり、混乱したり、あるいは間違った物体を掴んだりします。まるで、言語を変えただけで、ロボットが突然手の動かし方を忘れてしまったかのようです。

実験: ロボットの「耳」のテスト

研究者たちは、これが本当かどうかを確認したいと考えました。彼らは既存のロボット学習データ(そのほとんどが英語でした)を取り出し、「多言語テスト」を作成しました。

  1. 翻訳: 英語の指示を取り、それを中国語、フランス語、ロシア語、アラビア語の4つの言語に翻訳しました。
  2. 混ぜ合わせ(コードスイッチング): また、文章の大部分はある言語でありながら、いくつかの重要な単語(「cup」や「pick」など)が英語である「コードスイッチング」形式の指示も作成しました。
  3. テスト: シミュレーション上のキッチンにおいて、これらの異なる言語を使ってタスクを実行させました。

分かったこと:「多言語のギャップ」

結果は明白でした。そこには巨大な溝が存在していました。

  • 「英語のみ」の脳: 英語のデータで訓練されたロボットは、他の言語で指示されるとひどい成績でした。成功率は大幅に低下し、時にはほぼゼロになりました。
  • 「多言語対応」の脳: いくつかのロボットは、すでに多くの言語を知っている言語モデル(Qwen-VLなど)の上に構築されていました。これらのロボットは、特に中国語に対しては成績が良かったものの、英語と比較すると依然として苦戦していました。
  • 視覚的な罠: 視覚的なシーンが紛らわしい場合、問題はさらに悪化しました。例えば、ボウルを皿に置くことと、ストーブのスイッチを入れることが見た目では全く同じに見えるような場合、ロボットは言語に大きく依存します。もし言語が外国語であった場合、ロボットは完全に迷子になってしまいました。
  • キーワードの力: 興味深いことに、フランス語の文章を聞いていても、単語の「cup」が英語のままであれば、ロボットはより上手く機能しました。これは、ロボットが文章の残りの部分を理解していなくても、何をすべきかを判断するための「キーワードのトリガー」を持っているようなものです。

なぜこのようなことが起きるのか?(「翻訳」の問題)

研究者たちは、ロボットの「脳」の内部を調べ、何が間違っているのかを探りました。彼らは主に2つの問題を発見しました。

  1. 理解の混乱: ロボットは単に外国語の指示を理解できていないことがありました。フランス語で「ストーブのスイッチを入れて」と言われたのに、視覚的なシーンが似ていたために「ボウルを皿に置いて」と言われたのだと勘違いしてしまうのです。
  2. 「アクション・ヘッド」の不一致: これは技術的な部分ですが、ラインの最後にある「翻訳者」のようなものだと考えてください。ロボットの脳は言葉を理解していますが、実際に腕を動かす部分(「アクション・ヘッド」)は英語向けに調整されています。言語が変わると、腕に送られる「信号」が乱れてしまうのです。
    • 比喩: 指揮者(脳)がオーケストラに対してフランス語で指示を出しているのに、演奏者(ロボットの腕)は英語話者向けの楽譜しか読めない状況を想像してください。音楽は正しく演奏されません。
    • 彼らは、特定の設計(GR00Tπ と呼ばれるもの)を持つ「指揮者」の方が、この混同をうまく処理できることを発見しました。

解決策:「主成分アライメント」(MPCA)

研究者たちは問題を指摘しただけではありません。解決策も提示しました。彼らは Multilingual Principal Component Alignment (MPCA) と呼ばれる手法を提案しました。

  • 比喩: ロボットの脳には、言葉と行動がどのように関連しているかを示す「地図」があると想像してください。英語では、その地図は明確です。しかし、フランス語では、地図が左にずれているため、ロボットは間違った方向に歩いてしまいます。
  • 解決策: MPCAは、フランス語の地図を、英語の地図と同じ方向を指すように再調整するコンパスのようなものです。これはロボット全体を最初から再学習させる必要はありません。既存の知識を取り込み、外国語のデータを、既存のアクション・システムに適合するように「回転」させるだけなのです。

まとめ

この論文は、言語モデルが多言語対応しているからといって、ロボットが世界中で動作することを前提にしてはならない、と結論付けています。ロボットを多言語の現実環境で動作させたいのであれば、異なる言語が同じ物理的な行動につながるように、特別に訓練し、調整する必要があります。

彼らは、単純な調整(MPCA)によって、ロボットが他の言語の指示に従う能力を大幅に向上させることができ、より現実の世界に適応できることを示しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →