← 最新の論文
💻 computer science

Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy

本論文は、機械的に言い換えられた指示のみを用いてロボットの視覚・言語・行動ポリシーにギリシャ語を追加することについて調査しており、誤った結論を避けるためにはヌル・ベンチマークとシードの複製を用いた堅牢な評価が必要であることを明らかにするとともに、バイリンガル学習が特定の言い回しへの過学習にもかかわらず、対照群に対して一貫した改善をもたらすことを実証している。

原著者: Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

公開日 2026-09-09
📖 1 分で読めます☕ さくっと読める

原著者: Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが見て、理解し、動くことができるようになりつつありますが、現在のところ彼らは英語という一つの言語しか話せません。これらの機械は、人間がタスクを実行しているビデオを見て学習しますが、そこでの指示は英語で書かれています。言葉の理解を助けるソフトウェアは膨大な量の英語テキストで訓練されているため、その特定の言語に対して非常に高い能力を持っています。ギリシャ語やその他の言語を話す人々にとって、これは大きな障壁となります。ロボットが物体を動かす際の動作にギリシャ語の指示が付随したビデオライブラリは存在しませんし、それをゼロから構築するには、あらゆる単一のアクションに対してロボットアームを手動でガイドする作業に数ヶ月を要することになります。研究者たちが投げかけた問いは単純でした。「既存の英語データを利用して、コンピュータを用いて指示をギリシャ語に翻訳し、システム全体を作り直すことなく新しい言語を理解させることはできるだろうか?」というものです。

答えは、単純な翻訳よりも複雑であることが判明しました。アテネのSophea AIとKIEFER SAの研究チームは、オープンソースのロボット・システムを取り上げ、機械によって生成された何千ものギリシャ語の指示を入力しました。彼らはロボットの脳や物理的構造を変更せず、ただ英文をギリシャ語のテキストに入れ替えただけです。翻訳プロセスは迅速かつ容易であり、わずか数時間で完了しました。しかし、真の作業は、ロボットが実際に言われたことを本当に理解しているかどうかを測定しようとした時に始まりました。ロボティクスの世界では、実際には推測しているだけであるにもかかわらず、成功しているように見せてシステムを欺いてしまうことが驚くほど簡単にできてしまいます。研究者たちは、通常であれば明確な合格または不合格を与える標準的なテストが完全に騙されてしまったことを発見しました。彼らは、たとえ命令が無意味であったり、あるいはロボットが一度もギリシャ語を教わっていなかったとしても、ロボットが高い成功率でギリシャ語のコマンドに従うことがあることを突き止めました。これは、ロボットが言葉を読むのではなく、場面やオブジェクト(対象物)を認識することを学んでいたために起こりました。

これを解決するために、チームはロボットをテストするための新しい方法を考案しなければなりませんでした。彼らはコントロールグループを作成し、意図的に間違ったギリシャ語の指示を与えて、それでもロボットがタスクを実行しようとするかどうかを確認しました。その結果、10個のタスクの小規模なセットにおいて、機械翻訳されたギリシャ語の指示で訓練されたロボットは約84パーセントの確率で成功するように見えることが分かりました。しかし、誤った指示を用いたテストを行った際も、依然として約82パーセントの割合で成功していました。このことは、ロボットが言語を読んでおらず、単に視覚的な状況に反応していたことを証明しています。ロボットは言語を無視していたのです。

そこで研究者たちは異なるアプローチを試みました。同じシーン内で複数の可能なゴールを選択する必要がある90個のより大規模なタスク群を使用しました。ここでは、言語こそがロボットに行うべきことを伝える唯一の手掛かりとなりました。調査の結果、英語とギリシャ語の両方の指示で訓練されたロボットは、グラウンド上のランダムな選択よりも有意に優れた成績を示すものの、提示された文脈における目標達成率は約27パーセントにとどまることが分かりました。一方で、英語のデータをサポートなしにギリシャ語のみで訓練されたロボットは、ランダムな推測による改善がほとんど見られませんでした。バイリンガル訓練の方がギリシャ語のみの訓練よりも平均的にはパフォーマンスが高かったものの、統計的な範囲が大きく重なっており、英語のトレーニングがギリシャ語習得のための不可欠な足場として機能しているのかどうかについては、データから決定的な結論を下すことはできませんでした。最も確実な知見は、「ターゲット言語によるデモンストレーションが必要であるが、それ自体ではしばしば不十分である」ということです。ターゲットとなる言語のみで訓練されたポリシーは、言語に従う力が極めて低く、複数のテスト実行を通じて自身の失敗フロアから3ポイント以内の差にしかなかったのです。

また本研究により、ロボットは人間のやり方とは異なる形でギリ下語を学習していることも明らかになりました。むしろ、機械翻訳者が使用した特定の言い回しを記憶していたのです。研究者が別のプログラムで作られたギリシャ語の文章を使ってテストを行うと、ロボットの性能は急激に低下しました。それは「言語」ではなく、最初の翻訳機の「スタイル」を学習していたのです。これを修正するため、彼らは同じタスクを7つの異なるギリシャ語の表現で行わせるようにしました。この単純な変更により、未知の言い回しに対する堅牢性が大幅に向上し、新たなフレーズでテストした際の性能低下を半分に抑えることに成功しました。これは、データの多様性が、単一のマシンの執筆スタイルを超えて汎化していくために不可欠であることを示しています。

おそらく最も驚くべき発見は、一般的な常識に基づいた改良策が、実はロボットの状態を悪化させてしまったことです。チームは、事前にギリシャ語に適応させたモデルを使用して訓練を開始すれば、有利なスタートを切れると考えましたが、代わりにすると、英語およびギリシャ語の両方においてパフォーマンスが悪化しました。また、言語処理を担当する部分の脳を自由に学習させる(凍結させない)実験も行いましたが、これも性能を劣化させました。これらの結果は、こうした特定のシステムにおいては、言語理解の部分を訓練時と同じ状態に保ち、新しい言語の指示に従ってどのように動くかを学ぶことだけに集中するのが最善の戦略であることを示唆しています。

さらに研究者は、これらの方策を、模擬テストよりも遥かに大規模な現実世界のロボット・データに対しても検証しようと試みました。5万件以上の実際のロボットのエピソードをギリシャ語に翻訳しました。しかし、テストを実行するために必要な物理的なロボット本体が不足していたため、このデータの成否を測定することができませんでした。これは、この分野における重大なボトルネックを浮き彫りにしました。すなわち、データの翻訳は安価で速いが、ロボットが実際に学習したかどうかを検証することは遅く、高価であり、物理的な設備を必要とするということです。

最終的に、論文は次のように結論付けています。新しい言語をロボットに追加することは可能ですが、それは単なる翻訳の問題ではありません。それは既にその言語を理解しているベースモデル、新言語と英語の混合トレーニングデータ、そしてロボットが実際に耳を傾けていることを確認するための、あえて失敗を組み込んだ厳格なテスト工程を必要とします。ロボットは人間のような深いレベルで言語を学習しているのではありません。特定の言葉のパターンと行動を結びつけて学習しており、そのためには英語による安定性を必要としますが、英語がいかにしてギリシャ語を支えているのかという正確なメカニズムは、確定したルールというよりも未解明の課題として残されています。この研究は他の専門家への警告でもあります。ロボットの成功率を額面通りに信じてはならず、常にコントロールグループを用いて、ロボットが単に推測しているのではないことを証明してください。多言語対応ロボットへの道は、単なるデータだけでなく、そのデータが実際に理解されたことを証明するという徹底した規律によって切り拓かれるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →