ReLI: Cross-Lingual Language-to-Action Grounding for Human-Robot Interaction
ReLIは、大規模な基盤モデルを適応させることで、自律型エージェントが自然言語による指示を理解し、意味的に推論し、そして低リソース言語やクレオール語を含む140以上の多様な言語にわたって効果的にタスクを実行することを可能にするクロスリンガル・フレームワークであり、それによって既存の高リソース言語のみのシステムの限界を克服するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あらゆる言語、すなわち最も広く話されている言葉から小さなコミュニティで話されている希少な方言に至るまで、ロボットがそのコマンドを理解できる世界を想像してみてください。数十年にわたり、人間とロボットの自然な協調という夢は、言語という単純な障壁によって阻まれてきました。現代のロボットは周囲の状況を把握し、そこを移動する能力をますます高めていますが、英語や中国語のようなごく少数の主要な言語を理解するように主に訓練されてきました。この制限は、他の言語や方言、クレオールを話す何十億もの潜在的なユーザーを排除し、事実上、彼らを自動化の未来から締め出しています。人間とロボットの相互作用の分野は、音声または書かれた要求を物理的な動作へと翻訳する能力、すなわち「グラウンディング(接地)」と呼ばれるプロセスに依存しています。これまで、この翻訳は高リソース言語を利用できる人々に対してのみうまく機能する一方通行の道であり、それ以外の世界を置き去りにしてきました。
研究チームは、これらの言語の壁を打ち破るために設計された「ReLI」と呼ばれる新しいシステムを開発しました。ReLIは、指示が与えられた言語に関係なく、自律型エージェントが自然に対話し、環境について推論し、タスクを実行することを可能にします。このシステムは、ユーザーの音声をまず英語に翻訳することに依存しておらず、また、新しい言語ごとにロボットを再学習させる必要もありません。その代わりに、大規模な事前学習済みコンピュータモデルが持つ、数百の異なる言語にわたって言葉の背後にある意味を理解するという固有の能力を活用しています。これらの言語モデルを、物体や空間を「見る」ことを可能にする視覚センサーと組み合わせることで、ReLIは、たとえ希少な方言で「赤い椅子を見つけて」と言われたとしても、ユーザーが技術的なコードを知っていたり、支配的な世界言語を話したりする必要なく、それを正確な物理的動作へと変えることができるのです。
研究者たちは、車輪型ロボットや、カメラと深度センサーを備えた四足歩行マシンを用いて、シミュレーション環境と実世界の環境の両方でこのシステムをテストしました。彼らは、7万回を超えるマルチターン(多段階)の会話を用いてロボットに挑戦を与えました。これらの言語は、膨大なデジタルデータを持つ高リソース言語、データが限られている低リソース言語、そしてテクノロジーから無視されがちな脆弱な言語やクレオールを含む、世界の言語的多様性を広く代表するように慎重に選ばれました。タスクは、「特定の距離だけ前進する」といった単純な一歩のコマンドから、部屋をナビゲートし、記述に基づいて物体を特定し、見つけたものを報告するという複雑な複数ステップのミッションまで多岐にわたりました。
結果は、この広大な言語的景観において、システムが驚くほど一貫したパフォーマンスを示したことを明らかにしました。テストされたほぼすべての言語において、ロボットはユーザーの意図を正しく理解し、83パーセントを超える成功率でタスクを実行しました。多くの一般的な言語では、成功率は97パーセントを超えました。最も脆弱でリソースの少ない言語であっても、システムは高いレベルの正確性を維持し、指示を解析してロボットを目標へと導くことに成功しました。ロボットがコマンドを処理して動き始めるまでにかかる時間は、指示が主要な世界言語で行われたか、あるいは希少な方言で行われたかにかかわらず、平均2.1秒から2.6秒の間で安定していました。この速度と信頼性は、このシステムが単なる理論的な概念ではなく、リアルタイムで機能可能な実用的なツールであることを示唆しています。
テクノロジーを真に包括的なものにするために、研究者たちは、自身の母国語でロボットと対話する人間の参加者を対象とした研究も行いました。13の異なる言語に堪能な34人の評価者が、実世界のラボ環境でシステムをテストしました。彼らは、相互作用が自然で応答的であると感じ、大多数が、使用する言語に基づいてパフォーマンスに違いがあるとは感じなかったと報告しました。この発見は極めて重要です。なぜなら、システムが特定の言語を優遇したり、特定の言語のユーザーが劣った体験を受けるような隠れた格差を生み出したりしていないことを示しているからです。システムは、ユーザーが一つの文章の中で二つの異なる言語の言葉を混ぜて使う「コードスイッチング」をうまく処理し、「食べ物を調理する場所」のようにその機能によってのみ説明される場所へ移動するといった、複雑な空間推論も管理できました。
この成果の核心は、システムがどのように言語を動作に結びつけているかにあります。ユーザーが音声またはテキストでコマンドを入力すると、システムはまず入力を正規化し(必要に応じて音声をテキストに変換)、それをロボットの脳として機能する大規模言語モデルに渡します。このモデルはコマンドの意図を解釈し、それを論理的なステップのシーケンスへと分解します。次に、ロボットの視覚センサーに照会して、コマンドの中で言及されている物体や空間を特定します。もしユーザーが特定の椅子へ行くよう求めた場合、システムはコンピュータビジョンを使用して、その部屋の中の椅子の位置を特定し、その正確な三次元空間上の位置を決定し、ロボットがそこに到達するために取るべき経路を計算します。最後に、システムは計画を生成し、安全のために、複雑または長距離の移動を実行する前にはしばしばユーザーに確認を求めます。このプロセス全体は、明示的な翻訳や新しい言語への特別なトレーニングを必要とすることなく、シームレスに行われ、人間の思考と機械の動作の間の溝を埋めています。
研究は、このテクノロジーの限界についても探求し、システムは堅牢ではあるものの、決して完璧ではないことを明らかにしました。最も大きな課題は、ロボットが非常によく似た物体を識別しなければならない場合や、視覚的な環境が乱雑でターゲットを区別するのが困難な場合に発生しました。さらに、複雑な複数ステップのシーケンスを通じてナビゲートする必要があるタスクは、単純で直接的なコマンドよりもエラーが発生しやすい傾向がありました。これは、推論の連鎖においてミスが発生する機会が多くなるためです。しかし、これらの困難なシナリオにおいても、システムのパフォーマンスは強力なまま維持されました。研究者たちは、エラーは多くの場合、言語の理解の失敗ではなく、ロボットのセンサーの物理的な限界や環境の複雑さに起因していると指摘しました。
単一のフレームワークが140以上の言語を高い精度で扱えることを示したこの研究は、人間とロボットの相互作用における新しい道を提示しています。それは、ロボットが有用であるために特定の言語を教えられる必要があるという考えから、ロボットがユーザーの母国語に適応するというモデルへと移行するものです。研究者たちは、他の人々がこの基礎の上に構築できるよう、データとコードを公開しました。究極の目標は、単に多くの言語を話せるロボットを作ることではなく、機械に命じる能力が、誰もが、どこでも、自分が最もよく知る言語で享受できる普遍的な権利となる未来を作ることです。この転換は、自動化へのアクセスを民主化し、ロボット工学の恩恵がデジタル・エリートの言語を話す人々だけでなく、全人類によって共有されることを約束するものです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。