← 最新の論文
💻 computer science

DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

DeicticVLAは、言語、視覚言語、および視覚的指示のモードをテキストプロンプトと直示的マスクへと標準化することで、単一の視覚言語行動モデルへと統合し、言語のみのベースラインと比較して、未知の物体や表現に対する優れた汎化性能を実証している。

原著者: Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

公開日 2026-08-31
📖 1 分で読めます☕ さくっと読める

原著者: Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

キッチンに置かれた、助けを待つロボットアームを想像してみてください。人間に「左にある赤いカップを手に取って」と言えば、指示は伝わります。これは単純に見えますが、機械にとっての世界は、多くの赤いカップや、見た目がほぼ同一のカップで溢れていることがよくあります。もし人間がより具体的に、「左から3番目の赤いカップ、青いナプキンの隣にあるやつを取って」と言ったとしても、ロボットは依然として混乱するかもしれません。現代のロボットは言語を理解する能力が高まっていますが、指示が細かすぎたり、目の前にある物体が学習中に見た正確な写真と一致しなかったりすると、苦戦することがよくあります。彼らは、人間が今話した特定の言葉を無視して、単に見た目がより「馴染みのある」ものを選んで、間違ったアイテムを掴んでしまうことがあるのです。

これを解決するために、研究者たちは機械に伝えるための異なる方法、すなわち「指差しジェスチャー」を用いることを模索してきました。人間が指を差しながら「これを持って」と言うように、画面上のクリックを直接的なコマンドとして理解するようにロボットを教えることができます。この「直示的(deictic)ジェスチャー」と呼ばれる手法は、指示を直接示すことで、言語による混乱を切り抜けます。しかし、これまでは、ロボットは言葉のみを聞くように訓練されるか、あるいは言葉を聞きながら指差しを併用するように訓練されることはあっても、これらすべてのコミュニケーション方法を同時に扱うことができるものはほとんどありませんでした。新しい研究は、これらの方法を統合するシステムを紹介しており、これにより、一つのロボットの脳が、文章を聞くこと、文章を聞きながら指差しを受けること、あるいは言葉なしで単に指差しに従うことの間をシームレスに切り替えられるようにしています。

研究者たちは、「Vision-Language-Action(視覚・言語・行動)」モデルと呼ばれる人工知能の一種を用いて、「DeicticVLA」と名付けたシステムを開発しました。これらのモデルは、何百万冊もの本を読み、何百万もの画像を見て、見たものとすべき行動を結びつける方法を学んだロボットの脳のようなものです。課題は、この脳を、テキストによるコマンド、テキストと指差しジェスチャーを組み合わせたもの、あるいは指差しのみという、3つの異なる入力形式を受け入れられるほど柔軟にすることでした。第1のモードでは、ユーザーは完全な文章を入力します。第2のモードでは、「これ」や「そこ」といった言葉を含む文章を入力し、画面をクリックしてその言葉が何を指しているかを定義します。第3のモードでは、ユーザーは動かしたい物体をクリックし、移動させたい場所をクリックしますが、言葉は一切使いません。

これを実現するために、チームはこれら3つの異なる入力をすべて同じ内部形式に変換する翻訳ステップを作成しました。ユーザーが画面をクリックすると、システムは強力な画像解析ツールを使用して、その単一のクリックを、人間が触れている対象を正確に強調する輪郭(マスク)へと変換します。このマスクはテキストプロンプトと組み合わされます。もしユーザーが話していたなら、テキストプロンプトは彼らの言葉になります。もしユーザーがクリックだけを行ったなら、システムは「視覚的指示に従え」といったデフォルトのフレーズを使用します。このようにして、ロボットの脳には常に一貫したパッケージ、つまり「テキストによる指示」と「ターゲットの視覚的な強調」が届けられます。研究者たちは、この視覚的な強調をロボットの脳に送り込むためのさまざまな方法をテストしました。彼らは、カメラ画像上の物体の周りにボックスを描く方法、他のシーンをフェードアウトさせて物体を目立たせる方法、あるいは、画像と並行して処理される別のレイヤーの情報として輪郭を送り込む方法を試しました。

チームはまず、ロボットが壊すことなく何千回も練習できるデジタル世界である、シミュレーション環境でこれらのアイデアをテストしました。その結果、システムはこれら3つの指示モードすべてを同時に扱うことを学習できることが分かりました。ロボットが、家具の配置が変わった新しい環境での作業や、新しい空間的記述による物体の識別など、未学習のタスクを求められた際、指差しを用いた方法が言葉のみの場合よりも大幅に優れた結果を示しました。特定の参照オブジェクトの隣にある黒いボウルを識別するというテストでは、言語のみのアプローチはほとんどの場合に失敗しました。しかし、ユーザーが正しいボウルを指し示したとき、ロボットはほぼ毎回成功しました。この研究は、二段階の学習プロセスが極めて重要であったことを示しています。つまり、ロボットはまずテキストコマンドに従うことを学び、次にそれらのコマンドと指差しジェスチャーを組み合わせることを学んだのです。この順序によって、ロボットは言語を理解する能力を維持したまま、指差しに従うという新しいスキルを獲得することができました。

これが現実世界でも機能するかを確認するため、研究者たちはロボットアーム、カメラ、タブレットを備えた物理的なセットアップを構築しました。彼らは、ブロックを拾ってボウルに入れたり、ぬいぐるみを整理したりすることをロボットに教えました。そして、これまで聞いたことがないような指示、例えば「右端」の指示しか学習していないのに「左端」のブロックを拾うよう指示したり、見たこともない種類の特定の玩具を動かすよう指示したりしてテストを行いました。これらの困難なシナリオにおいて、言語のみに頼るロボットは苦戦し、誤った推測をしたり動作に失敗したりすることがよくありました。しかし、ユーザーがターゲットを指し示すと、ロボットの成功率は急上昇しました。全く新しいカテゴリーのぬいぐるみを用いたテストでは、言語のみのロボットの成功率は約6分の1にとどまりました。しかし、指差しを用いた手法は、完璧な成功率を達成しました。ロボットは、その玩具の名前やカテゴリーを知る必要はなく、単に人間が指した場所を見るだけでよかったのです。

これらの結果は、人間とロボットの相互作用の未来が、言葉を使うか指を差すかの選択ではなく、両方を同時に利用できることにあることを示唆しています。このシステムにより、ユーザーは文章から始めることができ、もしロボットが混乱しているようであれば、単に指を差して明確にすることができます。また、素早い日常的なタスクであれば、言葉を発さずに指を差すだけでも構いません。この研究は、言語は複雑な概念を説明するのに強力ですが、乱雑で変化し続ける世界において特定の物体を特定するには、指差しの方がより信頼できる方法であることを示しています。これらの方法を単一のシステムに統合することで、研究者たちは、人間が機械を導くためのより柔軟で堅牢な方法を作り出し、ロボットが私たちの言葉だけでなく、私たちの「意図」をも理解できるようにしたのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →