← 最新の論文
💻 computer science

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

本論文は、音響的に豊かな屋内環境におけるマルチゴール・ミッションによってエージェントに課題を突きつける、長期間の音響・視覚・言語ナビゲーションのための新しいベンチマークであるLH-AVLNを導入し、探索のためにバイノーラル音響を効果的に活用しながら、目標達成のために視覚的・意味的な検証に依存するトレーニングフリーのエージェントであるPAG-Navを提案する。

原著者: Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに究極のハウス・ディテクティブ(家の探偵)になってもらうよう教えているところを想像してみてください。通常、ロボットに家の中を移動する方法を教えるとき、私たちは非常に単純なミッションを与えます。「赤いボールを探せ」というものです。ロボットはカメラの目を使って周囲を見渡し、おそらく自分がどこにいたかを記憶しながら、対象物を見つけるまで歩き回ります。この分野は「エンボディド・ナビゲーション(身体化されたナビゲーション)」と呼ばれ、ロボットが現実世界を移動してタスクを解決する方法を学ぶものです。しかし、ここには落とし穴があります。ほとんどのこうしたトレーニング用のゲームは、完全に無音です。ロボットはレンズの正面にあるものしか見ることができません。もしボールが閉まったドアの後ろや暗い隅に隠れていたら、ロボットは目の前の視界の外にあるものに対して盲目となり、立ち往生してしまいます。

では、そのロボットに「超能力」を与えたらどうなるでしょうか。耳を与えるのです。現実の世界では、音は単に直線的に進むだけでなく、角を曲がって跳ね返ったり、隙間から漏れ出したりします。優れた耳を持つロボットなら、隣の部屋で犬が吠えている声や、壁の向奥で蛇口から水が滴る音を聞き取り、対象物がまだ見えていなくても、どこへ向かうべきかのヒントを得ることができるでしょう。この論文は、大きな、そして非常に難しい問いを投げかけています。もし、この二つの超能力――見る力と聞く力――を組み合わせた上で、ミッションをより難しくしたらどうなるか? 単に一つのものを見つけるのではなく、言葉による説明、画像による指示、あるいは名前だけの指定など、さまざまな形式のリストにある複数のアイテムを見つけなければならないとしたら? しかも、パズルを解いている間、家の中の音は変化し続けるとしたら?

陳如風(Rufeng Chen)氏ら、香港科技大学および吉林大学の研究チームによるこの研究は、LH-AVLNと呼ばれる新しいチャレンジを構築しました。これは、ロボットのためのハイリスクなマルチレベル・ビデオゲームのようなものです。このゲームでは、ロボットは3Dの家の中に放り込まれ、「グローバル・ミッション」として2つから4つの異なる目標を与えられます。これらの目標は非常にトリッキーです。一つは「ソファを探せ」(カテゴリ)であり、もう一つは「薄手のカーテンの隣にあるライトグレーのソファを探せ」(説明)であり、三つ目は「このベッドの特定の写真を探せ」(画像参照)といった具合です。

本当の仕掛けは「音」にあります。このゲームでは、ロボットが探しているすべてのアイテムが音を発します。しかし、ここでの注意点は、それらの音が固定されたターゲットではないということです。ロボットが目標を見つけてミッションを完了するたびに、そのアイテムの音は止まります。一方で、まだ見つけられていないアイテムたちは、誰が一番大きな音を出すかの順番を回しながら音を出し続けます。これは混乱を招く状況を生み出します。もしロボットがソファを探しているときに、トイレが流れる音を聞いたとしたら(それはまだ見つけられていないトイレの音です)、その音は邪魔な存在になります。ロボットはこう判断しなければなりません。「この音は現在のターゲットを見つけるための助けになるのか、それとも別の未完了のタスクへと自分を誘い込む『レッド・ヘリング(偽の手がかり)』なのか?」

これをテストするために、著者らは15万エピソードを超える膨大なデータセットを作成しました。そこでは、ロボットがノイズの多いマルチゴール・ミッションに挑みます。彼らの調査によると、既存のロボットは、たとえ指示に従うのが得意であったり、視覚的なマップを記憶したりできる賢いものであったとしても、非常に苦戦することが分かりました。音が混乱したり、ミッションが長くなったりすると、ロボットは道に迷うか、諦めてしまいます。彼らは、役立つ手がかりと、紛らわしいノイズとの区別をつけることができないのです。

この難易度を示すために、チームは独自のロボット・エージェントであるPAG-Navを構築しました。このロボットは複雑な訓練によって学習するのではなく、巧妙な戦略を用います。それは、家全体のメンタルマップを保持し、自分がどこに行ったか、何を見たか、そして音がどこから来ているかを追跡します。音が見えないときは探索のガイドとして音を利用しますが、対象物が正しいものであることを確認するために、しっかりとクリアな視界で対象を確認できるまでは「見つけた!」とは言いません。このスマートな戦略を用いても、このロボットが順序立てられたミッションで成功するのは約2%から3%、順序のないミッションでは約3%から5%に過ぎません。

この論文の主要な発見は、長く複雑なミッションに音を加えることは、現在のテクノロジーにとって、事態を容易にするどころか、著しく困難にするということです。著者らは、音は視界から隠れたものを見つけるための強力なツールである一方で、どの音がどのタスクに属しているのかを判別できなければ、悪夢に変わると指摘しています。彼らは、ロボット・ナビゲーションの未来は、単に「より良く見る」ことや「より良く聞く」ことではなく、「ノイズを無視し、適切なタイミングで適切な手がかりに集中する」ことを学ぶことにあると主張しています。論文は、私たちはまだこのパズルを解くには程遠い場所にあり、ノイズの多いマルチタスクの世界を真にナビゲートできるロボットを構築するための余地が多分に残されていると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →