Ludi: An Agentic System for Socially Intelligent Robots
本論文は、微調整された視覚言語モデルと、ナビゲーションおよび操作のための特化型ツールを組み合わせることで、文脈依存の推論と適応的な振る舞いを通じて、曖昧でマルチターンの人間との相互作用に対処することを可能にする、社会的に知的なロボットのためのエージェンティック・システムであるLudiを導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
数十年にわたり、役に立つロボットという夢は、単純な現実に阻まれてきました。それは、機械は厳格な指示に従うことには長けているものの、人間同士の会話の複雑で変化しやすい性質を理解することには極めて劣っているという現実です。従来のロボットに「赤い缶を持ってきて」と指示した場合、そのロボットは赤い缶を見つけて持ってきますが、作業の途中で指示の内容が変わったとしても、それに対応することはできません。このロボットには、人間の意図が変化したことを察知し、動作を一時停止し、新しい情報に基づいて行動を適応させるという、社会的な知性が欠けているのです。この硬直したプログラミングと流動的な人間との相互作用との間の溝こそが、現在研究者たちが解決しようとしている中心的な課題です。分野の目標は、単にロボットに「見る」ことや「動く」ことを教える段階を超え、「聞く」「覚える」「推論する」、そして人間が協力作業を行うときと同じように、リアルタイムで「考えを変える」ことを教えることへと移行しています。
Ludo Roboticsのチームは、Ludi0.1と呼ばれる新しいシステムによって、この目標に向けた重要な一歩を踏み出しました。これは、あらゆることを一度にこなそうとする単一のソフトウェアではなく、中央の「脳」の指導の下で連携して動く、専門化されたツールの調整されたチームです。この脳は、画像と言語の両方を理解するように訓練された一種の人工知能ですが、特に、実際の会話におけるやり取りを処理する方法に特化して学習されています。研究者たちは、この脳が「見ているもの」を観察し、「人が言っていること」を聞き、「直前に何が起きたか」を記憶し、その上で「話すか」「動くか」「何かを掴むか」「待つか」を判断できるシステムを構築しました。鍵となる革新は、このシステムが割り込みや訂正を処理できるように設計されている点です。例えば、人がコーラを頼み始め、ロボットがそれに手を伸ばしている最中に、人が突然「実は、彼女はペプシの方がいいって」と言ったとします。Ludi0.1は、古い計画がもはや有効ではないことを理解します。ロボットはコーラへ手を伸ばすのを止め、意識をペプシへと切り替え、相互作用の流れを壊すことなく、新しい指示に従ってタスクを継続します。
これを構築するために、研究者たちは、すべてをゼロから学ぼうとする単一の巨大なモデルには頼りませんでした。代わりに、中央の推論モデルがマネージャーとして機能する構造を作り上げました。このマネージャーは、ロボットの目からのライブビデオフィード、人間が今言ったテキスト、そしてロボットがこれまでに行ったことや考えたことの記録という、情報のストリームを受け取ります。この全体像に基づき、マネージャーは次にどのツールを使用するかを決定します。これらのツールは、物体が腕の届く範囲にあるかを確認したり、寝室のような名前のある部屋へ移動したり、あるいは実際に物体を掴んだりといった、特定の仕事のための専門プログラムです。マネージャーは、確認のための質問を投げかけることを決定する場合もあれば、デスクへと歩いていくことを決定する場合もあります。決定的なのは、このシステムがロボットに接続されたオンサイトのGPUワークステーション上で動作するように構築されている点です。これにより、ロボットは思考したり行動したりするためにインターネットへの接続を待つ必要がありません。これによって、ロボットは話している最中や動いている最中であっても、即座に反応することができるのです。
チームはこのシステムを、人間のように立ち、歩くヒューマノイドロボットであるUnitree G1を用いてテストしました。彼らは家庭環境のシミュレーションを作成してロボットを訓練し、複雑な相互作用の例を数千件生成しました。これらのトレーニングシナリオにおいて、ロボットは曖昧な要求への対処、タスク中の訂正への対応、そして多段階の用事の管理を練習しました。例えば、ユーザーが「真ん中のノートパソコンを持ってきて」と言った場合、ロボットは物体を掴む前に、まずシーンを観察してどのノートパソコンが真ん中にあるかを特定しなければならないことを学びました。トレーニングデータには、ユーザーが考えを変えたり、ロボットを遮ったり、あるいはロボットがすでに動作している最中に新しい情報を提供したりする状況が含まれていました。研究者たちは、これらの特定の相互作用パターンに基づいて中央の推論モデルを微調整することで、ロボットがタスクをより高い成功率で完了できるようになったことを発見しました。テストにおいて、システムは28の複雑なシナリオのうち20をエンドツーエンドで完了させ、これは同じモデルの未訓練バージョンと比較して大幅な改善となりました。
Ludi0.1の成功は、会話と物理的な行動を同じ現実の中に留めておく(グラウンディングする)能力にあります。ロボットは単に言葉を発するのではなく、見ているものや行っていることに直接結びついた言葉を発します。もしロボットが部屋に向かって歩いているなら、どこへ向かっているのかを説明できます。もし物体に手が届かないのであれば、正直にそう伝えることができます。システムは相互作用の共有履歴を維持しており、ユーザーが元々はコーラを欲しがっていたが、その後ペプシに切り替えたことを記憶することができます。この記憶は単なる事実のリストではなく、ロボットが行うあらゆる新しい決定を形作る、生きたコンテキストなのです。研究者たちは、ユーザーが寝室にいる人物に飲み物を運ぶようロボットに頼んだ実世界のテストで、これを示しました。ロボットが最初の缶に手を伸ばしている最中にユーザーが注文をコーラからペプシへと訂正した際、ロボットは即座に停止して正しい飲み物へと切り替え、寝室へと移動し、ユーザーに自分の行動を説明しながら、デスクの上に飲み物を置きました。
このシステムは素晴らしいものですが、研究者たちは現在の限界についても明確にしています。ロボットの知能は、中央の脳と、分離された専門的なツールの混合物です。脳が何をすべきかを決定し、ツールがその作業を行いますが、これらはまだ単一の統合された精神ではありません。この分離により、時に遅延が生じたり、ロボлоットの挙動が、まるでシステム内の異なる部分が一つとして機能するのではなく、互いに話し合っているかのように、わずかに断片的に感じられたりすることがあります。チームは、次のステップとして、このモジュール方式を超えたものへと進むことを認めています。彼らは、知覚、言語、記憶、そして物理的な制御を一つのまとまったシステムへと深く統合した、単一の基盤モデルである次世代版「Ludi 1.0」を目指しています。現時点では、Ludi0.1は動作するプロトタイプであり、貴重なデータの源として機能しています。ロボットがどのように人と相互作用するかを観察することで、研究者たちは、次世代の真に統合されたソーシャルロボットを訓練するために必要な、現実世界のトレース(軌跡)を収集しているのです。
本論文で提示された研究は、システムが人間の意図の予測不可能性に対処できるように設計されていれば、流動的な人間とロボットの協働が可能であることを示しています。研究者たちは、推論コアを専門的な物理スキルと強固な相互作用の記憶と組み合わせることで、ロボットがタスクの途中で変化に適応できることを証明しました。これは解決済みの問題ではなく、現在のシステムは依然として、完全に学習された統一的な知能ではなく、構造化されたアーキテクチャに依存しています。しかし、その結果は明確な進むべき道を示唆しています。一時停止し、聞き、修正し、そして継続する能力は、もはや単なる理論上の概念ではなく、今まさに構築し、テストできる機能なのです。チームがこれらのシステムを洗練し続けるにつれ、過去の硬直した機械と、未来の協力的なパートナーとの間の溝は、確実に狭まりつつあります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。