← 最新の論文
💻 computer science

Beyond Placement and Articulation: Usage-Driven Code Scenes for Embodied Interaction

本論文は、単なる視覚的な配置から、使用目的に基づいたオブジェクトの推論とルールベースの相互作用モデリングへと焦点を移すことで、エンボディドAIのための実行可能なコードベースの3D屋内シーンを生成するエージェンティックなフレームワークであるRoomWrightを導入するものである。

原著者: Zijian Xiao, Zipeng Ye, Jinkun Hao, Xiong Yang, Yuchen Xie, Ran Yi

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Zijian Xiao, Zipeng Ye, Jinkun Hao, Xiong Yang, Yuchen Xie, Ran Yi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットが部屋に入り、ケトルを持ち上げてコンロの上に置いたり、バーチャルエージェントがスイッチを切り替えてランプを点灯させたりできる世界を想像してみてください。これらの機械が学習し、行動するためには、単なる部屋の写真ではなく、実際に機能する空間が必要です。部品が動くオブジェクトがあり、ドアのハンドルを回せばラッチが動き、ボタンを押せばライトの状態が変わるような場所が必要です。最近まで、ロボットのために構築されたデジタルルームは、そのほとんどが静的なものでした。それらは本物のように見えましたが、本物のように振る舞うことはできませんでした。ロボットは椅子にぶつかることはできても、引き出しを引いたり、ダイヤルを回すと扇風機の速度が変わることを理解したりすることはできなかったのです。課題は、単なる家具の視覚的な集合体ではなく、物理世界と同じように原因と結果が展開される機能的なステージとしての屋内空間を構築することでした。

研究チームは、オブジェクトを単にシーンの中に配置する手法を超え、それらのオブジェクトが実際にどのように使われるかを理解するという、新しい方法でこれらのインタラクティブな世界を構築する方法を導入しました。彼らはそのシステムを「RoomWright」と呼んでいます。3Dモデルをボード上の駒のように並べて部屋を作るのではなく、このシステムは部屋全体を、コンピュータが実行できる一連の指示、すなわちコードとして書き出します。このアプローチにより、デジタル環境は完全に編集可能で、シミュレーションの準備が整ったものになります。重要な洞察は、部屋はその中で行われる活動によって定義されるという点です。コーヒーを淹れるなら、カウンター、ケトル、電源、そしてそれをオンにする方法が必要です。研究者たちは、活動から始めて、そこからオブジェクトとその接続へと遡ることで、視覚的に正しいだけでなく、機能的にも論理的なシーンを生成できることを見出しました。

従来の方法は、部屋の画像を見て、どこに何を置くべきかを推測することに頼ることがよくありました。これは見た目を美しくすることには役立ちますが、物事がどのように連携して機能するかという隠れた論理を捉えることにはしばしば失敗します。ロボットはケトルとコンロを目にすることはできても、その機能を理解していなければ、ケトルを空中に浮かせてしまったり、向きを間違った方向に配置したりしてしまうかもしれません。新しいシステムは、主要な家具の各パーツを特定のタスクの中心として扱うことで、この問題を解決します。システムは「ここで人は何をしたいのか?」と問いかけ、そのタスクに必要なオブジェクトだけを取り込みます。もしタスクが料理であれば、システムはコンロ、カウンター、ケトルを追加し、人間が実際に手を伸ばせる場所にそれらを配置することを確実にします。研究者が「使用駆動型推論(usage-driven reasoning)」と呼ぶこのプロセスは、部屋が視覚的な魅力よりも、人間のニーズに基づいて構築されることを保証します。

このシステムはさらに一歩進んで、オブジェクト同士がどのように相互作用するかを教えます。実際のキッチンでは、扇風機のつまみを回すと羽根の速度が変わり、電子レンジのボタンを押すとディスプレイが点灯します。これらは単一の部品の動きではなく、一つのアクションが別のアクションを誘発する一連の出来事です。研究者たちは、これらの相互作用のためのルールを書き込むようにシステムをプログラムしました。各ルールは小さなスクリプトのように機能します。「もしユーザーがスイッチを押せば、ランプが点灯する」「もしユーザーがダイヤルを回転させれば、扇風機の速度が変わる」といった具合です。これらのルールをコードとして書き込むことで、システムは複数のオブジェクトが連携して動作する、複雑な挙動(例えば、ケトルがベースの上に置かれたときに、正しく設置されるとライトが点灯する、など)を作成できます。これにより、デジタルルームはロボットの行動に対して、自然で一貫した方法で反応できるようになります。

これらの部屋を構築する上で最もトリッキーな部分の一つは、オブジェクトがどちらを向いているべきかを判断することです。トースターには前、後ろ、上がありますが、コンピュータが写真を見ているだけでは、人間がそれを使用する様子を見ない限り、どちらが「前」なのかを知ることができません。研究者たちは、オブジェクトを構築している間に得られる情報を利用することで、この問題を解決しました。システムはコードから部屋を構築するため、ハンドルやボタンの位置といった、あらゆるパーツの詳細を知っています。システムはこの知識を使用して、人間がどのように使うかに基づいて、オブジェクトの最適な向きを決定します。これにより、キーボードはユーザーにキーが向くように配置され、マウスは右手のグリップに適した位置に配置されることが保証されます。従来のメソッドは視覚的な推測に頼っていたため、こうした間違いをよく犯していました。

チームは、ダイニングエリアからオフィスまで28種類の異なる部屋を作成してシステムをテストし、その結果を既存の他の手法と比較しました。テストの結果、彼らのアプローチは、より完全で現実的な部屋を生成することが示されました。シミュレーションにおいて、生成された部屋は、オブジェクトが空中に浮いていたり、家具の支えがなかったりすることが少なく、実際に手が届き、使用可能なオブジェクトが多く含まれていました。最も重要な点は、生成された部屋には多くのインタラクティブな要素が含まれていたことです。他の手法は動くパーツをわずかに含むだけの部屋を作成するかもしれませんが、この新システムは、開閉するドア、点灯するライト、速度を制御するダイヤルなど、操作可能なオブジェクトを多く持つシーンを生成しました。研究者たちは、ロボットがこれらのデジタルルームに入り、ドアのハンドルを掴んで閉めたり、ボタンを押してディスプレイを点灯させたりといったタスクを正常に実行できることを実証しました。

この研究は、ロボットや人工知能のためにデジタル環境を構築する方法における重要な転換を意味しています。部屋の外観ではなく、部屋の目的に焦点を当てることで、研究者たちは現実世界でのテスト準備が整った空間を生成する方法を作り上げました。結果として得られるシーンは、単なる静止画ではなく、すべてのオブジェクトが役割を持ち、すべての行動に結果が伴うダイナミックな環境です。これにより、ロボットは、私たちの生活と同じように振る舞う世界の中で、スキルを学び、練習することができます。このシステムは、私たちが自分たちの家で使用するのと同じ論理を用いてデジタル世界を構築すれば、いつの日か私たちと共に暮らし、働くことになる機械にとって、より優れた基盤となることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →