← 最新の論文
🤖 AI

Bridging Values and Behavior: A Hierarchical Framework for Proactive Embodied Agents

本論文は、TongSim 環境における新たな価値中心評価スイートによる検証を経て、動機付けの葛藤を解決することで具身エージェントが安定した自己主導的な長視野の行動を実行可能にするよう、LLM に基づく価値推論と古典的計画を統合した階層的認知アーキテクチャ「ValuePlanner」を提案する。

原著者: Chunhui Zhang, Yuxuan Wang, Aoyang Qin, Yi-Long Lu, Kunlun Wu, Yizhou Wang, Wei Wang

公開日 2026-05-01
📖 1 分で読めます☕ さくっと読める

原著者: Chunhui Zhang, Yuxuan Wang, Aoyang Qin, Yi-Long Lu, Kunlun Wu, Yizhou Wang, Wei Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたの家にロボットのお手伝いがいると想像してください。現在、これらのロボットのほとんどは、非常に従順だが少し混乱しているインターンのようです。「台所を掃除して」と言われれば掃除します。「コーヒーを入れて」と言えばそれもやります。しかし、あなたが立ち去って彼らを放置すると?彼らは通常、新しい命令を待ってただそこに立っています。彼らには自分自身で何をすべきか分かりません。

この論文は、ValuePlannerと呼ばれる新しい種類のロボット頭脳を紹介しています。命令を待つのではなく、このロボットは独自の「性格」と、何が最も重要かを伝える一連の内部価値観を持っています。まるでロボットに道徳的コンパスと、自分で書くためのToDoリストを与えたようなものです。

以下に、それを簡単な部分に分解して説明します。

1. 問題:「何をするか」と「どうするか」

著者らは、ロボットに自律的に行動させることが難しい理由として、2 つの異なる仕事があることに気づきました。

  • 「何をするか」(高レベル思考): 何が重要と感じられるかに基づいて、次に何をするかを決定すること。(例:「整頓が好きだから、片付けようかな」)
  • 「どうするか」(低レベル行動): 何かを壊さずに実行するための具体的な手順を考案すること。(例:「カップを拾い、流し台まで歩き、蛇口をひねる…」)

現在のロボットは、通常、大規模言語モデル(LLM)という一つの大きな頭脳で、この両方を同時にやろうとすることが多いです。問題は、これらの大きな頭脳が時々「幻覚」(でたらめを言う)を起こしたり、物理法則(壁を歩き抜けるなど)を忘れたりすることです。

2. 解決策:2 部構成のチーム

著者らは、ValuePlannerを構築しました。これは、互いに会話する 2 人の専門チームメンバーに仕事を分担するものです。

  • 「ビジョナリー」(LLM): これが創造的な部分です。ロボットの内部の「価値観」(例:「きれいな部屋が好き」「安全でありたい」)を見て、目標を決定します。細かい手順は気にせず、「部屋をきれいにしよう」と言うだけです。
  • 「監督者」(記号プランナー): これが厳格で論理的な部分です。ビジョナリーの目標を受け取り、家のルールをチェックします。「よし、部屋をきれいにするには、まずゴミを拾って、次にゴミ箱に入れる必要がある。壁を歩き抜けることはできない」と言います。物理的に確実に機能する、ステップバイステップの計画を作成します。

魔法のループ:
監督者が「ねえ、ゴミ箱がいっぱいだからその計画はうまくいかないよ」と言うと、ビジョナリーは諦めるわけではありません。クリティク(コーチとして機能する 3 番目の頭脳)から 2 番目の意見をもらいます。クリティクは「その計画はあまりに散漫だ。別の目標を試そう」と言います。計画が完璧になるまで、彼らはそれを改善し続けます。

3. 「価値観」(ロボットの性格)

ロボットに上司がいないとき、どうやって何をすべきかを知るのでしょうか?それは人間の心理学(特にシュワルツの価値観理論)に基づいたシステムを使用します。

ロボットには、異なる感情に対する音量ノブのような 7 つの設定を持つダイヤルがあると想像してください。

  • 安全: 「安全で快適でありたい」
  • 管理: 「家を世話してきれいに保ちたい」
  • 快楽: 「リラックスして楽しみたい」
  • 達成: 「物事を成し遂げたい」

ロボットが「空腹」(エネルギー不足)の場合、安全(何かを食べる)を優先するかもしれません。満腹だが部屋が散らかっている場合は、管理(片付ける)を優先するかもしれません。退屈している場合は、快楽(本を読む)を優先するかもしれません。

面白い点は、ロボットが対立を調整できることです。

  • シナリオ: 部屋は散らかっているが、テーブルの端に花瓶があり、落ちる可能性がある。
  • 従来のロボット: 散らかったものを片付けようとして、花瓶を倒してしまうかもしれない。
  • ValuePlanner: 価値観を比較衡量する。「安全」(花瓶を割らないこと)は、今この瞬間、「管理」(掃除すること)よりも重要だ。だから、まず花瓶を移動させ、その後に散らかったものを片付ける。賢いトレードオフを行います。

4. 検証方法

彼らはこのロボットを仮想の家(TongSimと呼ばれます)に入れ、命令を与えずに長時間観察しました。

  • 結果: ロボットはただそこに座っているわけではありませんでした。自ら掃除をし、整理し、リラックスし始めました。
  • 比較: 命令に従うだけ、または基本的な欲求(「お腹がすいたから食べる」など)に反応する他のロボットと比較しました。ValuePlanner は、家の中で生活する実在の人のように感じられる一貫性のある長期的な計画を立てる点で、はるかに優れていました。単にチェックボックスを埋めるだけの機械ではありませんでした。

5. 結論

この論文は単に「ロボットはタスクをこなせる」と言っているのではありません。「ロボットには『なぜ』がある」と言っています。

「何をすべきか?」という創造的な問いと、「どうやってやるか?」という論理的な問いを分離し、ロボットに選択を導く内部価値観のセットを与えることで、著者らは先駆的に行動できるエージェントを創出しました。これは単にスクリプトに従っているのではなく、人間が誰にも頼まれなくても部屋を片付けることを決めるように、自分が重要だと思うことに基づいて意思決定を行うのです。

要約すると: 彼らはロボットに性格と計画を持たせることを教えました。そうすることで、ロボットはあなたが次に何をすべきかを教えてくれるのを待つだけでなく、家の中で自らの人生を生きられるようになるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →