← 最新の論文
💻 computer science

Can People Distinguish Human and AI Agency in Humanoid Teleoperation? A Preliminary Study of Agency Perception

本予備研究は、「Ghost-in-the-Loop」フレームワークを導入することで、ヒューマノイド・テレオペレーションにおいて、参加者が人間によるエージェンシーとAIによるエージェンシーを区別することにしばしば苦慮すること、そして彼らの判断が実際の制御源ではなく、主に知覚された自然さやマルチモーダルな一貫性に左右されることを実証するものである。

原著者: Xiang Li, Koya Dendo, Keigo Minamida, Yuto Nakamura, Per Ola Kristensson, Jun Rekimoto

公開日 2026-09-09
📖 1 分で読めます☕ さくっと読める

原著者: Xiang Li, Koya Dendo, Keigo Minamida, Yuto Nakamura, Per Ola Kristensson, Jun Rekimoto

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたのリビングルームに立っているロボットが、単にスクリプトに従うだけの機械ではなく、微笑み、身振り手振りを交え、人間のような流暢さで応答する対話のパートナーである……そんな未来を想像してみてください。このビジョンは、遠くにいる人がロボットの動きや声をリアルタイムで制御し、実質的にその機械をリモートの身体として利用する「テレオペレーション(遠隔操作)」という手法に基づいています。長年、これには人間のオペレーターが常に存在する必要があり、一人の人間が助けられる人数や、会話を続けられる時間に限界がありました。しかし、人工知能の急速な台頭により、新しい可能性が生まれました。それは、生成AIを用いて音声、表情、ジェスチャーを自律的に生成し、人間との違いを見分けがつかないほど精巧に模倣するシステムです。これにより、これらの機械と対話する人々にとって、非常に興味深く、かつ少し不安を感じさせる問いが生まれます。もしロボットが「演技」をしているとしたら、背後で人間が糸を引いているのか、それともアルゴリズムが作業を行っているのか、あなたには判別できるのでしょうか。

ソニーコンピュータサイエンス研究所と東京大学の研究チームは、「Ghost-in-the-Loop」と名付けたフレームワークを構築することで、この問いに答えようとしました。このフレームワークにより、ヒューマノイド・ロボットは、見た目も音も全く同じまま、人間のオペレーターによる制御と、AIによる完全な駆動の間をシームレスに切り替えることができます。顔となるスクリーンと周囲を見るためのカメラを備えたUnitree G1モデルのロボットが、その舞台となります。人間が制御しているとき、オペレーターはヘッドセットを装着してロボットが見ているものを見、モーションセンサーを使用してロボットの手や顔を誘導します。システムがAIモードに切り替わると、ロボットは会話を聞き取り、生成モデルを使用して、人間による制御時と同じ視覚的・聴覚的なスタイルに合わせて、独自の音声、顔の動き、手のジェスチャーを作り出します。目的は、どちらが優れているかを見極めることではなく、人間の観察者がその違いを識別できるかどうかを確認することでした。

この検証のために、研究チームはロボットが会話をしている一連の短いビデオクリップを作成しました。カジュアルな雑談からタスク指向の議論まで、5秒から40秒の長さの異なる8つのインタラクションを記録しました。これらのクリップの半分では、人間のテレオペレーターがロボットを制御していました。もう半分では、AIシステムが挙動を生成していました。決定的なのは、ロボットの音声、顔、身体はすべてのクリップを通じて一貫していたことであり、変化したのは制御のソース(源泉)のみでした。研究チームは、50人の参加者をオンライン上でこれらのビデオを視聴するよう招待しました。各クリップの視聴後、参加者はロボットが人間によって動かされているのか、それともコンピュータによって動かされているのかを判断し、その確信度を「確実なAI」を示すマイナス10から「確実な人間」を示すプラス10までのスケールで評価しました。また、なぜそのように感じたのかという理由も求められました。

結果は、これらの短い瞬間において、人間と機械の境界線が驚くほど曖昧であることを示唆しています。参加者は、これら2つの制御ソースを区別することに非常に苦労しました。平均して、人間による制御のクリップとAIによる制御のクリップの間で評価の差はほとんどなく、その差はランダムな推測と統計的に区別がつかないほど微小でした。この研究は、短いやり取りにおいては、人々はロボットが人間によって操られているのか、あるいはアルゴリズムによって動かされているのかを確実に判断することはできないということを示しています。研究者が参加者の実際の思考を探ったところ、明確なパターンが現れました。判断を下せると感じた人々は、ロボットの挙動の全体的な「自然さ」に大きく依存していました。彼らは、会話のタイミング、動きのリズム、そして声、表情、手のジェスチャーが調和して機能しているかどうかに細心の注意を払っていました。

ロボットの動きが硬かったり、タイミングがずれていたり、あるいは身体の各部位が声と同期していないと感じられた場合、参加者はAIであると推測する傾向がありました。逆に、ジェスチャーや表情がスピーチと完璧に一致し、一貫した流れを持って動いているとき、人々は人間の背後に制御者がいると信じる傾向がありました。これはAIが完璧であったことを意味するのではなく、AIのパフォーマンスにおける欠陥が、一瞥しただけでは見逃してしまうほど微細であったことを意味しています。この研究は、私たちのエージェンシー(主体性)の検知能力は、使用されている特定のテクノロジーよりも、パフォーマンスの一貫性に依存していることを示唆しています。もしロボットが統一された一つの存在として振る舞うならば、脳はそのエージェントが肉体を持っていようとコードであろうと、それを単一のエージェントとして受け入れるのです。

この予備的な研究は、将来のロボットの設計における新しい章を開くものです。これは、近い将来、短いやり取りの中でユーザーが「目の前のロボットが本物か偽物か」と常に疑う必要はないことを示唆しています。むしろ、焦点は、人間と人工知能がいかに融合できるかへと移ります。例えば、会話が複雑になったときに人間が介入し、ルーチン的な部分をAIが担当するといった形です。研究者らは、今回の知見はこれら短く構造化されたクリップに特有のものであり、より長く複雑なインタラクションでは異なるパターンが現れる可能性があると注記しています。現時点では、この研究は、ロボットが話し、微笑み、一貫性を持って動くとき、人間の精神はそれをパートナーとして受け入れ、そのエージェンシーの真の性質を静かな謎の中に残しておくことを裏付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →