Infer Human's Intentions Before Following Natural Language Instructions
本論文は、行動を計画する前に社会的推論を通じて人間の意図を明示的に推論することにより、協調タスクにおけるエンボディドAIの性能を向上させるフレームワークであるFISERを提案しており、これによりHandMeThatベンチマークにおいて標準的なエンドツーエンドの手法や強力なベースラインを上回る性能を実現している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
家の中での手助けをするために設計されたロボットを想像してみてください。この機械が真に有用であるためには、私たちが日常的に互いに交わす、しばしば不完全な要求を理解できなければなりません。例えば、片付けをしている時に人が「ソファからあれを取ってくれる?」と言った場合、その人は真空状態で話しているわけではありません。その人は、共有された文脈や直前に起こった出来事に基づいて、聞き手が「あれ」が何を指しているのかを知っていると想定しています。もしその人が本を箱に集めていたのであれば、ロボットは「あれ」がクッションやリモコンではなく、本であることを理解すべきです。行間を読み、観察された行動から隠れた目的を推論するこの能力こそが、人工知能を人間の環境における真のパートナーにするための核心的な課題です。このスキルがなければ、ロボットは指示には忠実に従うものの、共有されたタスクを完了するために必要な具体的な行動へと、曖昧な命令と結びつけることができず、役に立つことに失敗するかもしれません。
ワシントン大学とMITの研究者たちは、FISER(Follow Instructions with Social and Embodied Reasoning:社会的・身体的推論による指示遂行)と呼ばれる新しいアプローチでこの問題に取り組みました。彼らの研究は、特定の困難に焦点を当てています。それは、人間は当たり前だと思い込んでいる詳細を省略するため、人間の指示は自然と曖昧になるという点です。チームは、人間とロボットが協力して作業を行うテキストベースの家庭用シミュレーションである「HandMeThat」というデジタル環境で、彼らのアイデアをテストしました。この設定では、人間がアイテムを整理している途中で、曖昧な要求を出してロボットに助けを求めることがあります。ロボットの仕事は、単に言葉を聞くだけでなく、人間が何をしていたかを観察し、その背後にある計画を推測することによって、人間が正確に何を望んでいるのかを解明することです。
研究者たちは、この問題を解決するための最も成功した方法は、問題を2つの明確なステップに分解することであることを見出しました。まず、ロボットは「社会的推論」を行い、人間の意図を明示的に推測するために一旦停止します。ロボットは、人間の行動の履歴と現在の状況を見て、その人が実際に何を達成しようとしているのかを判断します。例えば、もし人間が本を箱に入れているのであれば、ロボットは「本を収納すること」が目的であると推論します。この推論を行った後に初めて、ロボットは第2のステップである「身体的推論」へと進み、正しい物体を手渡すために必要な物理的な動きを計画します。この2段階のプロセスが極めて重要なのは、システムに対して、動こうとする前に言語の曖昧さを解決することを強制するからです。
これをテストするために、チームはこれらのステップを実行できるコンピュータモデルを構築しました。彼らは、大規模な学習済み言語モデルに一度にタスクを実行させる方法や、「思考の連鎖(Chain of Thought)」と呼ばれる手法を用いてモデルを推論ステップへと導く方法など、他のアプローチと比較しました。結果は明白でした。社会的推論と物理的な計画を明確に分離したモデルの方が、大幅に優れた性能を示したのです。非常に指示が曖昧な最も困難なテストにおいて、この新手法は64.5パーセントの成功率を達成し、この種のタスクにおける新記録を樹立しました。対照的に、注意深くプロンプトを与えられたとしても、最も強力な学習済み言語モデルでさえも、同じレベルのパフォーマンスに達することに苦戦し、しばしば人間の隠れた目的を理解できなかったり、環境の詳細の中で迷子になったりしました。
この研究はまた、なぜ強力な学習済みモデルが苦戦したのかについても明らかにしました。インターネット上の膨大なテキストを読み込んできたこれらのモデルは、一般的な知識は持っていますが、共有されたタスクにおける即時的かつ物理的な文脈について推論する特定の能力を欠いています。研究者が環境から無関係なオブジェクトをフィルタリングしてモデルを助けようとしても、モデルは依然として効果的な計画を立てることができませんでした。これは、問題が単に情報が多すぎることではなく、社会的な手がかりと物理的な行動を結びつけるという根本的な困難さにあることを示唆しています。研究者たちは、ロボットが真に役立つアシスタントとなるためには、一般的な言語モデルが自力で解決することを期待するのではなく、人間の意図を解決すべき特定の観察可能な要素として扱うように訓練される必要があると結論付けました。人間の心をまず理解し、その理解に基づいて行動するようにシステムを教えることで、研究者たちは、より有能で協力的な人工エージェントへの道筋を示したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。