← 최신 논문
💬 NLP

Infer Human's Intentions Before Following Natural Language Instructions

이 논문은 행동을 계획하기 전에 사회적 추론을 통해 인간의 의도를 명시적으로 추론함으로써 협업 작업에서의 Embodied AI 성능을 향상시키는 프레임워크인 FISER를 제안하며, 이를 통해 HandMeThat 벤치마크에서 표준 엔드 투 엔드 방식 및 강력한 베이스라인 모델들을 능가하는 성능을 보여준다.

원저자: Yanming Wan, Yue Wu, Yiping Wang, Jiayuan Mao, Natasha Jaques

게시일 2026-08-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Yanming Wan, Yue Wu, Yiping Wang, Jiayuan Mao, Natasha Jaques

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

집안일을 돕기 위해 설계된 로봇을 상상해 보십시오. 이 기계가 진정으로 유용해지려면, 우리가 일상에서 서로에게 하는 다소 불완전한 요청들을 이해할 수 있어야 합니다. 사람이 정리 정돈을 하며 "소파에서 저것 좀 건네줄래?"라고 말할 때, 그들은 진공 상태에서 말하는 것이 아닙니다. 그들은 공유된 맥락과 방금 일어난 일들의 이력을 바탕으로 '저것'이 무엇을 가리키는지 청자가 알고 있다고 가정합니다. 만약 사람이 책들을 상자에 모으고 있었다면, 로봇은 '저것'이 쿠션이나 리모컨이 아니라 책이라는 것을 이해해야 합니다. 행간을 읽고, 관찰된 행동으로부터 숨겨된 목표를 추론하는 이 능력은 인공지능을 인간의 환경 속에서 진정한 파트너로 만드는 핵심적인 과제입니다. 이 기술이 없다면, 로봇은 지시를 문자 그대로 따를 수는 있겠지만, 모호한 명령과 공유된 과업을 완수하기 위해 필요한 구체적인 행동 사이의 간극을 메우지 못해 실질적인 도움이 되지 못할 수도 있습니다.

워싱턴 대학교와 MIT의 연구진은 FISER(Follow Instructions with Social and Embodied Reasoning, 사회적 및 체화된 추론을 통한 지시 수행)라고 불리는 새로운 접근 방식으로 이 문제를 해결했습니다. 그들의 연구는 인간의 지시가 자연스럽게 모호하다는 특정 어려움에 초점을 맞추고 있는데, 이는 사람들이 당연하다고 가정하는 세부 사항을 생략하기 때문입니다. 연구팀은 인간과 로봇이 함께 협력해야 하는 텍스트 기반의 가정 환경 시뮬레이션인 'HandMeThat'이라는 디지털 환경에서 아이디어를 테스트했습니다. 이 설정에서 인간은 물건을 정리하고 있을 수 있으며, 작업 도중에 모호한 요청을 통해 로봇에게 도움을 요청할 수 있습니다. 로봇의 임무는 단순히 단어에 귀를 기울이는 것이 아니라, 인간이 무엇을 해왔는지 관찰하고 그들의 잠재적인 계획을 추측함으로써 인간이 정확히 무엇을 원하는지 파악하는 것입니다.

연구진은 이 문제를 해결하는 가장 성공적인 방법은 문제를 두 가지 뚜렷한 단계로 나누는 것임을 발견했습니다. 첫째, 로봇은 '사회적 추론(social reasoning)' 단계에 돌입하여, 인간의 의도를 명시적으로 추측하기 위해 잠시 멈춥니다. 로봇은 인간의 행동 이력과 현재 상황을 살펴보고, 그 사람이 실제로 달성하고자 하는 목표가 무엇인지 결정합니다. 예를 들어, 인간이 책을 상자에 넣고 있었다면, 로봇은 목표가 책을 보관하는 것이라고 추론합니다. 이러한 추론을 마친 후에야 로봇은 두 번째 단계인 '체화된 추론(embodied reasoning)'으로 넘어가, 올바른 물건을 건네주기 위해 필요한 물리적 움직임을 계획합니다. 이 2단계 프로세스는 시스템이 움직이기 전에 언어의 모호성을 먼저 해결하도록 강제하기 때문에 매우 중요합니다.

이를 테스트하기 위해 연구팀은 이러한 단계들을 수행할 수 있는 컴퓨터 모델을 구축했습니다. 그들은 거대 사전 학습 언어 모델에게 한 번에 작업을 수행하도록 지시하거나, 모델이 추론 단계를 거치도록 유도하는 '생각의 사슬(Chain of Thought)' 기법을 사용하는 것을 포함한 다른 접근 방식들과 자신들의 방법을 비교했습니다. 결과는 명확했습니다. 사회적 추론과 물리적 계획을 명시적으로 분리한 모델들이 훨씬 더 뛰어난 성능을 보였습니다. 매우 모호한 지시가 주어졌던 가장 까다로운 테스트에서, 새로운 방법은 64.5%의 성공률을 기록하며 이 유형의 과업에서 새로운 기록을 세웠습니다. 반면, 주의 깊게 프롬프트를 입력했음에도 불구하고 가장 강력한 사전 학습 언어 모델들조차 동일한 수준의 성능에 도달하지 못했으며, 종종 인간의 숨겨진 목표를 이해하지 못하거나 환경의 세부 사항 속에서 길을 잃었습니다.

이 연구는 왜 강력한 사전 학습 모델들이 어려움을 겪었는지도 밝혀냈습니다. 인터넷의 방대한 텍스트를 읽은 이 모델들은 일반적인 지식은 갖추고 있지만, 공유된 과업의 즉각적이고 물리적인 맥락을 추론하는 특정한 능력은 부족합니다. 연구진이 환경에서 무관한 물체들을 걸러내어 모델을 도와주려 했을 때도 모델들은 여전히 효과적인 계획을 세우지 못했는데, 이는 문제가 단순히 정보가 너무 많은 것이 아니라, 사회적 신호를 물리적 행동으로 연결하는 데 근본적인 어려움이 있음을 시사합니다. 연구진은 로봇이 진정으로 도움이 되는 조수가 되기 위해서는, 일반적인 언어 모델이 스스로 알아서 해주기를 바라는 것이 아니라, 인간의 의도를 해결해야 할 하나의 구체적이고 관찰 가능한 부분으로 취급하도록 훈련받아야 한다고 결론지었습니다. 인간의 마음을 먼저 이해한 다음, 그 이해를 바탕으로 행동하도록 시스템을 가르침으로써, 연구진은 더 유능하고 협력적인 인공 에이전트로 나아가는 길을 보여주었습니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →