← 최신 논문
🤖 AI

STEP: State-Aware Task Estimation and Planning with Multi-Modal LLMs for Human-Robot Collaboration

본 논문은 멀티모달 거대 언어 모델을 활용하여 시스템 상태를 명시적으로 추정하고 상태 전이를 예측함으로써, 인간-로봇 협업에서의 환각 현상과 모호성을 극복하여 산업 조립 작업의 실행 가능성을 유의미하게 향상시키고 최종 상태 오류를 줄이는 상태 인지 프레임워크인 STEP을 제안한다.

원저자: Maitrey Gramopadhye, Prakash Baskaran, Xiao Liu, Songpo Li, Soshi Iba

게시일 2026-08-28
📖 4 분 읽기☕ 가벼운 읽기

원저자: Maitrey Gramopadhye, Prakash Baskaran, Xiao Liu, Songpo Li, Soshi Iba

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 산업의 분주한 세계에서 인간과 기계 사이의 원활한 팀워크라는 꿈은 현실이 되어가고 있지만, 여전히 근본적인 오해로 인해 어려움을 겪고 있습니다. 로봇이 진정으로 인간을 보조하기 위해서는 단순히 명령 목록을 따르는 것을 넘어, 인간의 의도를 이해하고 다음에 올 것을 예측할 수 있어야 합니다. 이러한 과제는 컴퓨터가 방금 본 것을 바탕으로 미래의 사건 시퀀스를 예측하려고 시도하는 '장기 행동 예측(long-term action anticipation)'이라 불리는 분야의 핵심에 자리 잡고 있습니다. 최근 몇 년 동안 이미지와 텍스트를 모두 처리할 수 있는 강력한 인공지능 시스템이 이 작업을 위한 유망한 도구로 등장했습니다. 이러한 시스템은 사람이 작업하는 영상을 보고 그가 무엇을 만들려고 하는지 추측할 수 있습니다. 그러나 중대한 격차가 남아 있습니다. 이러한 지능형 시스템은 언어와 패턴 인식에는 뛰어나지만, 물리적 세계에 대한 진정한 이해는 부족한 경우가 많습니다. 이들은 물체가 움직일 때 방의 상태가 어떻게 변하는지를 자연스럽게 추적하지 못하며, 이로 인해 불가능한 행동을 상상하거나 궁극적인 목표를 놓치기도 합니다.

이 격차를 메우기 위해 혼다 연구소(Honda Research Institute)와 노스캐롤라이나 대학교 채플힐 캠퍼스의 연구진은 STEP(State-Aware Task Estimation and Planning, 상태 인식 작업 추정 및 계획)이라는 새로운 방법을 개발했습니다. 연구팀은 인간 작업자가 작업대 위에서 나무 블록을 사용하여 구조물을 조립하고, 로봇이 이를 지켜보며 바통을 이어받을 준비를 하는 흔한 산업적 시나리오에 집중했습니다. 실험에서 인간은 다리나 탑과 같은 특정 모양을 만들기 시작한 후 멈추고, 로봇에게 계획 책임을 넘깁니다. 연구진은 로봇이 최종 구조물이 어떤 모습이어야 하는지 추측할 뿐만 아니라, 다음 동작을 계획할 때 작업 공간에 대한 정신적 지도를 끊임없이 업데이트하도록 가르칠 수 있는지 확인하고자 했습니다. 단순히 로봇에게 문장 속의 다음 단계를 예측하라고 요구했던 이전 방식들과 달리, 이 새로운 시스템은 로봇이 현재 모든 블록의 배치를 명시적으로 설명하고, 각 동작 후에 그 배치가 어떻게 변할지 예측한 다음, 그 업데이트된 설명을 사용하여 후속 단계를 계획하도록 강제합니다.

STEP의 핵심 혁신은 물리적 세계에 대한 구조화된 디지털 기록을 유지해야 한다는 점에 있습니다. 로봇이 작업대를 관찰할 때, 단순히 "탑을 쌓는 중"이라는 모호한 개념을 생성하는 것이 아닙니다. 대신, 다섯 개의 나무 블록이 각각 어디에 위치해 있는지, 블록이 똑바로 서 있는지 아니면 누워 있는지, 그리고 카메라 및 다른 물체와 비교하여 정확히 어떻게 방향을 틀고 있는지와 같은 장면의 사실들을 상세하고 조직적인 목록으로 만듭니다. 그런 다음 시스템은 이 정밀한 설명을 사용하여 미래를 시뮬레이션합니다. 시스템은 "내가 이 블록을 여기로 옮기면 다음 장면은 어떻게 될까?"라고 스스로에게 묻고, 다음 동작에 대해서도 이 질문을 반복합니다. 자신의 예측을 목표와 끊임없이 대조함으로써, 시스템은 작업을 완료하기까지 얼마나 남았는지 측정할 수 있습니다. 만약 계획된 동작 시퀀스가 막다른 길이나 목표에서 멀어진 상태로 이어진다면, 시스템은 이 오류를 인식하고 계획을 단축하여 목표에 더 가까워지는 다른 경로를 선택합니다. 이 계획, 결과 시뮬레이션, 그리고 경로 수정의 과정은 로봇이 궤도를 유지할 수 있도록 여러 번 반복됩니다.

연구진은 인간 작업자가 두 개의 로봇 팔을 원격 제어하여 나무 블록을 조립하는 데이터셋을 사용하여 시뮬레이션 환경에서 이 접근 방식을 테스트했습니다. 그들은 이들의 방법을 환경의 상태를 이러한 방식으로 구조화하여 추적하지 않는 기존의 선도적인 기술과 비교했습니다. 결과는 새로운 시스템의 명확한 우위를 보여주었습니다. STEP가 생성한 계획은 훨씬 더 실용적이었습니다. 연구진은 자신들의 방법으로 예측된 행동이 기존 방식보다 32.8% 더 자주 로봇에 의해 성공적으로 실행될 수 있음을 발견했습니다. 또한, 로봇이 작업을 마쳤을 때 완성된 구조물은 기존 방식이 만든 구조물보다 의도한 목표에 14.8% 더 가까웠습니다. 이 연구는 또한 기존 방식이 때때로 인간의 원래 시퀀스와 일치하는 더 긴 행동 목록을 생성하기도 하지만, 그 추가적인 단계들이 종종 불필요하거나 틀렸던 반면, 새로운 방식은 목표에 안정적으로 도달하는 더 짧고 효율적인 계획을 생성한다는 것을 밝혀냈습니다.

연구진은 이 접근 방식의 성공이 초기 단계의 정확도에 크게 의존한다는 것을 발견했습니다. 만약 시스템이 인간이 무엇을 만들려 하는지 정확히 식별하고 블록의 현재 상태를 정확하게 설명한다면, 이후의 계획은 매우 효과적입니다. 그러나 시스템이 목표를 잘못 추측하거나 블록의 위치를 잘못 판단하면, 이러한 실수들은 나머지 계획 전체로 파급됩니다. 이 발견은 작업 공간의 물리적 실체를 끊임없이 재평가하는 시스템 능력의 중요성을 강조합니다. 연구진은 현재의 방식이 이 특정 블록 쌓기 시나리오를 위해 설계되었지만, 상태 변화를 명시적으로 추적한다는 근본적인 원리는 기계 조립이나 모듈형 고정 장치 구축과 같은 다른 산업 작업에도 적용될 수 있다고 언급했습니다. 또한 현재 시스템은 이러한 여러 계획 주기를 실행하는 데 상당한 컴퓨팅 시간을 필요로 하여 더 단순한 방법보다 느리다는 점을 인정했지만, 기술이 발전함에 따라 이러한 지연 시간은 줄어들 수 있다고 믿고 있습니다. 궁극적으로, 이 연구는 인공지능에게 물리적 세계에 대한 지속적인 기록을 갖게 함으로써, 우리가 단순히 반응적인 로봇이 아니라 복잡한 작업을 인간과 함께 이해하고 완수할 수 있는 진정한 협력 파트너를 만들 수 있음을 입증합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →