← 최신 논문
🤖 AI

Evidence-Gated Task and Motion Planning with Vision-Language Models

본 논문은 시각-언어 모델을 작업 및 모션 계획(Task and Motion Planning)과 통합하여 시각적 증거를 동적으로 획득하고 계획 결정을 게이팅함으로써, 검증되지 않은 가정에 기반한 실행을 방지하여 부분 관측성 하의 장기 지평 조작 작업에서 성공률을 향상시키는 증거 획득 및 타당성 게이팅(Evidence Acquisition and Feasibility Gating, EAFG) 프레임워크를 제안한다.

원저자: Tsunehiko Tanaka, Matthew Stephenson, Alistair Macvicar, Edgar Simo-Serra

게시일 2026-08-21
📖 4 분 읽기☕ 가벼운 읽기

원저자: Tsunehiko Tanaka, Matthew Stephenson, Alistair Macvicar, Edgar Simo-Serra

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

우리 집과 주방을 돌아다니는 로봇들은 근본적인 문제에 직면해 있습니다. 그들은 단순히 무엇을 해야 하는지뿐만 아니라, 그것을 실제로 할 수 있는지 여부까지 이해해야 한다는 점입니다. "수프를 만들어라"와 같은 간단한 지시를 수행하기 위해, 기계는 매우 다른 두 세계를 연결해야 합니다. 첫째, 로봇은 언어의 의미를 파악해야 합니다. 즉, 수프를 만드는 데 닭고기와 소금 같은 재료가 필요하며, 이 항목들을 가열해야 한다는 것을 알아야 합니다. 이것은 언어와 상식의 영역입니다. 둘째, 로봇은 물리적 세계를 이해해야 합니다. 냄비가 정확히 어디에 있는지, 캐비닛 문을 벽에 부딪히지 않고 열 수 있는지, 그리고 로봇의 팔이 향신료 병에 닿을 수 있는지 등을 알아야 합니다. 수년 동안 연구자들은 로봇이 행동을 계획하는 데 도움을 줄 수 있도록 보고 읽을 수 있는 고급 컴퓨터 모델을 사용하여 이 두 가지 기술을 결합하려고 시도해 왔습니다. 그러나 지속적인 문제가 남아 있었습니다. 만약 로봇이 주방을 보았을 때 필요한 모든 것을 볼 수 없다면 어떻게 될까요? 만약 중요한 재료가 닫힌 서랍 안에 숨겨져 있거나, 아예 존재하지 않는다면, 로봇은 자신의 학습 데이터에서 알고 있는 것을 바탕으로 추측할 수도 있습니다. 로봇은 존재하지 않는 당근을 집으려고 계획할 수 있으며, 이는 작업 실패나 빈 공간을 계속 잡으려고 시도하는 혼란스러운 기계로 이어질 수 있습니다.

와세다 대학교와 플린더스 대 университета의 연구진은 로봇이 뛰어들기 전에 먼저 살펴보도록 강제하는 새로운 해결 방법을 제ように 제시했습니다. '증거 획득 및 실행 가능성 게이팅(Evidence Acquisition and Feasibility Gating)'이라 불리는 이 접근 방식은 작업 순서를 변경합니다. 로로봇이 추측을 바탕으로 즉시 요리를 시작하는 대신, 먼저 호기심 많은 탐험가처럼 행동하도록 프로그래밍됩니다. 로봇은 정보를 수집하기 위한 목적으로만 설계된 작고 안전한 작업들을 수행하도록 설정되는데, 예를 들어 닫힌 캐비닛을 열거나 시야를 가로막고 있을지도 모르는 상자를 치우는 것 등이 있습니다. 로봇이 이러한 행동을 수행하면, 시스템은 장면의 새로운 사진을 찍습니다. 강력한 시각-언어 모델이 이 새로운 시각적 증거를 검토하여 다음 단계를 결정합니다. 시스템은 다음과 같은 단순하지만 결정적인 질문을 던집니다. "이제 요리 작업을 계획할 충분한 증거를 확보했는가?" 만약 답이 '예'라면, 로봇은 전체 요리 과정을 계획하는 단계로 넘어갑니다. 만약 답이 '아니오'이지만 여전히 살펴볼 곳이 남아 있다면, 로봇은 다시 탐색 단계로 돌아갑니다. 만약 답이 '아니오'이고 필요한 물건이 없다는 것이 명확해지면, 로봇은 없는 것을 사용하려고 시간을 낭비하는 대신 동작을 완전히 멈춥니다.

연구진은 실제 가정의 복잡성을 모방하여 설계된 시뮬레이션 주방 환경에서 이 방법을 테스트했습니다. 로봇은 단일 팔을 부여받았으며, 재료를 찾고, 가스레인지를 사용하고, 다양한 용기를 관리하는 과정이 포함된 치킨 수프 만들기 과제를 맡았습니다. 연구진은 증거를 먼저 확인하지 않는 기존 방식과 비교하여 이 새로운 시스템이 어떻게 수행되는지 확인하기 위해 세 가지 뚜렷한 시나리오를 설정했습니다. 첫 번째 시나리오에서는 필요한 모든 아이템이 존재하며 지시 사항에 명확히 나열되어 있었습니다. 여기서 새 시스템은 표준 방식과 동일한 성능을 보여주었으며, 이는 확인을 위한 추가 단계를 넣는 것이 로봇을 느려지게 하거나 혼란스럽게 하지 않는다는 것을 입증했습니다. 진짜 차이점은 두 번째 시나리오에서 나타났습니다. 로봇에게 소금이나 후추를 사용하라는 말 없이 그냥 "치킨 수프를 만들어라"라는 모호한 지시가 내려졌습니다. 기존 방식으로는 로봇이 숨겨진 양념을 찾아야 한다는 것을 알지 못했기 때문에 성공하는 경우가 드물었습니다. 하지만 증거 수집 방식을 사용하자, 로봇은 캐비닛을 열고 소금과 후추를 찾아내어 40%의 실험에서 레시피를 완수했으며, 이는 기준 모델에 비해 상당한 개선입니다.

세 번째 시나리오는 작업이 불가능할 때를 인식하는 시스템의 능력을 테스트했습니다. 로봇에게 소금, 후추, 당근을 넣어 수프를 만들라는 지시를 내렸으나, 당근은 주방에 없었습니다. 표준 시스템은 종-종 누락된 당근을 찾거나 사용하려고 반복적으로 시도하며 시간과 에너지를 낭비하는 루프에 빠지곤 했습니다. 그러나 새 시스템은 멈추는 법을 배웠습니다. 당근이 있을 법한 장소들을 적극적으로 탐색하고 아무것도 발견하지 못함으로써, 로봇의 내부 게이트는 중단 결정을 내렸습니다. 이러한 테스트에서, 한 모델은 90%, 다른 모델은 100%의 확률로 올바르게 멈췄으며, 누락된 채소를 잡으려는 실패 횟수를 획기적으로 줄였습니다. "나는 이것을 할 수 없다"라고 말하는 능력은 성공하는 능력만큼이나 중요하며, 이는 로봇이 잘못된 가정에 근거하여 행동하는 것을 방지합니다.

연구진은 자신들의 방법이 완벽하지 않다는 점을 인정합니다. 이 방법은 문을 열거나 물건을 움직여 더 나은 시야를 확보할 수 있는 로봇의 능력에 의존합니다. 만약 로봇이 기계적 문제나 물리적 제약으로 인해 캐비닛을 여는 데 실패한다면, 물건이 그곳에 있더라도 필요한 증거를 찾지 못할 수 있습니다. 그럼에도 불구하고, 이 연구는 불확실한 환경에서 작동해야 하는 로봇을 위한 명확한 경로를 보여줍니다. 최종 계획 단계 이전에 능동적인 정보 수집 단계를 삽로 넣음으로써, 시스템은 로봇의 행동이 단순히 추측하는 것이 아니라 실제로 볼 수 있는 것에 근거하도록 보장합니다. 이러한 '추측'에서 '검증'으로의 전환은 로봇이 인간의 공간이 가진 무질서하고 불완전한 현실을 더 효과적으로 다룰 수 있게 하며, 식사 준비부터 방 정리까지 다양한 작업에서 더욱 신뢰할 수 있는 파트너가 되게 합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →