Bridging Learned Visual Perception and Symbolic Belief-Space Planning
이 논문은 시각적 인식의 불확실성을 기호적 상태에 대한 확률 분포로 포착하는 새로운 "VLM-as-probabilistic-grounder" 패러다임을 도입하며, 이를 통해 부분 관측 가능한 환경에서 기존의 결정론적 방식보다 뛰어난 성능을 보이는 강건한 믿음 공간 계획(belief-space planning)을 가능하게 한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
로봇이 어질러진 거실을 정리하려고 노력하는 모습을 상상해 보십시오. 로봇은 탁자 위의 책과 방 건너편의 선반을 보지만, 카메라가 흔들리고 조명은 어둡습니다. 현실 세계에서 로봇의 시야는 결코 완벽하지 않습니다. 로봇은 모든 것을 한 번에 볼 수 없습니다. 물체는 가구 뒤에 숨어 있고, 센서는 자신이 보고 있는 것을 오해하기도 합니다. 로봇이 안전하고 효과적으로 행동하기 위해서는 자신이 무엇을 모르는지 인정해야 합니다. 만약 물체의 위치를 잘못 추측한다면, 존재하지 않는 것을 잡으려 하거나, 더 심하게는 들고 있지 않은 물체를 놓으려 할 수도 있습니다. 이러한 불확실성은 기계가 우리의 복잡하고 예측 불가능한 가정을 항해하도록 가르치는 데 있어 가장 큰 장애물입니다.
수년 동안 연구자들은 로봇에게 사진을 보고 무엇이 진실인지 즉각 결정할 수 있는 '두뇌'를 부여함으로써 이 문제를 해결하려 노력해 왔습니다. 그들은 이미지와 언어를 모두 이해하는 강력한 인공지능 모델을 사용합니다. 아이디어는 간단했습니다. 로봇에게 사진을 보여주고 "캐비닛이 열려 있습니까?"라고 묻는 것입니다. 만약 모델이 "예"라고 답하면, 로봇은 그것을 절대적인 사실로 간주하고 다음 동작을 계획합니다. 하지만 실제로 이 접근 방식은 취약합니다. 모델이 실수할 때(물체가 가려져 있거나 시야가 불분명할 때 자주 발생합니다), 로봇은 거짓말에 기반한 계획을 따르게 됩니다. 로봇은 이미 열려 있는 문을 열려고 몇 분 동안 시간을 허비하거나, 더 심하게는 작업이 불가능하다고 생각하여 아예 포기해 버릴 수도 있습니다. 핵심 문제는 이러한 시스템이 불확실한 추측을 확실한 사실로 취급하여 오류에 대한 여지를 남겨두지 않는다는 점입니다.
이스라엘 테크니온(Technion)의 연구팀은 이 문제에 대해 다른 방식으로 생각할 것을 제안했습니다. 로봇에게 세상에 대해 단 하나의 경직된 추측을 강요하는 대신, 여러 가능성을 동시에 염두에 두도록 가르친 것입니다. 그들은 이를 RoVLaP라고 부릅니다. 이 시스템은 인공지능 모델에게 "책이 탁자 위에 있다" 또는 "책이 탁자 위에 없다"라고 말하라고 요구하는 대신, 각 시나리오가 얼마나 일어날 법한지를 말하라고 요청합니다. 예를 들어, 책이 탁자 위에 있을 확률이 60%, 서랍 안에 숨겨져 있을 확률이 40%라고 말할 수 있습니다. 이러한 확률을 유지함으로써, 로봇은 불확실성을 인정하는 세상에 대한 '믿음'을 구축할 수 있습니다. 로봇은 단순히 가장 가능성 높은 시나리오만을 위해 계획을 세우는 것이 아니라, 여러 가능한 시나리오를 동시에 고려하여 계획을 세웁니다.
연구진은 가상의 가구, 서랍, 물체들로 가득 찬 디지털 세계인 시뮬레이션된 가정 환경에서 이 아이디어를 테스트했습니다. 그들은 로봇에게 책을 선반에 정리하거나, 서랍을 정리하거나, 문을 잠그는 것과 같은 일반적인 가사 노동 과제를 부여했습니다. 이 테스트에서 로봇은 숨겨진 물체의 위치에 대한 특별한 지식 없이 오로지 카메라가 볼 수 있는 것에만 의존해야 했습니다. 그들은 이 새로운 방식과 두 가지 다른 일반적인 접근 방식을 비교했습니다. 하나는 AI 모델이 로봇에게 단계별로 직접 지시하는 방식이고, 다른 하나는 모델이 표준 플래너가 사용할 수 있도록 방에 대한 단 하나의 고정된 설명을 제공하는 방식입니다.
결과는 새로운 접근 방식의 명확한 우위를 보여주었습니다. 시뮬레이션 테스트에서 표준 방식들은 로봇의 시야가 가려지거나 오도될 때 자주 완전히 실패했습니다. 예를 들어, 그릇이 닫힌 캐비닛 안에 숨겨져 있는 과제에서, 표준 로봇은 그릇이 보일 것이라고 가정하고 즉시 잡으려 시도하다가 매번 실패했습니다. 그러나 새로운 시스템은 그릇이 숨겨져 있을 수 있다는 점을 인식했습니다. 이 시스템은 먼저 캐비닛을 여는 과정을 포함하는 일련의 행동을 계획했습니다. 이 단 한 번의 변화가 표준 방식이 실패한 상황에서 로봇이 성공할 수 있게 해주었습니다. 어려운 과제에서 새로운 시스템은 66.7%의 문제를 해결한 반면, 표준 "그라운더(grounder)" 방식은 하나도 해결하지 못했습니다. 중간 난이도의 과제에서 이 시스템은 표준 방식에 비해 성공률을 160% 이상 향상시켰습니다.
단순히 더 많은 과제를 해결하는 것을 넘어, 이 새로운 시스템은 더 효율적이었습니다. 처음부터 불확실성을 고려하여 계획을 세웠기 때문에, 실수를 덜 저질렀고 계획을 재시작해야 하는 횟수도 적었습니다. 표준 방식들은 종-종 멈춰서 자신들이 틀렸음을 깨닫고 다시 시도해야 했기에 시간과 에너지를 낭비했습니다. 반면 새로운 시스템은 초기 혼란을 처리할 수 있을 만큼 견고한 계획을 생성하여 다시 생각하기 위해 멈출 필요 없이 움직였습니다. 로봇은 첫 번째 추측이 틀릴 가능성에 대비하고 만약을 위한 백업 계획을 준비하며, 일종의 신중한 자신감을 가지고 움직였습니다.
연구진은 또한 이 방법이 수학적으로 타당하다는 것을 증명했습니다. 그들은 인공지능 모델이 무작위 추측보다 조금이라도 더 낫다면, 로봇이 관찰과 믿음 업데이트를 지속할 경우 결국 세상의 실제 상태를 파악하게 될 것임을 보여주었습니다. 이 시스템은 모델이 완벽할 것을 요구하지 않습니다. 단지 동전 던지기보다 일관되게 나은 수준이면 충분합니다. 시간이 흐름에 따라 로봇이 더 많은 시각적 증거를 수집하면 불확실성은 줄어들고 계획은 더욱 정밀해집니다. 이는 안전망을 제공합니다. 설령 로봇이 잘못된 생각을 가지고 시작하더라도, 시스템은 충돌하거나 멈추지 않고 스스로를 수정하도록 설계되었습니다.
이 연구는 자율 에이전트를 구축하는 방식의 변화를 나타냅니다. 로봇이 행동하기 위해 진실을 알아야 한다는 생각에서 벗어나, 불확실할 때도 현명하게 행동할 수 있다는 방향으로 나아가는 것입니다. 세상을 단 하나의 고정된 현실이 아닌 일련의 가능성으로 다룸으로써, 로봇은 더 적응력이 높고 신뢰할 수 있게 됩니다. 시뮬레이션된 가정에서 이는 숨겨진 물체를 볼 수 없을 때 포기하는 로봇과, 인내심 있게 캐비닛을 열어 그것을 찾아내는 로봇 사이의 차이를 의미했습니다. 빛이 변하고, 물체가 움직이며, 시야가 가려지는 실제 가정으로 로로봇이 이동함에 따라, 미지의 것을 계획하는 이 능력은 그들을 진정으로 유용한 동반자로 만드는 핵심이 될 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.