← 최신 논문
🤖 AI

Grounding LTL Tasks in Sub-Symbolic RL Environments for Zero-Shot Generalization

본 논문은 에이전트가 기호와 관측값 간의 매핑에 대한 사전 지식 없이도 비기호적 환경에서 선형 시제 논리(Linear Temporal Logic) 지침을 따를 수 있도록, 뉴럴 리워드 머신(Neural Reward Machines)을 사용하여 다중 작업 강화 학습 정책과 기호 접지기(symbol grounder)를 공동 학습시키는 방법을 제안하며, 이를 통해 기존 방식보다 뛰어난 제로샷 일반화 성능을 달성한다.

원저자: Matteo Pannacci, Andrea Fanti, Elena Umili, Roberto Capobianco

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Matteo Pannacci, Andrea Fanti, Elena Umili, Roberto Capobianco

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

로봇이 한 번도 본 적 없는 방에 들어가는 상황을 상상해 보십시오. 로봇은 커피 머신, 책상, 그리고 우편함 투입구를 봅니다. 하지만 로봇에게 이것들은 그저 화면 위의 모양과 색깔일 뿐입니다. 로봇은 이 기계가 커피를 위한 것이라거나, 저 구멍이 우편물을 위한 것이라는 사실을 알지 못합니다. 이제 인간이 로봇에게 복잡한 지시를 내린다고 가정해 봅시다. "우편함 투입구로 갔다가, 그다음 커피 머신으로 가고, 마지막으로 책상으로 가세요. 하지만 가는 길에 빨간색 바닥 타일을 밟지는 마세요." 인간에게 이것은 쉬운 일입니다. 우리는 단어의 의미와 사물을 이해하기 때문입니다. 하지만 로봇에게 이것은 거대한 퍼즐입니다. 로봇은 먼저 어떤 물체가 무엇인지 파악해야 하고, 빨간 타일을 피하면서 사건의 순서를 기억해야 하며, 동시에 움직이는 법도 배워야 합니다. 이것이 바로 인공지능에게 현실 세계에서 지시를 따르는 법을 가르치는 과제입니다. 현실에서는 사물의 이름이 무엇인지 적힌 미리 만들어진 사전이 주어질 수 없기 때문입니다.

수십 년 동안 연구자들은 로봇에게 세상의 완벽한 지도를 제공하여, 어떤 픽셀이 "커피"나 "우편물"에 해당하는지 정확히 알려주는 방식으로 이 문제를 해결하려 노력해 왔습니다. 이 방식은 통제된 실험실에서는 작동하지만, 무질서하고 예측 불가능한 실제 세상에서는 실패합니다. 최근 연구에서 상세히 다뤄진 새로운 접근 방식은 로봇이 움직임을 배우는 동시에 스스로 이러한 의미들을 학습하도록 가르치는 방법을 시도합니다. 과학자들은 시간과 순서가 포함된 특정 유형의 지시, 즉 '시간 논리(temporal logic)'에 집중했습니다. 이것은 단순히 "지점 X로 가라"고 말하는 대신, "A를 하고, 그다음 B를 하되, 절대로 C는 하지 마라"와 같은 규칙을 작성하는 방법이라고 생각하면 됩니다. 목표는 로봇이 사물이 무엇인지 전혀 모르는 상태에서, 오직 카메라 피드와 성공 또는 실패 시의 간단한 신호만을 사용하여 이러한 복잡하고 시간 기반적인 규칙을 따를 수 있는지 확인하는 것이었습니다.

연구진은 로봇이 두 가지를 동시에 배우는 시스템을 구축했습니다. 첫째, 로봇은 '정책(policy)', 즉 다음에 어떤 행동을 할지 결정하는 전략을 배웁니다. 둘째, 더 중요한 것은 '그라운더(grounder)'를 배운다는 점입니다. 그라운더는 번역기 역할을 하는 구성 요소로, 카메라로부터 들어오는 가공되지 않은 이미지가 지시 사항의 관점에서 무엇을 의미하는지 파악하려고 노력합니다. 만약 로봇이 빨간 사각형을 보고 지시 사항에 "빨간색을 피하라"고 되어 있다면, 그라운더는 결국 그 빨간 사각형을 "용암"이나 "위험"으로 라벨링하는 법을 배워야 합니다. 어려운 점은 로봇에게 정답을 알려주는 선생님이 없다는 것입니다. 로봇은 오직 희소한 보상(sparse reward)만을 받습니다. 즉, 작업을 올바르게 마쳤을 때 아주 작은 신호를 받고, 실패했을 때 부정적인 신호를 받을 뿐, 그 사이 과정에 대해서는 아무런 피드백을 받지 못합니다. 이는 대화 중간에 하는 말 하나하나에 대한 피드백 없이, 대화가 완전히 끝난 후에만 "예" 또는 "아니오"라는 대답만 들으며 새로운 언어를 배우는 것과 같습니다.

이 문제를 해결하기 위해 연구팀은 지시 사항의 구조를 이용한 영리한 트릭을 사용했습니다. 그들은 지시 사항을 로봇이 움직임에 따라 상태가 변하는 하나의 '기계'로 취급했습니다. 만약 로봇이 우편물을 집어 들면, 기계는 "우편물 완료, 이제 커피를 찾아라"라는 새로운 상태로 이동합니다. 연구진은 로봇의 번역기가 이 기계가 줄 보상을 예측하도록 훈련했습니다. 로봇이 움직이는 것을 관찰하고 기계가 "성공" 또는 "실패"를 알리는 것을 봄으로써, 번역기는 자신이 보는 이미지와 지시 사항의 올바른 단어를 서서히 일치시키는 법을 배웁니다. 이것은 시행착오의 과정이며, 로봇은 작업의 논리를 사용하여 기호의 의미를 스스로 가르칩니다. 연구진은 이 방식을 두 가지 매우 다른 환경에서 테스트했습니다. 하나는 로봇이 아이템들이 있는 미로를 통과해야 하는, 단순화된 비디오 게임처럼 보이는 그리드 기반 환경이었습니다. 다른 하나는 로버가 평면 위에서 자동차처럼 움직이며 특정 순서대로 색상 구역을 방문해야 하는 매끄럽고 연속적인 공간이었습니다.

결과는 이 방법이 놀라울 정도로 잘 작동한다는 것을 보여주었습니다. 그리드 월드에서 로봇은 마치 처음부터 올바른 사전을 부여받은 것처럼 거의 완벽하게 지시를 따르는 법을 배웠습니다. 로봇은 아이템을 식별하고 사건의 순서를 따르는 법을 배웠으며, 지시 사항이 더 길고 복잡해지더라도 이를 수행해 냈습니다. 연속적인 환경에서도 로봇은 높은 정확도로 구역을 식별하는 법을 배웠지만, 가장 복잡한 회피 과제에서는 약간 어려움을 겪었습니다. 결정적으로, 로봇은 별도의 훈련 단계 없이 움직임을 배우는 동시에 이러한 의미들을 학습했습니다. 이 시스템은 에이전트가 (raw data를) 통해 기호의 의미를 구현하는 법(grounding symbols)—즉, 가공되지 않은 이미지를 추상적인 개념과 연결하는 법—을 단지 과제를 해결하려고 노력하고 작업의 구조를 학습의 가이드로 사용함으로써 배울 수 있음을 입증했습니다.

또한 이 연구는 동일한 문제를 해결하려는 이전의 시도와 이 새로운 방법을 비교했습니다. 지시 사항의 문법을 바탕으로 로봇의 뇌를 조각조각 만들어 가려 했던 기존 방식은 지시 사항이 길어지면 실패했습니다. 그것은 새로운 과제의 복잡성을 감당할 수 없었습니다. 그러나 새로운 접근 방식은 효과적으로 규모를 확장하여, 사물의 의미를 배우는 것과 움직이는 전략을 배우는 것이 서로 깊게 연결되어 있으며 함께 학습되어야 한다는 것을 보여주었습니다. 연구진은 로봇이 사물을 식별하는 능력이 빠르게 향상되어, 훈련 과정 중 몇 백만 단계 이내에 높은 정확도에 도달한다는 것을 발견했습니다. 이는 작업 구조로부터 오는 간접적인 피드백이, 인간이 직접 가리키지 않더라도 로봇에게 사물이 무엇인지 가르치기에 충분하다는 것을 시사합니다.

이 시스템이 완벽한 것은 아닙니다. 특히 가장 어려운 연속 환경에서, 전체 작업 시간 동안 위험을 피하는 것이 모든 방법론에 있어 어려웠기 때문입니다. 하지만 핵심적인 발견은 명확합니다. 인공 에이전트가 자신이 모르는 세상 속에서 복잡하고 시간 기반적인 지시를 이해하도록 훈련하는 것은 가능하며, 이는 세상의 특징들의 의미를 학습하면서 동시에 과업을 완수하도록 함으로써 가능합니다. 이는 우리가 더 나아가, 로봇이 새로운 환경에 들어가서 규칙의 집합을 듣고, 마주칠 수 있는 모든 물체에 대해 미리 프로그래밍된 지도가 없더라도 무엇을 해야 할지 스스로 파악할 수 있게 만드는 데 한 걸음 더 다가갔음을 의미합니다. 이 연구는 작업의 논리와 환경에 대한 학습을 결합함으로써, 로봇이 가공되지 않은 데이터와 의미 있는 행동 사이의 간극을 메울 수 있음을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →