From Optimal Actions to World Models: Identifiability of Transition Kernels in Discounted MDPs
이 논문은 최적 행동만을 통해 할인된 마르코프 결정 과정(discounted Markov decision processes) 내 전이 커널(transition kernels)의 식별 가능성을 규명하며, 상태-행동 보상은 구별 불가능한 고차원적 가족군을 남기는 반면, 다음 상태에 의존하는 보상은 일반적으로 전이 커널의 완전한 회복을 허용하고 상태 전용 보상은 훨씬 더 적은 정보를 제공한다는 점을 입증한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 로봇에게 미로를 통과하는 법을 가르치려 한다고 상상해 보세요. 지도를 보여주는 대신, 당신은 서로 다른 목표를 주었을 때 로봇이 어떻게 행동하는지 관찰하기만 합니다. 예를 들어, 당신이 "치즈를 찾아라"라고 말하면 로봇은 왼쪽으로 달려갑니다. 그다음 "배터리를 찾아라"라고 말하면 오른쪽으로 달려갑니다. 이것이 바로 인공지능의 한 분야인 **강화 학습(Reinforcement Learning)**의 세계입니다. 여기서 에이전트는 '보상'을 극대화하기 위해 시행착오를 거치며 학습합니다.
이 세계에서 에이전트가 알아야 할 두 가지 핵심 요소가 있습니다. 바로 무엇을 할 것인가(전략)와 다음에 어떤 일이 일어날 것인가(세상의 물리 법칙)입니다. '무엇을 할 것인가'는 눈에 잘 보입니다. 로봇의 선택을 관찰하면 되니까요. 하지만 '다음에 어떤 일이 일어날 것인가'는 전이 모델(transition model), 즉 "여기서 이 버튼을 누르면 70%의 확률로 구덩이에 빠지고, 30%의 확률로 보물을 발견한다"라고 말해주는 확률적인 비밀 지도입니다. 보통 우리는 모든 가능한 목표에 대해 로봇의 완벽한 전략을 알고 있다면, 그 비밀 지도를 역설계할 수 있다고 가정합니다. 하지만 만약 로봇이 너무 유능해서 우리로부터 지도를 숨기고 있다면 어떨까요? 만약 완전히 다른 두 개의 지도가 똑같은 최적의 선택들을 만들어낸다면 어떨까요? 이 논문은 까다로운 질문을 던집니다. 승자의 움직임을 관찰하는 것만으로 게임의 진짜 규칙을 결코 알 수 없는 것일까?
거대한 지도의 미스터리
당신이 비디오 게임이 어떻게 작동하는지 알아내려는 탐정이라고 상상해 보세요. 하지만 당신은 게임 코드를 볼 수 없습니다. 오직 스피드러너(speedrunner)가 게임을 완벽하게 플레이하는 모습만을 볼 수 있습니다. 그 스피드러너는 최고 점수를 얻기 위해 매 순간 어떤 버튼을 눌러야 하는지 정확히 알고 있습니다.
논문은 이렇게 묻습니다. 만약 당신이 가능한 모든 보상 시나리오(코인 찾기, 용암 피하기, 열쇠 수집하기 등)에 대해 이 스피드러너가 플레이하는 것을 관찰한다면, 게임의 물리 법칙을 알아낼 수 있을까요? "점프" 버튼을 누르면 캐릭터가 5피트 위로 튀어 오르는지, 아니면 10피트 위로 튀어 오르는지 확신할 수 있을까요?
이 연구의 답변은 놀랍게도 **"아니요, 항상 그런 것은 아닙니다"**입니다.
저자인 닐 바트라(Neal Batra)는 당신이 모든 가능한 보상 상황에 대해 완벽한 움직임을 만들어내는 완전히 다른 두 개의 게임 엔진(두 개의 서로 다른 '전이 커널' 또는 세상이 작동하는 방식의 지도)을 가질 수 있음을 증명합니다. 이는 마치 미로의 벽과 함정의 배치는 다르더라도, 출구로 가는 경로 자체는 동일해 보이는 두 개의 서로 다른 미로를 가진 것과 같습니다.
세 가지 종류의 단서
이 논문은 로봇에게 보상을 주는 세 가지 서로 다른 방식을 테스트하며, 각 단서가 얼마나 많은 진실을 드러내는지 보여줍니다.
1. "행동" 단서 (상태-행동 보상, State-Action Rewards)
가장 흔한 시나리오입니다. 당신은 로봇에게 "주방에 있고 숟가락을 집으면 10점을 얻는다"라고 말합니다.
논문에 따르면, 모든 방에 있는 모든 숟가락, 포크, 칼에 대해 로봇의 완벽한 선택을 알고 있다 하더라도, 여전히 정확한 지도를 특정할 수는 없습니다. 로봇에게는 똑같아 보이는 다양한 지도들이 존재합니다.
- 마술의 트릭: 저자는 이러한 서로 다른 지도들이 수학적인 "마법 렌즈"(L이라 불리는 행렬)에 의해 연결되어 있음을 보여줍니다. 이 렌즈를 통해 세상을 보면 확률은 변하지만, 로봇의 최선의 선택은 그대로 유지됩니다.
- 미스터리의 규모: 로봇이 있을 수 있는 장소가 개라면, 숨겨진 지도들의 거대하고 매끄러운 가족(family)이 존재합니다. 구체적으로는 개의 자유 차원을 가진 가족입니다. 이는 문(door)의 위치만 유지한다면 방의 벽을 칠하는 방법이 무수히 많은 것과 같습니다. 로봇의 선택지가 많아질수록(행동이 많아질수록) 진실을 숨기기는 어려워지지만, 여전히 숨기는 것이 가능합니다.
2. "다음 단계" 단서 (전이 의존 보상, Transition-Dependent Rewards)
이제 당신이 로봇이 도착한 곳을 기준으로 보상을 줄 수 있다고 상상해 보세요. "버튼을 눌러서 빨간 타일 위에 착지하면 100점을 얻는다."
이것은 훨씬 더 강력한 단서입니다. 도착 지점을 직접적으로 보상할 수 있기 때문에, 게임의 물리 법칙을 훨씬 더 엄격하게 테스트할 수 있습니다.
- 결과: 로봇이 방 안에서 최소 두 가지 이상의 선택을 할 수 있다면, 당신은 대개 정확한 지도를 파악할 수 있습니다. 오직 로봇이 선택할 수 있는 움직임이 하나뿐인 방에 있을 때만 불가능합니다. 이 경우 로봇은 선택권이 없으므로 물리 법칙이 다른지 테스트할 수 없습니다. 하지만 선택지가 생기는 즉시, "다음 단계" 단서는 게임이 매우 특이하고 드문 방식으로 조작되지 않는 한 진정한 지도를 드러냅니다.
3. "상태" 단서 (상태 보상, State Rewards)
마지막으로, 당신이 무엇을 하든 상관없이 "주방에 있으면 10점을 얻는다"라고만 말할 수 있다고 상상해 보세요.
이것은 가장 약한 단서입니다. 마치 로봇에게 "어떤 버튼을 누를지는 말하지 않고, 그냥 주방에 있으면 행복해져라"라고 말하는 것과 같습니다.
- 결과: 이 방식은 가장 적은 정보를 드러냅니다. 완전히 다른 두 개의 지도가 이 규칙 아래에서는 동일해 보일 수 있습니다. 논문은 이러한 단순한 보상에 대한 로봇의 선택을 아는 것만으로는 많은 서로 다른 세계들을 구별하기에 충분하지 않음을 증명합니다.
진실의 계층 구조
논문은 이러한 발견들을 명확한 지식의 사다리로 정리합니다.
- 전이 보상 (도착 지점을 보상함)이 가장 강력합니다. 이는 대개 정확한 지도를 밝혀낼 수 있습니다.
- 행동 보상 (선택을 보상함)은 중간 단계입니다. 이는 행동들이 서로 어떻게 비교되는지는 알려주지만, 여러 가지 가능한 지도들이라는 "안개"를 남깁니다.
- 상태 보상 (위치를 보상함)은 가장 약합니다. 이는 가장 많은 안개를 남겨, 많은 서로 다른 지도들을 똑같아 보이게 만듭니다.
이것이 왜 중요한가
당신은 "그래서 뭐? 로봇이 옳은 움직임을 한다면, 지도가 왜 중요한데?"라고 생각할 수도 있습니다.
논문은 단순히 이기는 것 이외의 목적을 위해서도 지도가 중요하다고 주장합니다. 만약 다음에 어떤 일이 일어날지 예측하거나, 재난 상황을 시뮬레이션하거나, 혹은 "내가 만약 다른 행동을 했다면 어땠을까?"(반사실적 추론, counterfactuals)라고 묻고 싶다면, 현재의 게임에만 유효한 지도가 아니라 진짜 지도가 필요합니다.
이 연구는 최선의 움직임을 아는 것이 세상의 규칙을 안다는 것을 보장하지 않는다는 점을 입증합니다. 당신은 천재처럼 행동하는 완벽한 에이전트를 가질 수 있지만, 그 에이전트의 내부적인 현실 이해는 완전히 틀릴 수 있습니다. 이는 AI의 세계에서, 옳은 일을 한다는 것이 반드시 그 일이 '왜' 옳은지, 혹은 그 밑바닥에 실제 세상이 어떤 모습인지 이해하고 있다는 것을 의미하지는 않는다는 점을 상기시켜 줍니다.
저자는 단순히 추측하는 것이 아니라 수학적 증명을 제공합니다. 그들은 로봇을 속이는 "가짜" 지도들을 어떻게 만드는지 정확히 보여주며, 이러한 가짜 지도들이 얼마나 존재하는지 계산합니다. 이는 확실히 증명된 사실입니다. 보물로 가는 경로는 같을지 몰라도, 발밑의 지형은 무엇이든 될 수 있습니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.