← 최신 논문
🤖 AI

Calculating Mutual Information between a Reward Maximizer and its Environment

이 논문은 nn개의 상태와 mm개의 행동을 가진 제어 마르코프 과정(Controlled Markov Process)에서, 최적의 결정론적 정책을 관찰하는 것이 기저의 환경에 대해 정확히 nlogmn \log m 비트의 정보를 전달한다는 것을 증명하며, 이를 통해 다양한 보상 극대화 목적 함수에 걸쳐 최적성을 위해 요구되는 암묵적 세계 모델에 대한 정밀한 정보 이론적 하한을 확립한다.

원저자: Alfred Harwood, Jose Faustino, Alex Altair

게시일 2026-07-15
📖 6 분 읽기🧠 심층 분석

원저자: Alfred Harwood, Jose Faustino, Alex Altair

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

완벽한 플레이어들의 비밀 언어

당신이 한 체스 거장을 지켜보고 있다고 상상해 보세요. 당신은 보드의 규칙도 모르고, 기물들이 어디서 시작되었는지도 모르며, 상대방이 무작위로 두는 것인지 아니면 거대한 계획을 가지고 두는 것인지도 모릅니다. 하지만 거장이 수를 거듭할수록, 당신은 심오한 사실 하나를 깨닫기 시작합니다. 그들의 완벽한 전략에는 반드시 게임의 숨겨진 지도가 포함되어 있어야 한다는 것입니다. 만약 그들이 어떤 수가 승리를 가져다줄지 정확히 알고 있다면, 그들은 기물이 어떻게 움직이고 보드가 어떻게 구성되어 있는지에 대해 무언가를 알고 있음이 틀림없습니다. 이것이 인공지능(AI) 세계의 거대한 질문의 핵심입니다. 똑똑한 에이전트가 자신이 살아가는 세상을 "이해"해야만 좋은 성과를 낼 수 있는 것일까요, 아니면 그저 성공을 향해 추측하며 나아갈 수 있는 것일까요?

이 질문에 답하기 위해 과학자들은 **상호 정보량(Mutual Information)**이라는 개념을 사용합니다. 이것은 두 사물이 서로에 대해 얼마나 많은 것을 "말해주는가"를 측정하는 척도라고 생각하면 됩니다. 날씨를 알면 사람들이 우산을 쓰고 있을지 아는 데 큰 도움이 되므로, 두 요소 사이의 상호 정보량은 높습니다. 반면 누군가의 신발 사이즈를 안다고 해서 그 사람이 아침으로 무엇을 먹었는지 알 수는 없으므로, 상호 정보량은 낮습니다. AI 연구에서 연구자들은 다음과 같은 점을 알고 싶어 합니다. 만약 우리가 AI의 완벽한 행동을 목격한다면, 그 행동은 그가 속한 세상의 숨겨진 규칙에 대해 얼마나 많은 정보를 드러내는가? AI는 자신의 뇌 속에 거대하고 상세한 "세계 모델"을 품고 있어야 할까요, 아니면 아주 작고 모호한 힌트만으로도 충분할까요? 이 논문은 AI의 완벽한 전략을 일단 열면 그 안에 담긴 정밀한 양의 비밀 데이터를 드러내는 잠긴 상자로 취급하며 이 질문을 파고듭니다.

논문의 거대한 발견: 완벽한 지도

이 새로운 연구에서 Dovetail Research와 상파울루 대학교의 연구팀은 "역공학(reverse engineering)" 게임을 하기로 했습니다. 그들은 단순하지만 까다로운 질문을 던졌습니다. 만약 우리가 AI 에이전트가 완벽한 보상 극대화 도구(즉, 항상 가능한 최고의 점수를 얻는 존재)로서 행동하는 것을 본다면, 그 완벽한 행동 안에 환경에 대한 정보가 얼마나 숨겨져 있는가?

이를 알아내기 위해, 그들은 거대한 다방실 미로와 같은 세상을 가정했습니다. 이 미로는 nn개의 서로 다른 방(상태)과, 에이전트가 각 방에서 선택할 수 있는 mm개의 서로 다른 문(행동)을 가지고 있습니다. 반전은 무엇일까요? 연구자들은 "최대의 무지" 상태에서 시작했습니다. 그들은 어떤 문이 어디로 연결되는지 알지 못했습니다. 모든 가능한 문들의 연결 방식은 마치 모든 셔플이 서로 다른 세상을 만드는 카드 덱처럼 동일하게 발생할 가능성이 있었습니다.

그다음, 그들은 AI를 관찰했습니다. 그들은 AI가 특정한 결정론적 계획을 찾아냈음을 보았습니다. "내가 1번 방에 있다면, A 문을 연다. 내가 2번 방에 있다면, B 문을 연다"와 같은 식입니다. 결정적으로, 이 계획은 특정 목표(예: 금화를 가장 많이 모으는 것)를 달est하기 위한 유일한 방법이었습니다.

연구팀은 놀라운 수학적 사실을 증명했습니다. 당신이 이 특정한 계획이 완벽한 것이라는 사실을 배우는 순간, 당신은 미로에 대해 정확히 nlogmn \log m 비트의 정보를 즉시 알게 된다는 것입니다.

이것이 무엇을 의미하는지 재미있는 비유로 풀어보겠습니다. 미로가 거대한 도서관이고, 그곳에 nn개의 선반이 있다고 상상해 보세요. 각 선반에는 당신이 꺼낼 수 있는 mm개의 서로 다른 책이 있습니다. "완벽한 계획"은 마치 모든 선반에서 최고의 이야기를 찾기 위해 어떤 책을 꺼내야 하는지 정확히 아는 사서와 같습니다. 연구자들은 이 사서의 완벽한 선택 목록이 하나의 열쇠 역할을 한다는 것을 보여주었습니다. 그것은 단지 한 가지를 알려주는 것이 아니라, 도서관의 연결 관계에 대해 정보를 제공하여 가능성을 특정 정보량의 규모로 좁혀줍니다.

숫자 nlogmn \log m은 그 비밀의 "크기"입니다.

  • nn은 당신이 있을 수 있는 장소의 수입니다.
  • mm은 각 장소에서 가질 수 있는 선택의 수입니다.
  • logm\log mmm개의 옵션 중 하나를 선택하는 데 필요한 정보량입니다.

따라서, 3개의 방이 있고 각 방에 2개의 문이 있다면, 완벽한 전략은 3×log(2)3 \times \log(2) 비트의 정보를 담고 있습니다. 만약 100개의 방과 10개의 문이 있다면, 전략은 100×log(10)100 \times \log(10) 비트의 정보를 담고 있습니다. 논문은 이 숫자가 대다수의 경우에 정확하며, 정책(policy)에 담긴 정보의 정밀한 하한선을 나타낸다는 것을 증명합니다.

이것이 왜 중요한가 (그리고 무엇을 배제하는가)

이 발견은 중요한 이유가 있습니다. 완벽한 에이전트가 얼마나 많은 "세계 지식"을 간접적으로라도 가지고 있어야 하는지에 대한 엄격한 하한선을 설정하기 때문입니다. 이는 당신이 자신의 세상이 어떻게 돌아가는지에 대한 특정 양의 정보를 암묵적으로 알지 못하고서는 완벽한 보상 극대화자가 될 수 없음을 시사합니다.

이 논문은 또한 자신들이 말하지 않는 것에 대해서도 매우 신중합니다. 연구진은 AI가 머릿속에 인간과 같은 거대한 3D 모델을 가지고 있다고 주장하는 것이 아닙니다. AI가 그림으로 "생각"한다고 말하는 것도 아닙니다. 대신, AI의 행동이 세계 모델과 동일한 양의 정보를 포함하고 있다고 말합니다. 그 정보는 그것이 복잡한 신경망에 저장되어 있든, 단순한 조회 테이블(lookup table)에 있든, 혹은 마법의 블랙박스에 있든 상관없이 그곳에 존재합니다. 논문은 정보의 내용이 어떻게 구축되었든 관계없이 그 정보의 양이 nlogmn \log m 비트로 고정되어 있음을 증명합니다.

연구진은 또한 다양한 유형의 "게임"에 걸쳐 이 아이디어를 테스트했습니다. 그들은 다음을 살펴보았습니다:

  1. 짧은 게임: 에이전트가 정해진 단계 내에서 최고의 점수를 얻으려고 노력하는 경우.
  2. 긴 게임: 에이전트가 영원히 플레이하지만, 즉각적인 보상(할인된 보상)을 더 중요하게 여기는 경우.
  3. 끝없는 게임: 에이전트가 영원히 플레이하며 시간 경과에 따른 평균 점수를 중요하게 여기는 경우.

이 모든 경우에 수학적 원리는 유지되었습니다. 목표가 (에이전트가 처한 위치에 기반한 것이지, 어떤 이상하고 무작위적인 규칙에 기반한 것이 아니라면) 최고의 점수를 얻는 것이라면, 완벽한 전략은 항상 환경의 비밀인 정확히 nlogmn \log m 비트를 드러냅니다. (수학적으로 무시할 수 있는 아주 작은 예외 케이스들은 제외하고 말입니다.)

"동일한 부피"의 비밀

그들은 어떻게 이것을 증명했을까요? 그들은 영리한 기하학적 트릭을 사용했습니다. 가능한 모든 미로의 공간을 거대한 다차원 덩어리(blob)라고 상상해 보세요. 연구진은 이 덩어리를 어떤 전략이 최선인지에 따라 조각냈을 때, 모든 전략이 덩어리의 정확히 동일한 크기의 조각을 차지한다는 것을 보여주었습니다.

이것을 거대한 피자를 mnm^n개의 조각으로 자르는 것에 비유해 보세요 (nn개의 방 각각에 mm개의 선택지가 있으므로). 무작위로 피자를 고른다면, 어떤 특정 조각이든 다른 조각만큼이나 "최선"의 조각이 될 확률이 동일합니다. 모든 조각의 크기가 같기 때문에, 완벽한 전략을 관찰함으로써 당신이 어떤 조각에 있는지 알게 되는 것은 불확실성을 정확한 양, 즉 조각 개수의 로그 값만큼 줄여줍니다. 이 계산이 바로 nlogmn \log m이라는 결과로 직접 이어집니다.

논문은 이에 대해 엄격합니다. 그들은 거의 모든 가능한 미로(여러 전략이 완벽하게 동률을 이루는 수학적으로 무시할 수 있는 아주 작은 예외 케이스들은 제외하고)에 대해 정확히 하나의 완벽한 전략이 존재함을 증명했습니다. 그리고 "최선의" 전략이 가능한 모든 전략 중 어느 것이든 될 확률이 동일하기 때문에, 정보 획득량은 일정하며 계산 가능합니다.

향에 대하여

저자들은 자신들 연구의 한계를 솔직하게 밝히고 있습니다. 그들은 오직 현재 위치를 바탕으로 하나의 결정을 내리는 에이전트(결정론적, 무기억 정책)만을 살펴보았습니다. 동전을 던져 결정하는 에이전트(확률적 정책)나 전체 이력을 기억하는 에이전트는 다루지 않았습니다. 또한 방 전체를 볼 수 없는 에이전트(부분 관측 가능 환경)도 고려하지 않았습니다.

하지만 그들이 연구한 특정한 유형의 완벽하고 명확한 시야를 가진 에이전트에 대해서는 답이 명확합니다: 완벽해지기 위해서는, 당신은 세상의 비밀인 정확히 nlogmn \log m 비트를 지니고 있어야 합니다. 이것은 훌륭한 성과가 단순히 운이 아니라, 숨겨진 지도의 반영이며, 우리는 이제 그 지도가 얼마나 큰지 정확히 측정할 수 있다는 수학적 증명입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →