← 최신 논문
📈 economics

Rationalizing Boltzmann Rationality: An Axiomatic Characterization of Entropy-Regularized Policies

이 논문은 환경적 우연과 행위자의 선택을 구분함으로써 표준 소프트맥스 정책과 마르코프 결정 과정 공리 사이의 이론적 긴장을 해결하며, 선택 노드에 무관한 대안의 독립성과 단조성을 부과하는 것이 행위자가 자신의 선택 능력을 가치 있게 여기는지 여부를 반영하는 규범적 설계 선택으로서 볼츠만 정책과 엔트로피 정규화된 표현을 유일하게 도출함을 입증한다.

원저자: Silviu Pitis

게시일 2026-07-21
📖 6 분 읽기🧠 심층 분석

원저자: Silviu Pitis

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

당신이 선택으로 가득 찬 세상을 항해하는 법을 배워야 하는 로봇의 뇌를 만들고 있다고 상상해 보십시오. 컴퓨터 과학의 세계에서 이 분야는 강화 학습(Reinforcement Learning)이라고 불리며, 이는 에이전트(로봇이나 게임을 하는 AI와 같은)가 최고의 보상을 얻기 위해 결정을 내리는 법을 가르치는 것에 관한 것입니다. 이를 위해 에이전트는 자신이 알고 있는 것이 효과적이라는 것을 고수하는 것(exploitation, 착취)과, 그것보다 더 나은 것이 있는지 확인하기 위해 새로운 것을 시도하는 것(exploration, 탐색) 사이에서 균형을 잡아야 합니다. 이를 위해 수십 년 동안 이 "새로운 것을 시도하는" 방식을 다루는 표준적인 방법은 **소프트맥스(softmax)**라고 불리는 수학적 레시피였습니다. 이것은 마치 요리사가 수프에 각 재료를 얼마나 넣을지 결정하는 것과 같습니다. 만약 한 재료가 약간 더 맛이 좋다면 요리사는 그것을 조금 더 넣겠지만, 다른 재료들을 완전히 무시하지는 않습니다. 이 레시피는 너무나 흔해서 거의 모든 현대 AI 시스템의 기본 설정입니다. 하지만 여기에는 미스터리가 있습니다. 모두가 이 레시피를 사용하고 있지만, 왜 이것이 처음부터 유일하게 옳은 방법이었는지 아무도 설명할 수 없었습니다. 사실, 이 레시 recipe를 사용하는 것은 우리가 합리적인 선택을 내리는 방식에 대한 근본적인 규칙들을 깨뜨리는 것처럼 보였으며, "무엇이 효과적인가"와 "무엇이 타당한가" 사이의 혼란스러운 긴장감을 만들어냈습니다.

"Rationalizing Boltzmann Rationality"라는 제목의 이 논문은 이 미스터리를 해결하는 탐정 이야기와 같습니다. 저자인 실비우 피티스(Silviu Pitis)는 단순하지만 심오한 질문을 던집니다. 만약 에이전트가 합리적이기를 원하고 자신의 선택 능력을 가치 있게 여긴다면, 이 특정 "수프 레시피"(소프트맥스 정책)가 논리적인 선택임을 증명할 수 있는가? 이 논문은 우리가 두 가지 서로 다른 종류의 무작위성을 혼동했기 때문에 혼란이 발생했다고 주장합니다. 당신이 교차로에 서 있다고 상상해 보십시오. **우연(Chance)**은 날씨가 갑자기 변하여 당신의 의지와 상관없이 경로를 변경하게 만드는 것과 같습니다. **선택(Choice)**은 당신이 어떤 길을 갈지 결정하는 것입니다. 이 논문은 우연(날씨)과 당신의 결정(선택)을 별개의 것으로 취급하고, 당신의 옵션들을 어떻게 가치 있게 평가해야 하는지에 대한 몇 가지 상식적인 규칙을 적용하면, 소프트맥스 레시피가 유일한 해답으로 도출된다는 것을 보여줍니다. 즉, "엔트로피 보너스(entropy bonus)"—수학적으로는 페널티처럼 들리지만 실제로는 옵션을 갖는 것에 대한 보상인 이 용어—는 바로 **옵션 프리미엄(option premium)**입니다. 이는 선택할 수 있는 자유로부터 얻는 추가적인 가치입니다. 논문은 만약 에이전트가 자신의 경로를 선택하는 능력을 가치 있게 여긴다면, 일관성을 유지하기 위해 반드시 이 특정 공식을 사용해야 한다고 증명합니다. 그렇지 않다면, 그것은 합리적인 것이 아니라 그저 일관성이 없는 것입니다.

로봇 요리사의 이야기

발견의 핵심으로 들어가 봅시다. 당신이 피자, 타코, 스시라는 세 가지 메뉴가 있는 주방의 로봇 요리사라고 상상해 보십시오. 당신은 과거의 경험을 바탕으로 각 음식이 얼마나 맛있는지에 대한 "점수"를 가지고 있습니다.

  • 옛날 방식 (단호한 선택): 예전의 엄격한 사고방식에서는, 만약 피자의 점수가 10점이고 타코의 점수가 9점이라면, 당신은 오직 피자만을 선택할 것입니다. 스시의 점수가 5점이라면, 당신은 스시를 완전히 무시할 것입니다. 이것을 "하드(hard)"한 결정이라고 합니다.
  • 새로운 방식 (부드러운 선택): 하지만 현실 세계와 대부분의 현대 AI에서는 "소프트(soft)"한 선택을 사용합니다. 우리는 여전히 피자를 가장 자주 고르겠지만, 타코를 선택할 작은 가능성을 열어두고 스시를 아주 작은 가능성으로 남겨둡니다. 이것이 볼츠만 정책(Boltzmann policy) 또는 소프트맥스입니다. 이것은 "피자가 최고지만, 오늘은 다른 것이 먹고 싶을지도 몰라"라고 말하는 것과 같습니다.

오랫동안 과학자들은 로봇이 더 빠르고 효과적으로 탐색하고 학습하도록 돕기 위해 이 소프트한 선택을 사용해 왔습니다. 그러나 여기에는 찜찜한 문제가 있었습니다. "하드"한 선택의 수학(이를 기대 효용 이론이라 부름)에 따르면, 만약 메뉴에 "탄 토스트"와 같은 형편없는 옵션을 추가하더라도 피자와 타코 사이의 당신의 선호도는 변해서는 안 됩니다. 이 규칙을 **무관한 대안의 독립성(Independence of Irrelevant Alternatives, IIA)**이라고 합니다. 그러나 소프트한 선택의 수학은 이 규칙을 깨뜨리는 것처럼 보였습니다. 만약 "탄 토스트"를 추가한다면, 수학적으로는 메뉴가 커졌다는 이유만으로 피자에 대한 당신의 애정이 변할 수 있음을 시사했습니다. 이는 전체 시스템을, 마치 맞지 않는 기초 위에 세워진 집처럼 불안정하게 만들었습니다.

위대한 구분: 날씨와 의지

이 논문은 **우연(Chance)**과 선택(Choice) 사이의 탁월한 구분을 통해 이 문제를 해결합니다.

  • **우연(Chance)**은 우주가 당신을 위해 동전을 던지는 상황입니다. 만약 당신이 가방 안에 든 무작위의 음식을 먹어야만 하는 상황이라면, 그 가방의 가치는 그 안에 든 음식들의 평균값일 뿐입니다. 이것이 "날씨" 부분입니다.
  • **선택(Choice)**은 당신이 고르는 상황입니다. 메뉴를 가지고 있을 때, 당신은 단순히 무작위 음식을 먹는 것이 아니라 선택할 수 있는 을 가집니다. 논문은 메뉴를 갖는 것 자체가 가치 있다고 주장합니다. 그것은 보물 상자를 열 수 있는 열쇠를 가진 것과 보물을 이미 주머니에 넣고 있는 것의 차이와 같습니다. 보물은 같지만, 상자를 열 수 있는 능력이 추가적인 가치를 더합니다.

저자는 우연(날씨) 부분에 대해서만 합리성의 규칙을 적용하고, 당신의 의지(선택)에 대해서는 새로운 규칙 세트를 적용하면 마법이 일어난다는 것을 보여줍니다. 선택의 규칙은 다음과 같습니다:

  1. 무관한 대안의 독립성 (IIA): 피자와 타코 사이의 당신의 선호도는 메뉴에 "탄 토스트"가 추가되었다고 해서 변하지 않아야 합니다.
  2. 단조성 (Monotonicity): 만약 피자의 점수가 더 좋아진다면, 당신은 피자를 선택할 확률이 높아져야 합니다.

이 두 가지 간단한 규칙을 "옵션을 갖는 것은 가치 있다"는 아이디어와 결합하면, 수학은 당신을 단 하나의 특정한 형태로 몰아넣습니다. 그 형태가 바로 볼츠만 정책입니다. 결국 "엔트로피 보너스"(옵션을 유지하는 데서 얻는 추가 가치)는 정확히 옵션 프리미엄임이 드러납습니다. 즉, 선택을 할 수 있는 권한을 갖는 것에서 얻는 가치입니다. 논문은 만약 에이전트가 선택할 수 있는 힘을 갖는 것이 가치 있고, 당신의 옵션들이 진정으로 독립적이라고 믿는다면, 이 특정 공식을 사용하는 것이 유일하게 합리적인 방법임을 증명합니다.

이것이 미래에 의미하는 바

이 논문은 단순히 "이것은 멋지다"라고 말하는 데 그치지 않고, 언제 이 레시피를 사용하고 언제 버려야 하는지에 대한 명확한 지도를 제공합니다.

  • 사용할 때: 만약 로봇이 서로에게 영향을 주지 않는 독립적인 것들(예: 서로 다른 맛의 아이스크림) 사이에서 선택하고 있다면, 볼츠만 정책은 수학적으로 증명된 완벽한 선택입니다. 이것은 일관성을 유지하기 위한 유일한 방법입니다.
  • 사용하지 않을 때: 논문은 옵션들이 "뭉쳐져" 있다면 이 레시피가 실패한다고 경고합니다. 예를 들어, 10가지의 서로 다른 "빨간 버스"와 1가지의 "파란 버스"가 있는 메뉴를 상상해 보십시오. 만약 로봇이 모든 빨간 버스를 완전히 별개의 선택지로 취급한다면, 실제로는 파란 버스를 더 선호하더라도 빨간 버스가 매우 많다는 이유만으로 빨간 버스를 고르는 데 시간의 90%를 보낼 수 있습니다. 이것을 "유사성 효과(similarity effect)"라고 합니다. 이러한 경우, 독립성 가정이 위반되었기 때문에 단순한 볼츠만 레시피는 무너지며, 로봇은 더 스마트한 메뉴 시스템(예: 빨간 버스들을 하나로 그룹화하는 방식)이 필요합니다.

저자들은 또한 로봇이 얼마나 "합리적"이어야 하는지에 대해 놀라운 발견을 했습니다. 그들은 "최소한의 합리성 임계치"를 발견했습니다. 만약 로봇이 너무 불확실하여(온도 척도 β\beta가 너무 낮아), 하나의 선택이 보상을 폭발시킬 수 있는 상황(예: 자산이 두 배 또는 세 배로 불어날 수 있는 투자)에 직면하면, 수학은 완전히 무너집니다. 로봇의 가치는 무한대가 되어 터무니없어집니다. 그러나 논문은 만약 로봇이 미래가 결국 중요하지 않게 되는 시점이 온다는 개념("지평 연속성", horizon continuity)을 이해한다고 가정한다면, 이 문제가 사라지고 수학이 다시 작동한다는 것을 보여줍니다.

거시적 관점

결국, 이 논문은 복잡한 수학의 세계에서 보기 드문 일을 해냅니다. 경제학, 정보 이론, 그리고 인공지능 사이의 점들을 연결한 것입니다. 인간이 왜 검보(Gumbel) 맛 아이스크림(특정한 유형의 무작위 노이즈)을 선택할 수도 있는지를 설명하는 동일한 논리가 왜 AI가 소프트맥스 함수를 사용해야 하는지를 설명한다는 것을 보여줍니다. 이는 "엔트로피 보너스"가 단순히 학습을 빠르게 하기 위한 임시방편이 아니라, 바로 옵션 프리미엄임을 증명합니다. 그것은 선택을 당하는 것이 아니라, 스스로 선택을 내리는 사람이 되는 것의 가치입니다.

그러므로 다음에 AI가 약간의 무작위성을 가지고 결정을 내리는 것을 본다면, 그것이 단순히 추측하는 것이 아님을 기억하십시오. 그것은 "선택할 수 있는 자유를 갖는 것은 가치 있으며, 당신의 선택이 독립적일 때 그 자유를 존중하는 수학적으로 완벽한 방법은 이것이다"라는 깊은 수학적 법칙을 따르고 있는 것입니다. 이 논문은 우리가 수년간 사용해 온 도구를 정당화할 뿐만 아니라, 그것이 왜 작동하는지, 언제 사용해야 하는지, 그리고 언제 새로운 것을 만들어야 하는지를 정확히 알려줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →