← 최신 논문
💰 quantitative finance

Reinforcement Learning and Consumption-Savings Behavior

이 논문은 표준적 합리적 기대가 아닌 적응적 학습 메커니즘이 어떻게 자산이 적은 실업 가구의 높은 한계 소비 성향과 과거 실업 경험을 가진 개인들에게서 관찰되는 지속적인 소비 "흉터(scarring)" 현상을 동시에 생성하는지를 설명하기 위해 신경망 근사를 활용한 강화 학습 모델을 제안한다.

원저자: Brandon Kaplowitz

게시일 2026-08-06
📖 5 분 읽기🧠 심층 분석

원저자: Brandon Kaplowitz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

뇌의 GPS와 소비의 미스터리

당신의 뇌를 일상의 혼란스러운 지형을 항해하는 매우 똑똑한 GPS라고 상상해 보세요. 보통 우리는 사람들이 완벽한 수학자처럼 경제적 결정을 내린다고 가정합니다. 즉, 그들은 내년에 정확히 얼마를 벌 것인지 알고, 오늘 소비하는 것과 내일을 위해 저축하는 것 사이의 완벽한 균형을 계산하며, 절대 실수를 하지 않는다고 생각합니다. 이것이 바로 경제학자들이 수십 년 동안 사용해 온 표준 지도인 "합리적 기대(Rational Expectations)" 관점입니다. 하지만 현실은 훨씬 더 무질서합니다. 우리에게는 수정구슬이 없습니다. 오직 과거의 경험만이 있을 뿐입니다.

여기에 **강화 학습(Reinforcement Learning)**이 등장합니다. 이것을 방정식을 푸는 슈퍼컴퓨터가 아니라, 시행착오를 통해 배우는 비디오 게임 플레이어라고 생각해 보세요. 게임에서 당신은 레벨의 규칙을 미리 알지 못합니다. 어떤 동작을 시도하고, 보상을 얻거나(또는 "게임 오버"를 당함), 그러면 당신의 뇌는 다음번을 위해 "무엇이 효과적인가"에 대한 내부 지도를 업데이트합니다. 높은 점수를 얻으면 그 경로를 기억합니다. 패배하면 그 경로를 피합니다. 이 논문은 매혹적인 질문을 던집니다. 만약 우리의 소비 습관이 완벽한 수학자에 의해 계산되는 것이 아니라, 이와 동일한 "시도하고, 실패하고, 배우는" 과정에 의해 형성된다면 어떨까요? 이 논문은 우리의 뇌가 미래에 대한 완벽한 예측이 아니라, 과거에 겪었던 '놀라움(surprises)'을 바탕으로 우리가 얼마나 저축해야 하는지에 대한 정신적 모델을 끊임없이 업데이트한다고 제안합니다.

퍼즐: 왜 어떤 사람들은 돈이 없을 때 더 많이 쓰는가?

경제학자들은 어려운 시기에 사람들이 돈을 쓰는 방식에 나타나는 두 가지 이상한 패턴을 두고 머리를 싸매 왔습니다.

첫 번째 미스터리: 팬데믹 기간 동안 정부는 경기 부양책으로 지원금을 지급했습니다. 연구 결과, 은행 계좌에 돈이 거의 없었던 실업자들은 받은 추가 달러당 약 0.53을 소비했습니다. 반면, 원래 돈이 많았던 실업자들은 추가 달러당 0.29만을 소비했습니다. 이는 이상한 현상입니다. 왜냐하면 돈을 받는 그 순간, 두 집단 모두 실제로 "빈털터리"이거나 돈을 빌릴 수 없는 상태는 아니었기 때문입니다. 표준 경제 이론에 따르면, 충분한 현금을 보유하고 있다면 갑작스러운 횡재에 대해 그렇게 열렬히 소비해서는 안 됩니다. 왜 누군가의 과거 자금 부족이, 현재 괜찮은 상태임에도 불구하고 지금 더 많은 소비를 유도하는 걸까요?

두-번째 미스터리: 또 다른 연구에 따르면, 과거에 실업을 경험했던 사람들은 현재 직장이 있고 형편이 좋아졌음에도 불구하고 몇 년 동안 더 많이 저축하고 덜 소비하는 경향이 있습니다. 이를 "흉터(scarring)"라고 부릅니다. 마치 과거의 유령이 현재의 월급을 즐기지 못하게 방해하는 것과 같습니다.

중요한 질문은 이것입니다: 단 하나의 설명으로 이 두 가지 미스터리를 모두 해결할 수 있을까요? 보통 경제학자들은 하나를 선택해야 합니다. "아마 그들이 미래를 두려워하기 때문이거나," 혹은 "아mati 그들이 수학에 서툴기 때문일 것"이라고 말이죠. 하지만 이 논문은 다른 범인을 지목합니다. 바로 강화 학습입니다.

실험: 디지털 에이전트에게 학습시키기

저자인 브랜든 카플로위츠(Brandon Kaplowitz)는 이 아이디어를 테스트하기 위해 컴퓨터 시뮬레이션을 구축했습니다. 디지털 에이전트들에게 미래에 대한 완벽한 지도를 주는 대신, 경험을 통해 배우는 뇌의 단순화된 버전인 "신경망(neural network)"을 부여했습니다.

시뮬레이션은 다음과 같이 진행됩니다:

  1. 설정: 에이전트들은 저축과 소비를 하는 방법에 대해 대략적인 추측을 가지고 시작합니다. 이는 완벽한 수학자가 하는 것과 비슷합니다.
  2. 게임: 그들은 시뮬레이션된 삶의 50분기(약 12.5년)를 살아갑니다. 직업을 갖고, 직업을 잃고, 급여를 받습니다.
  3. 학습: 에이전트가 갑작스러운 일실직과 같은 '놀라움'을 경험할 때, 그들은 "시간차 오류(temporal difference error)"를 느낍니다. 비디오 게임 용어로 설명하자면, 금화를 기대했는데 돌멩이를 받은 것과 같습니다. 뇌는 "와, 내 지도가 틀렸구나!"라고 깨닫습니다.
  4. 업데이트: 에이전트의 신경망은 이 실수를 바로잡기 위해 내부 가중치(weights)를 조정합니다. 단순히 숫자 하나를 바꾸는 것이 아니라, 미래를 위해 저축하는 것이 얼마나 가치 있는지에 대한 전체적인 이해를 재형성합니다.

거대한 결과: "흉터"가 지도를 어떻게 바꾸는가

시뮬레이션은 실제 세상의 퍼즐과 거의 똑같은 결과를 만들어냈습니다. 여기에는 마법 같은 메커니즘이 있습니다:

에이전트가 실업을 경험하면, 그들의 뇌는 "부정적인 놀라움"을 겪습니다. 이를 해결하기 위해 신경망은 미래에 대한 정신적 지도를 업데이트합니다. 이 업데이트는 동시에 두 가지 일을 수행합니다:

  1. 지도를 더 가파르게 만듭니다: 에이전트는 저축이 생각보다 더 중요하다는 것을 깨닫습니다. 이로 인해 전반적인 소비가 줄어듭니다 ("흉터" 효과).
  2. 지도를 더 구불구불하게 만듭니다: 에이전트는 부유해질수록 저축의 가치가 빠르게 떨어진다는 것을 깨닫습니다. 이로 인해 그들은 새로운 돈이 생길 때마다 매우 열렬하게 소비하게 됩니다. 왜냐하면 저축이 적을 때 느끼는 "고통"이 이전보다 훨씬 더 날카롭다고 느끼기 때문입니다.

결과:

  • 흉터 효과: 실업 경험이 있는 에이전트들은 실제 데이터와 마찬가지로 평균 소비가 낮아졌습니다.
  • 지출 열풍: 이 동일한 에이전트들이 경기 부양 지원금을 받았을 때, 그들은 받은 금액의 0.50을 소비했습니다(실제 데이터인 0.53에 매우 근접). 반면, 안정적인 직장 생활을 했던 에이전트들은 0.34만을 소비했습니다(실제 데이터인 0.29에 근접).

이것이 의미하는 바 (그리고 의미하지 않는 것)

이 논문은 우리가 이러한 행동을 설명하기 위해 사람들이 "비합리적"이라거나 "이상한 심리"를 가졌다고 가정할 필요가 없음을 시사합니다. 대신, 우리의 뇌는 단지 자신이 가장 잘하는 일, 즉 과거의 놀라움으로부터 배우는 일을 하고 있을 뿐입니다.

  • 비관주의에 관한 것이 아닙니다: 저자는 에이전트들이 단순히 "비관적"(실업 가능성이 높다고 생각함)이 된 버전을 테스트했습니다. 그 모델은 실패했습니다. 그 모델은 사람들을 덜 소비하게 만들었지만, 동시에 횡재(windfall)에 대해서도 덜 소비하게 만들었습니다. 이는 실제 현실과 반대되는 결과입니다. 강화 학습 모델만이 "전반적인 소비 감소"와 "보너스에 대한 높은 소비"라는 두 가지 측면을 모두 제대로 설명해 냈습니다.

  • 시뮬레이션이지, 수정구슬이 아닙니다: 저자는 이것이 컴퓨터 시뮬레이션 결과임을 주의 깊게 명시합니다. 숫자들이 실제 연구 결과(예: 시뮬레이션의 0.50 대 0.34 vs 실제의 0.53 대 0.29)와 일치하지만, 이것은 어떻게 작동할 수 있는지에 대한 모델이지, 모든 인간의 뇌가 어떻게 작동하는지에 대한 최종적인 증명은 아닙니다.

  • "블랙박스"의 한계: 에이전트들이 신경망을 통해 학습하기 때문에, 우리는 그들에게 "당신은 해고될 확률이 얼마라고 생각하나요?"라고 쉽게 물을 수 없습니다. 이 모델은 특정 확률을 계산하는 것이 아니라 값을 조정함으로써 작동합니다. 이는 강점(유연함)인 동시에 약점(에이전트의 머릿속에 있는 정확한 '믿음'을 볼 수 없음)이기도 합니다.

요약하자면, 이 논문은 우리의 지갑을 바라보는 새롭고 흥미로운 방법을 제시합니다. 우리의 소비 습관은 우리가 겪은 놀라움들에 의해 쓰인 살아있는 역사서라는 것입니다. 직장을 잃어 겁을 먹을 때, 우리의 뇌는 단순히 슬퍼하는 것이 아니라 게임의 규칙을 다시 씁니다. 즉, 다가올 폭풍에 대비해 더 많이 저축하게 만드는 동시에, 폭풍이 다시 올 경우를 대비해 횡재를 더 빨리 써버리도록 만드는 것입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →