← 최신 논문
💰 quantitative finance

Data-Driven Merton's Strategies via Policy Randomization

이 논문은 불완전 시장에서 모델 파라미터를 알 수 없는 Merton 의 최적 투자 문제를 해결하기 위해 정책 무작위화를 도입하고 이를 연속시간 강화학습 알고리즘으로 구현하여 기존 모델 기반 방법보다 우수한 성능을 입증했습니다.

원저자: Min Dai, Yuchao Dong, Yanwei Jia, Xun Yu Zhou

게시일 2026-02-17
📖 3 분 읽기☕ 가벼운 읽기

원저자: Min Dai, Yuchao Dong, Yanwei Jia, Xun Yu Zhou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

1. 기존 방식: "완벽한 지도를 그리려는 탐험가" (Plug-in Method)

전통적인 금융 이론 (Merton 문제) 은 투자를 할 때 다음과 같은 과정을 거칩니다.

  • 상황: 투자자는 주식 시장이라는 미지의 숲에 들어섭니다.
  • 방법: 먼저 과거 데이터를 분석해서 "이 숲의 지도 (모델)"를 그려냅니다. 나무가 얼마나 자라는지 (수익률), 바람이 얼마나 강한지 (변동성) 를 통계적으로 계산합니다.
  • 문제: 이 지도를 그리는 데는 엄청난 양의 데이터가 필요하고, 지도가 조금만 틀려도 (예를 들어, 나무 성장률을 1% 만 잘못 계산해도) 그 위에 그린 최적의 경로 (투자 전략) 는 완전히 엉망이 됩니다. 마치 지도가 1cm만 틀려도 목적지에 도착하지 못하는 것과 같습니다.
  • 결과: "지도 (모델) 를 먼저 완벽하게 그리는 것"에 모든 에너지를 쏟다가, 실제 투자에서는 실패하는 경우가 많습니다.

2. 이 논문의 방식: "랜덤하게 길을 시도하는 AI" (Policy Randomization & RL)

이 논문은 **"지도가 없어도, AI 가 직접 경험을 통해 최고의 길을 찾아낼 수 있다"**고 말합니다. 여기서 핵심은 **'랜덤성 (무작위성)'**입니다.

  • 아이디어: AI 가 "어떤 길이 좋을지"를 딱 정해서 (결정론적) 가는 게 아니라, 일정 확률로 여러 가지 길을 무작위로 시도해 보는 것입니다.
  • 비유:
    • 기존 방식: 지도를 보고 "A 길이 최고야!"라고 확신하고 A 길만 갑니다.
    • 이 논문의 방식: "A 길도 가보고, B 길도 살짝 가보고, C 길도 살짝 가보자!"라고 랜덤하게 여러 경로를 섞어서 가봅니다.
    • 왜 그럴까요? 단순히 '호기심' 때문이 아닙니다. AI 는 무작위로 다양한 길을 가보면서 "어, B 길은 비가 오는데도 잘 가네?", "C 길은 바람이 불면 위험하네?"라는 **데이터 (경험)**를 얻습니다. 이 데이터를 바탕으로 "아, 앞으로는 B 길에 더 무게를 두자"라고 전략을 수정합니다.

3. 핵심 통찰: "랜덤함은 실수가 아니라 도구"

일반적으로 투자에서 "무작위로 투자하는 것"은 어리석은 짓으로 보입니다. 하지만 이 논문은 **랜덤성 (Policy Randomization)**을 다음과 같은 새로운 관점에서 바라봅니다.

  • 기술적인 도구: 랜덤하게 시도하는 것은 단순히 '탐험'을 위한 것이 아니라, **수학적으로 풀기 어려운 문제를 푸는 '열쇠'**입니다.
  • 비유:
    • 어두운 방에서 물건을 찾으려 할 때, 손으로 한 번에 정확히 잡으려 하면 (결정론적) 실패할 확률이 높습니다.
    • 대신 손으로 살짝씩 여러 방향으로 흔들어 보며 (랜덤성) 물건의 위치를 감지하면, 결국 정확한 위치를 찾아낼 수 있습니다.
    • 이 논문은 **"랜덤하게 흔드는 행위 자체가, 결국 가장 정확한 위치 (최적 투자 전략) 를 찾는 데 필수적인 기술"**임을 수학적으로 증명했습니다.

4. 실제 성과: "실전에서는 AI 가 압승"

논문은 시뮬레이션과 실제 주식 시장 (S&P 500) 데이터를 통해 이 방법을 검증했습니다.

  • 결과:
    • 기존 방식 (지도 그리기): 시장이 예상과 조금만 달라져도 (예: 2008 년 금융위기, 2000 년 닷컴 버블) 전략이 무너지고 큰 손실을 봅니다.
    • 이 논문의 방식 (AI 학습): 시장이 어떻게 변하는지 실시간으로 학습하며 전략을 바꿉니다. 시장이 폭락할 때는 재빨리 방어하고, 회복할 때는 빠르게 공격합니다.
    • 특징: 특히 시장이 혼란스러울 때 (변동성이 클 때) 기존 방식보다 훨씬 더 잘 견디고, 손실 회복 속도도 훨씬 빠릅니다.

5. 한 줄 요약

"우리는 주식 시장의 복잡한 수학적 공식 (지도) 을 완벽하게 알 수 없습니다. 하지만 AI 가 '무작위로 여러 시도를 해보는 것'을 통해 스스로 배우게 하면, 그 결과물이 우리가 아는 그 어떤 복잡한 공식보다 더 똑똑하고 튼튼한 투자 전략이 됩니다."

이 연구는 인공지능 (강화학습) 이 단순히 데이터를 분석하는 것을 넘어, 불확실한 세상에서 스스로 최적의 결정을 내리는 새로운 패러다임을 제시했다는 점에서 매우 중요합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →