A Reinforcement Learning Supervisor with Dynamic Performance-Metric Weighting for Cryptocurrency Portfolio Management
본 논문은 이질적인 에이전트 집합으로부터 최적의 트레이딩 정책을 선택하기 위해 여러 성능 지표에 동적으로 가중치를 부여하는 강화 학습 감독 프레ка임워크를 제안하며, 이를 통해 개별 에이전트 및 고정된 전략과 비교하여 비정상성(nonstationary) 암호화폐 시장에서 우수한 위험 조정 수익률을 입증한다.
원본 논문은 CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
금융 시장에 투자하는 것은 끊임적인 적응의 게임입니다. 경제가 호황기의 성장으로부터 완만한 횡보 또는 갑작스럽고 급격한 하락으로 변화함에 따라 게임의 규칙도 변합니다. 이러한 환경에서, 호황기에 완벽하게 작동했던 단일 전략은 시장이 전환될 때 처참하게 실패하곤 합니다. 이것이 포트폴리오 관리의 핵심 과제입니다. 즉, 미래는 불확실하고 과거는 신뢰할 수 있는 지도가 아닐 때, 자금을 서로 다른 자산에 어떻게 배분할 것인가를 결정하는 일입니다. 수십 년 동안 투자자들은 위험과 보상을 균형 있게 맞추기 위해 수학적 공식에 의존해 왔지만, 이러한 정적인 모델들은 시장 조건이 급격히 변할 때 종종 어려움을 겪습니다. 최근에는 컴퓨터 과학자들이 강화 학습(reinforcement learning)이라는 일종의 인공지능에 주목했습니다. 이 컴퓨터 프로그램들은 특정 규칙을 배우는 대신, 시뮬레이션된 시장과 상호작용하며 시행착오를 통해 어떤 행동이 최선의 장기적 결과를 이끌어내는지 스스로 학습합니다. 이러한 프로그램들은 거래하는 법을 배울 수는 있지만, 종종 하나의 사고방식에 갇혀 시장의 체제(regime)가 바뀔 때 전환하지 못하는 한계를 보입니다.
한국교통대학교의 연구팀은 이 문제를 해결하기 위한 새로운 방법을 제 제안했습니다. 그들은 단 하나의 완벽한 트레이딩 로봇을 만들려고 노력하는 대신, 약간씩 다른 학습법으로 훈련된 다섯 명의 서로 다른 트레이딩 로봇 팀을 관리하는 감독자 역할을 하는 시스템을 구축했습니다. 감독자는 직접 거래를 수행하지 않습니다. 대신, 각 로봇이 최근에 어떻게 성과를 냈는지 관찰하고 현재 어느 로봇이 책임을 맡아야 할지를 결정합니다. 연구진은 이 시스템을 극심한 변동성과 급격한 변화로 잘 알려진 암호화폐 시장의 실제 고빈도 데이터를 사용하여 테스트했습니다. 그 결과, 이 감독자 시스템이 동적으로 현재 시장 조건에 가장 적합한 에이전트를 선택함으로써, 단일 로봇이나 전통적인 투자 전략보다 일관되게 더 나은 성과를 낸다는 것을 발견했습니다.
연구진은 먼저 다섯 명의 뚜렷한 에이전트를 구축하는 것으로 시작했습니다. 각 에이전트는 투자 결정을 내리도록 설계된 컴퓨터 프로그램이지만, 서로 다른 수학적 접근 방식을 사용하여 훈련되었습니다. 모든 에이전트가 동일한 보상 함수와 동일한 포트폴리오 환경에서 훈련되었음에도 불구하고, 각자의 독특한 학습 메커니즘은 각 에이전트에게 고유한 '성격'을 부여했습니다. 어떤 에이전트는 높은 수익을 쫓으며 큰 위험을 감수하는 매우 공격적일 수 있는 반면, 다른 에이전트는 빠른 이익보다 안정성을 우선시하며 더 신중할 수 있습니다. 안정적인 시장에서는 공격적인 에이전트가 빛을 발할 수 있습니다. 난기류가 발생하는 시장에서는 신중한 에이전트만이 살아남을 수도 있습니다. 문제는 어떤 단일 에이전트도 항상 모든 면에서 최고일 수는 없다는 점입니다. 만약 투자자가 단 하나의 에이전트만을 선택하여 고수한다면, 그 에이전트가 선호하지 않는 방향으로 시장이 변할 때 손실을 입을 가능성이 높습니다.
이를 해결하기 위해 연구진은 감독자 에이전트를 도입했습니다. 이 감독자는 자신이 관리하는 다섯 에이전트의 내부 코드를 알지 못합니다. 대신, 마치 경기를 지켜보는 코치처럼 오직 전광판만을 바라봅니다. 감독자는 각 에이전트의 수익률, 수익을 내기 위해 감수한 위험, 양(+)의 수익을 기록한 기간의 비율 등 일곱 가지의 서로 다른 성과 지표를 추적합니다. 또한 지난 몇 시간부터 지난 며칠까지의 다양한 시간 범위를 통해 이 수치들을 살펴봅니다. 감독자의 임무는 현재 어떤 지표가 가장 중요한지를 파악하는 것입니다. 평온한 시장에서 감독자는 꾸준하고 일관된 수익이 좋은 에이전트를 판단하는 가장 중요한 징표라고 결정할 수 있습니다. 혼란스러운 시장에서는 큰 손실을 피하는 것이 유일하게 중요한 요소라고 결정할 수 있습니다.
감독자는 자신의 학습 과정을 통해 이러한 가중치 시스템을 학습합니다. 감독자는 시장과 에이전트들의 최근 이력을 관찰한 다음, 서로 다른 성과 지표에 중요도 점수를 할당하는 법을 배웁니다. 단순히 최근 수익이 가장 높은 에이전트를 고르는 것이 아닙니다. 대신, 감독자는 각 에이전트의 성과 데이터와 해당 순간을 위해 학습된 중요도 가중치를 결합하여 각 에이전트에 대한 점수를 계산합니다. 총점이 가장 높은 에이전트가 다음 거래 기간 동안 포트폴리오를 관리하도록 선택됩니다. 이는 시장 환경이 변함에 따라 신뢰를 한 에이전트에서 다른 에이전트로 옮겨가며 끊임없이 선택을 재평가하는 시스템을 만듭니다.
연구진은 바이낸스(Binance) 암호화폐 거래소의 30분 단위 가격 데이터를 사용하여 이 시스템을 테스트했으며, 기간은 2021년 1월 1일부터 2025년 12월 31일까지를 대상으로 했습니다. 연구진은 네 개의 인기 있는 암호화폐를 포함하는 시나리오와, 시스템이 조금 더 큰 규모의 투자를 처리할 수 있는지 확인하기 위해 다섯 번째 자산을 추가한 다섯 개의 자산을 포함하는 두 가지 다른 시나리오를 설정했습니다. 연구진은 이 감독자 시스템을 다섯 명의 개별 에이전트, 모든 자산을 동일하게 보유하는 단순한 전략, 그리고 여러 전통적인 투자 공식들과 비교했습니다. 결과는 명확했습니다. 감독자 시스템은 단일 에이전트나 전통적인 전략보다 훨씬 더 높은 최종 포트폴리오 가치를 생성했습니다. 네 개의 자산 시나리오에서 감독자 시스템은 포트폴리오 가치를 초기 금액의 2.349배로 키운 반면, 가장 우수한 개별 에이전트는 1.652배에 그쳤습니다. 다섯 개의 자산 시나리오에서 감독자는 초기 값의 3.044배에 도달했으며, 이는 가장 우수한 개별 에이전트의 2.554배와 대조됩니다.
결정적으로, 이러한 추가적인 성장은 더 높은 위험을 대가로 얻은 것이 아니었습니다. 감독자 시스템은 개별 에이전트들보다도 더 작은 최대 손실폭(drawdown)을 경험했습니다. 이는 이 시스템이 더 높은 수익을 얻기 위해 단순히 더 큰 도박을 한 것이 아니라, 더 안전한 에이전트로 전환할 시점을 정확히 알고 위험을 더 잘 관리했음을 시사합니다. 또한 연구진은 항상 최근 수익이 가장 높은 에이전트를 선택하는 것과 같이 단 하나의 고정된 규칙만을 사용하는 더 단순한 버전의 시스템과도 비교했습니다. 감독자 시스템은 이러한 단일 규칙 전략들을 압도적으로 앞질렀습니다. 이는 시스템의 성공이 단일하고 경직된 기준에 의존한 것이 아니라, 여러 요인을 동시에 가중하여 고려하는 능력에서 비롯되었음을 증명했습니다.
시스템이 정확히 무엇 때문에 작동했는지 이해하기 위해, 연구진은 시스템의 일부를 제거했을 때 어떤 일이 발생하는지 확인하는 일련의 테스트를 수행했습니다. 그들은 시스템이 최상의 성능을 발휘하기 위해서는 일곱 가지 성과 지표와 네 가지 시간 창(time window)이 모두 필요하다는 것을 발견했습니다. 수익 관련 지표를 제거하면 부를 늘리는 능력이 저하되었고, 위험 관련 지표를 제거하면 손실을 방어하는 능력이 저하되었습니다. 마찬가지로, 시스템은 단기 및 장기 성과 이력을 모두 살펴봐야 했습니다. 네 개의 자산 테스트에서는 장기 이력이 가장 중요했던 반면, 다섯 개의 자산 테스트에서는 단기 이력이 더 중요했습니다. 이러한 변동성은 시스템이 고정된 규칙을 사용하는 것이 아니라, 현재의 포트폴리오와 시장 조건의 구체적인 요구에 진정으로 적응하고 있음을 보여주었습니다.
본 연구는 포트폴리오를 관리하는 것이 단순히 단 하나의 최고의 트레이딩 알고리즘을 찾는 문제가 아니라는 결론을 내립니다. 그것은 업무의 성격이 변함에 따라 그 업무에 적합한 도구를 선택할 수 있는 구조를 만드는 것입니다. 감독자를 사용하여 다양한 성과 신호에 동적으로 가중치를 부여함으로써, 이 시스템은 단일 에이전트나 정적인 전략보다 암호화폐 시장의 예측 불가능한 특성을 더 효과적으로 헤쳐 나갈 수 있습니다. 연구진은 현재의 시스템이 특정 다섯 명의 에이전트와 특정 시장 데이터를 사용하고 있다고 언급했습니다. 향후 연구는 서로 다른 위험 프로필을 가진 에이전트를 포함하거나 다른 유형의 자산에 대해 시스템을 테스트함으로써 이를 확장할 수 있습니다. 그러나 핵심적인 발견은 견고합니다. 즉, 다각적인 성과 관점을 바탕으로 정책을 선택하도록 학습하는 계층적 접근 방식은 금융 시장의 불확실성을 다루는 강력한 방법이라는 것입니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.