← 최신 논문
💰 quantitative finance

Self-Supervised Auxiliary Task Discovery for Stable Reinforcement Learning in Stock Trading

본 논문은 다양한 시장 국면에서 주식 거래를 위한 표현 학습을 강화하고 강화 학습 정책을 안정화하기 위해, 메타 그래디언트 메커니즘을 통해 일반 가치 함수 기반의 보조 작업을 자동으로 발견하는 자기 지도 학습 프레임워크를 제안한다.

원저자: Arishi Orra, Himanshu Choudhary, Manoj Thakur

게시일 2026-08-18
📖 4 분 읽기☕ 가벼운 읽기

원저자: Arishi Orra, Himanshu Choudhary, Manoj Thakur

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

주식 거래의 세계는 오랫동안 인간의 직관이 혼란스럽고 변화무쌍한 시장과 맞서 싸우는 영역이었습니다. 수십 년 동안 트레이더들은 가격이 오를지 내릴지를 예측하는 패턴을 찾기 위해 산더미 같은 데이터를 걸러내는 알고리즘에 의존해 왔습니다. 최근 몇 년 사이, 강화 학습(reinforcement learning)이라 불리는 강력한 유형의 인공지능이 이 과업을 위한 선도적인 도구로 부상했습니다. 정답을 직접 듣는 대신, 행동을 시도하고 실수를 저지르며 자신이 경험한 수익과 손실으로부터 천천히 배워나가는 디지털 에이전트를 상상해 보십시오. 이러한 접근 방식은 과거의 방식이 시장이 어제와 오늘 똑같이 움직인다고 가정하는 것과 달리, 변화하는 조건에 적응할 수 있다는 점에서 유망합니다. 하지만 이러한 에이전트에게 수익성과 안정성을 모두 갖추도록 가르치는 것은 매우 어려운 일입니다. 금융 시장은 소음이 많고 예측 불가능하며, 특정 결정이 좋은 결정이었는지 나쁜 결정이었는지에 대해 한참이 지난 후에야 아주 적은 피드백을 주는 경우가 많기 때문입니다. 명확한 지침이 없으면 에이전트는 학습에 어려움을 겪어 변덕스러워지거나 새로운 시장 조건에 자신의 기술을 일반화하는 데 실패할 수 있습니다.

이러한 에이전트가 더 빠르고 신뢰성 있게 학습하도록 돕기 위해, 연구자들은 종종 주된 목표인 돈을 버는 것과 병행하여 해결해야 할 작고 추가적인 과업들을 부여하곤 합니다. 이것들을 보조 과업(auxiliary tasks)이라고 부릅니다. 전통적으로 전문가들은 다음 가격 변동을 예측하거나 시장의 변동성을 추정하는 것과 같이, 에이전트가 시장을 더 잘 이해하는 데 도움이 될 만한 것을 추측하여 이러한 추가 과업들을 수동으로 설계해야 했습니다. 하지만 이러한 수동 방식의 문제는 시장이 끊임없이 변한다는 점입니다. 평온한 시기에는 잘 작동하던 과업이 격동의 시기에는 무용지물이 되거나 심지어 해가 될 수도 있습니다. 만약 보조 과업들이 고정되어 있다면, 그것들은 변화하는 주식 시장의 풍경에 적응할 수 없으며, 결국 트레이딩 에이전트에게 시대에 뒤떨어지거나 무관한 정보를 남기게 됩니다.

인도 공과대학교(IIT) 만디의 연구진은 이 문제를 해결하기 위한 새로운 방법을 개발했습니다. 인간에게 어떤 추가 과업이 도움이 될지 추측하도록 요청하는 대신, 그들은 시스템이 스스로 이러한 과업들을 발견하도록 만들었습니다. 그들은 이를 QUESTrader라고 부릅니다. 핵심 아이디어는 인공지능이 스스로 무엇을 배워야 할지를 스스로 파악하게 하는 것입니다. 이 시스템은 이중 네트워크 설계를 사용합니다. 하나의 네트워크인 메인 트레이더는 수익을 극대화하기 위해 주식을 사고파는 법을 배웁니다. 두 번째 네트워크는 질문 생성기 역할을 합니다. 이 네트워크는 연구에서 사용된 일일 종가 데이터와 기술적 지표를 바탕으로, "앞으로 며칠 동안 가격이 어떻게 될 것인가?" 또는 "시장이 얼마나 움직일 것인가?"와 같이 메인 트레이더가 답해야 할 새롭고 단순한 질문들을 지속적으로 제안합니다. 이 질문들은 고정되어 있지 않으며, 시스템이 현재 경험하고 있는 상황에 따라 동적으로 생성됩니다. 시스템은 주식 거래를 수행하는 동안 이 질문들에 답하도록 메인 트레이더를 훈련시킵니다.

이 접근 방식의 탁월함은 시스템이 어떤 질문을 던질 가치가 있는지 결정하는 방식에 있습니다. 연구진은 장기적인 결과를 살펴보는 정교한 학습 메커니즘을 사용합니다. 시스템은 다음과 같이 묻습니다. "이 특정 질문에 답하는 것이 나중에 트레이더가 더 나은 결정을 내리는 데 도움이 되었는가?" 만약 특정 질문이 더 나은 거래 성과로 이어진다면, 시스템은 그 질문을 계속 던지도록 매개변수를 조정합니다. 만약 질문이 방해가 된다고 판단되면, 시스템은 그 질문을 더 이상 생성하지 않도록 매개변수를 정교하게 다듬습니다. 이 과정은 보조 과업이 항상 현재의 시장 상황에 적절하게 유지되도록 보장합니다. 연구진은 이 방법을 미국의 다우 존스 산업평균지수, 영국의 FTSE 100, 인도의 센섹스(Sensex), 그리고 대만의 TAIEX 등 네 개의 주요 글로벌 주식 시장에서 테스트했습니다. 그들은 자신들의 새로운 시스템을 전통적인 투자 방법, 표준 인공지능 모델, 그리고 수동으로 설계된 보조 과업을 사용하는 다른 시스템들을 포함한 광범위한 기존 전략들과 비교했습니다.

결과는 놀라웠습니다. 네 개의 시장 모두에서 QUESTrader 시스템은 다른 방법들을 일관되게 앞질렀습니다. 미국 시장에서 이 시스템은 연간 수익률 21.785%를 달お성했는데, 이는 그다음으로 우수한 방법인 18.176%보다 현저히 높은 수치입니다. 더 중요한 점은 이 시스템이 단순히 더 많은 돈을 벌 뿐만 아니라, 더 큰 안정성을 가지고 있었다는 것입니다. 이 시스템은 가장 높은 위험 조정 점수를 기록했는데, 이는 위험 한 단위당 더 많은 이익을 창출했음을 의미합니다. 시장이 하락했을 때, QUESTrader 에이전트는 경쟁 모델들보다 손실을 적게 보았습니다. 예를 들어 인도 시장에서 이 시스템은 최대 손실률을 10.584%로 유지했는데, 이는 다른 첨단 모델들이 보인 17.783%의 손실보다 훨씬 낮은 수치였습니다. 또한 이 시스템은 변동성이 큰 대만 시장에서도 연간 수익률 30.279%를 기록하며 다른 모든 접근 방식을 압도하는 효과를 입증했습니다.

연구진은 이 성공의 핵심이 보조 과업을 실시간으로 적응시키는 능력에 있다는 것을 발견했습니다. 적절한 질문을 자동으로 발견함으로써, 트레이딩 에이전트는 더 풍부하고 정확한 시장 이해도를 구축할 수 있었습니다. 에이전트는 인간이 설계한 과업이 놓쳤을 수도 있는 패턴을 인식하는 법을 배웠습니다. 연구진은 또한 시스템이 한 번에 얼마나 많은 질문을 던져야 하는지, 그리고 질문의 가치를 판단하기 위해 얼마나 먼 미래를 내다봐야 하는지도 탐구했습니다. 그들은 약 16개에서 64개 사이의 적당한 수의 질문이 가장 효과적이며, 학습 과정에서 약 10단계 앞을 내다보는 것이 미래의 성공에 대한 적절한 공로를 질문에 돌리는 데 도움이 된다는 것을 발견했습니다. 이러한 균형은 시스템이 너무 많은 정보에 압도되거나 너무 먼 미래를 보느라 혼란을 겪는 것을 방지했습니다.

이 연구는 자동화된 트레이딩의 미래가 더 나은 규칙을 설계하는 더 똑똑한 인간이 아니라, 무엇에 집중해야 할지를 스스로 가르칠 수 있는 더 똑똑한 기계에 달려 있음을 시사합니다. 시스템이 스스로 학습 목표를 발견하도록 함으로써, 연구진은 정적인 인간의 지침에 의존하는 모델보다 더 견고하고, 더 적응력이 뛰어나며, 궁극적으로 더 수익성이 높은 트레이딩 에이전트를 만들어냈습니다. 이 연구 결과는 복잡하고 변화무쌍한 금융 세계에서, 무엇을 배울지를 배우는 능력이 어떻게 거래할지를 배우는 능력만큼이나 중요하다는 것을 보여줍니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →