← 최신 논문
🤖 AI

Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading

본 논문은 쌍거래의 신용 할당 문제를 해결하기 위해 대규모 언어 모델을 고수준 쌍 선택과 저수준 실행에 모두 활용하며 텍스트 피드백에 기반한 프롬프트 업데이트만으로 이를 최적화하는 언어 기반 계층적 강화 학습 프레임워크인"모이라"를 제안한다.

원저자: Polydoros Giannouris, Yuechen Jiang, Lingfei Qian, Yuyan Wang, Xueqing Peng, Jimin Huang, Guojun Xiong, Sophia Ananiadou

게시일 2026-05-06
📖 3 분 읽기☕ 가벼운 읽기

원저자: Polydoros Giannouris, Yuechen Jiang, Lingfei Qian, Yuyan Wang, Xueqing Peng, Jimin Huang, Guojun Xiong, Sophia Ananiadou

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

매우 정교한 트레이딩 회사를 운영한다고 상상해 보세요. 하지만 인간 팀을 고용하는 대신, 두 명의 전문 AI 어시스턴트가 협력하여 일합니다. 이 논문은 두 개의 AI 어시스턴트를 활용하여 주식 쌍을 거래함으로써 (한 주식을 매수하고 다른 주식을 동시에 매도) 수익을 창출하는 'Moira'라는 시스템을 소개합니다.

다음은 간단한 비유를 통해 설명한 Moira 의 작동 방식입니다:

1. 문제: "책임 전가 게임"

전통적인 트레이딩 시스템에서는 손실이 발생하면 그 원인이 종종 미스터리입니다. 거래할 주식을 잘못 선택했을까요? 아니면 단순히 매수 및 매도 시점을 잘못 잡았을까요? 이는 요리를 실패한 셰프가 문제의 원인이 레시피 (고수준 계획) 에 있는지, 아니면 조리 과정 (저수준 실행) 에 있는지 알지 못하는 것과 같습니다. 피드백 (수익 또는 손실) 이 며칠 또는 몇 주 뒤에 나오기 때문에, 누구의 탓인지 또는 어떻게 수정해야 할지 파악하기 어렵습니다.

2. 해결책: 두 명의 매니저 팀

Moira 는 비즈니스에 **전략가 (Strategist)**와 **전술가 (Tactician)**가 있는 것처럼 업무를 두 가지 명확한 역할로 분할함으로써 이를 해결합니다.

  • 전략가 (The "Selector"): 이는 고수준의 보스입니다. 그들의 유일한 임무는 거시 경제 뉴스, 장기적 추세, 시장 심리 등 큰 그림을 살펴보고 다음 달에 거래할 주식 한 쌍을 선택하는 것입니다. 한 번 쌍을 선택하면 그들은 물러납니다. 그들은 버튼을 조작하지 않습니다.
  • 전술가 (The "Trader"): 이는 직접적인 작업을 수행하는 근로자입니다. 전략가가 주식 쌍 (예: 아마존과 메타) 을 선택하면 전술가가 업무를 인수합니다. 그들의 임무는 분 단위로 가격 변동을 관찰하고 수익을 내기 위해 정확히 언제 매수하거나 매도할지 결정하는 것입니다.

3. 비장의 무기: 개선을 위한 "대화"

일반적으로 AI 는 복잡한 수학 방정식 (기울기) 을 조정하며 학습합니다. Moira 는 다른 방식으로 작동합니다: 스스로와 대화하며 학습합니다.

  • 작동 방식: 전략가와 전술가 모두 이 설명 뒤에 있는 AI 와 같은 대규모 언어 모델 (LLM) 로 구동됩니다. 내부 수학을 변경하는 대신, 시스템은 이들에게 주어지는 **지시사항 (프롬프트)**을 변경합니다.
  • 피드백 루프:
    • 전술가를 위해: 일주일간의 거래 후, '비평가 (Critic)' AI 가 수행된 거래들을 검토합니다. 그리고 평범한 영어로 메모를 작성합니다: "뉴스가 나쁠 때 너무 일찍 매수했습니다. 다음에는 뉴스가 안정될 때까지 기다리세요." 시스템은 이 조언을 포함하도록 전술가의 매뉴얼을 다시 작성합니다.
    • 전략가를 위해: 한 달이 끝날 때, 비평가는 총 수익을 검토합니다. 그리고 메모를 작성합니다: "너무 변동성이 큰 주식 쌍을 선택했습니다. 다음에는 더 안정적인 뉴스가 있는 쌍을 찾으세요." 시스템은 전략가의 매뉴얼을 다시 작성합니다.

4. 이것이 더 나은 이유

이 논문은 실제 미국 주식 시장 데이터를 사용하여 이 시스템을 다른 방법들 (오래된 수학 공식 및 기타 AI 모델 등) 과 비교 테스트했습니다.

  • 결과: Moira 는 다른 방법들보다 훨씬 더 많은 수익을 창출했고 더 적은 리스크를 감수했습니다.
  • 비유: 모든 것을 한 번에 하려는 평면적인 AI 를 상상해 보세요 (주식 선택 거래 타이밍 잡기). 이는 저녁 식사를 준비하면서 동시에 소설을 쓰려는 사람처럼 혼란에 빠집니다. Moira 는 작업을 분리합니다. 전략가는 "스토리" (어떤 주식) 에 집중하고, 전술가는 "행동" (언제 거래할지) 에 집중합니다.
  • "튜닝" 효과: 논문은 AI 에게 이러한 텍스트 업데이트를 통한 "학습"을 허용하지 않고 기본 지시사항만 제공하면 성능이 저하된다는 것을 발견했습니다. 하지만 AI 가 피드백을 바탕으로 스스로 매뉴얼을 다시 쓰기 시작하면, 그것은 규율 있고 수익성 있는 트레이더가 됩니다.

요약

Moira 는 AI 가 어떻게 거래할지 가르치기 위해 언어를 사용하는 트레이딩 시스템입니다. 이는 무엇을 거래할지 선택하는 업무와 거래를 실행하는 업무를 분리합니다. AI 가 자신의 성과를 평범한 영어로 "비판"하고 자신의 지시사항을 업데이트함으로써, 전통적인 방법들보다 실수를 피하고 수익을 포착하는 능력을 훨씬 더 잘 학습합니다.

핵심 교훈: 이 논문은 "큰 그림" 의사결정과 "세부적인" 실행을 분리하고 언어를 사용하여 AI 의 규칙을 업데이트함으로써, 일반적으로 손실에 대한 책임 소재를 파악하기 어려운 복잡한 금융 문제를 해결할 수 있다고 주장합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →