Reinforcement Learning for Execution under Dynamic Fees in a Closed-Loop DEX Simulator
이 논문은 폐쇄 루프형 DEX 시뮬레이터를 도입하여, 소규모 심층 Q-네트워크(DQN) 에이전트가 동적 수수료 환경에서 튜닝된 벤치마크 대비 구현 결핍(implementation shortfall)을 유의미하게 감소시킨다는 것을 입증함으로써, 자동화된 마켓 메이커에서의 실행 제어를 위한 모델 조건부 반사실적 증거를 제공한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
당신이 탈중앙화 거래소(DEX)에서 거대한 양의 디지털 쿠키를 팔려고 노력하는 상인이라고 상상해 보십시오. 옛날에는 쿠키를 파는 데 드는 "수수료"가 사탕 바에 붙은 고정 가격표처럼 고정된 비율이었습니다. 하지만 최근, 이 거래소들은 **동적 수수료(dynamic fees)**를 사용하기 시작했습니다. 이것은 마치 택시의 수요 급증 가격 책정 알고리즘과 같습니다. 도로가 혼잡해지거나 날씨가 나빠지면 탑승 요금이 즉각적으로 올라가는 것과 같습니다.
연구자들이 답을 얻고자 했던 핵심 질문은 다음과 같습니다: 스마트한 컴퓨터 에이전트가 단순한 규칙을 따르는 인간보다 변화하는 수수료를 더 잘 헤쳐 나갈 수 있는가?
문제점: 기계 속의 "유령"
보통 과학자들은 과거의 기록(역사적 데이터)을 살펴보며 트레이딩을 연구합니다. 하지만 여기에는 함정이 있습니다. 과거에는 수수료가 거의 변하지 않았으며, 트레이더들이 왜 그런 선택을 했는지 정확히 알 수 없습니다. 이는 마치 체스 조각들이 절대 움직이지 않는 영화를 보면서 체스를 배우려는 것과 같습니다. 당신의 움직임에 따라 게임이 어떻게 반응하는지(변하는지)는 결코 배울 수 없습니다. 당신이 움직여도 게임은 마음을 바꾸지 않기 때문입니다.
이를 해결하기 위해 저자들은 비디오 게임 시뮬레이터를 구축했습니다. 이것은 "폐쇄 루프(closed-loop)" 세계입니다:
- 당신(에이전트)은 쿠키를 팔려고 노력합니다.
- 시장은 당신의 판매에 반응하여 가격과 수수료를 변경합니다.
- 다른 플레이어들(노이즈 트레이더와 차익 거래자들) 또한 시장에 반응하며 움직입니다.
결정적으로, 이 게임에서 수수료 규칙은 "스마트"하게 설계되었습니다. 실제 동적 수수료 시스템처럼 시장 상태에 따라 변화하도록 설계되었습니다. 이를 통해 컴퓨터 에이전트는 시장이 어떻게 맞서 싸우는지 실제로 학습할 수 있습니다.
콘테스트: 전략의 사다리
저자들은 단순히 AI를 무작위로 추측하는 자와 대결시킨 것이 아닙니다. 그들은 각 단계마다 이전 단계보다 더 똑똑한 "사다리" 형태의 상대들을 구축했습니다:
- 스케줄 방식(The Schedule): 타이머를 따르는 로봇처럼 일정한 속도로 쿠키를 판매하는 방식입니다.
- 일보 앞을 내다보는 방식(The One-Step Lookahead): 다음 1초를 내다보고 최선의 움직임을 계산한 뒤, 바로 생각을 멈추는 똑똑한 인간 모델입니다.
- 플래너(The Planners): 몇 단계 앞을 시뮬레이션하여 어떤 일이 일어날지 예측하고 계획하는 에이전트들입니다.
- DQN (Deep Q-Network): 이야기의 "주인공"입니다. 이것은 모델 프리(model-free) 방식의 작은 AI로, 우주의 법칙을 직접 배우지 않고도 시행착오를 통해 장기적으로 최선인 전략을 찾아내도록 학습됩니다.
대반전
저자들은 누가 이기는지 확인하기 위해 서로 다른 무작위 시장 시나리오(시드)를 사용하여 시뮬레이션을 1,000번 실행했습니다.
결과: 작은 규모의 DQN AI는 똑똑한 "일보 앞을 내다보는" 인간을 이겼습니다.
- 얼마나 더 나았나? AI는 거래 비용에서 약 13.3 베이시스 포인트(매우 작은 비율이지만 트레이딩에서는 매우 큰 수치)를 절감했습니다.
- 승리의 비결은 무엇인가? AI는 거래 타이밍을 완벽하게 맞추어 "낮은 수수료" 구간을 공략하는 법을 배웠습니다. 시장이 진정되고 수수료가 떨어질 때까지 기다렸다가 판매한 것입니다.
- 함정: 이 이점은 오직 동적 수수료 환경에서만 존재했습니다. 연구자들이 동적 수수료를 끄고 고정 수수료(평탄한 수수료)로 만들었을 때, AI와 단순한 인간의 성능은 동일했습니다. AI는 단순히 운이 좋았던 것이 아니라, 변화하는 수수료를 이용하는 법을 구체적으로 학습한 것입니다.
AI가 한 것 (그리고 하지 않은 것)
AI가 마법의 돈 복사기가 된 것은 아닙니다. 미래를 예측하거나 "완벽한" 솔루션을 찾아낸 것도 아닙니다.
- 플래너를 이기지는 못했다: 놀랍게도 2~3단계 앞을 계획하려던 에이전트들은 단순한 일보 앞을 내다보는 인간보다 유의미하게 더 잘하거나 못하지 않았습니다. 시장이 너무 노이즈가 심해 그들이 명확하게 볼 수 없었기에, 결국 기준점(baseline)과 통계적으로 비슷한 성적을 냈습니다. DQN만이 통계적 확실성을 가지고 기준점을 이겨낸 유일한 학습자였습니다.
- 독립적으로 작동하지 않았다: 만약 AI가 시장이 움직이기 전에 행동하도록 훈련받았다면 훌륭한 성과를 냈습니다. 하지만 연구자들이 AI가 시장이 움직인 후에 행동하도록 강제했을 때(다른 순서 적용), 성능이 떨어졌습니다. 그러나 그 특정 새로운 규칙에 맞춰 AI를 재학습시키자, 다시 회복하여 승리했습니다. 이는 AI가 단순히 기술을 암기한 것이 아니라, 게임의 특정한 리듬을 학습했음을 증в합니다.
이 논문이 말하고자 하는 것이 아닌 것
이 논문이 무엇을 배제하고 있는지 아는 것이 매우 중요합니다:
- 이것은 역사 수업이 아닙: 결과는 전적으로 시뮬레이션에 기반합니다. 저자들은 이것이 실제 트레이더들이 과거에 어떻게 행동했는지에 대한 증거가 아님을 명시했습니다.
- 이것은 수익 보장이 아닙: 이 논문은 이 AI를 실제 거래소에 배치하면 부자가 될 것이라고 주장하지 않습니다. 이것은 비즈니스 플랜이 아니라 '제어(control)'에 관한 개념 증명입니다.
- 이것은 "해결된" 문제가 아닙: AI가 절대적인 최적의 전략을 찾은 것은 아닙니다(사후적으로 완벽한 전략은 여전히 AI보다 뛰어났습니다). AI는 단지 현재 우리가 사용하는 일반적인 스마트 규칙들보다 더 나은 방법을 찾아냈을 뿐입니다.
결론
이 특정한 시뮬레이션 세계 안에서, 학습하는 작은 AI는 단순한 규칙을 따르는 똑똑한 인간보다 동적 수수료와 더 잘 어울리는 법을 배울 수 있습니다. AI는 수수료가 낮을 때를 기다려 거래함으로써 약 13.3 베이시스 포인트를 절감했습니다. 하지만 이 기술은 수수료가 변하는 시장에 특화되어 있습니다. 수수료가 고정되어 있다면, AI는 이미 존재하는 단순한 규칙들과 다를 바 없습니다.
이 논문은 복잡하고 끊임없이 변화하는 탈중앙화 금융의 세계에서, 적응하는 법을 배우는 것이 살아남는 유일한 방법일 수 있음을 시사합니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.