An Ensemble PPO Trading Agent Across Real Limit Order Book and Long-Horizon OHLCV Data: Diagnosis, Correction, and Honest Evaluation
본 논문은 PPO 기반 비트코인 트레이딩 에이전트에 대한 투명한 경험적 연구를 제시하며, 해당 에이전트가 Buy-and-Hold 전략 대비 완만한 장기적 초과 수익을 달기 위해 결정적인 학습 실패를 진단하고 수정하는 과정을 다루는 동시에, 실시간 리밋 오더 북(limit order book) 데이터가 거래 비용이 미세한 가격 변동보다 크기 때문에 종종 합리적인 '무거래(no-trade)' 정책을 도출한다는 점을 입증함으로써, 결과적으로 세련된 성공 서사보다 재현 가능한 부정적 결과 보고의 가치를 옹호한다.