← 最新论文
📈 economics

Asset-Universe Design and Action-Space Granularity in Cointegration-Based Deep Reinforcement Learning for Cryptocurrency Statistical Arbitrage

本研究表明,基于协整关系的深度强化学习在加密货币统计套利中的样本外表现,关键取决于资产池构建与动作空间粒度,其中特定的资产池设计(如支付币种和基准 14)以及二元动作空间,与更广泛的资产池或更细粒度的动作规范相比,能产生更优越的回报。

原作者: Veliota Drakopoulou

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Veliota Drakopoulou

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名专业的赌徒,正试图在一场非常特定的游戏中获胜:统计套利(Statistical Arbitrage)

在这场游戏中,你的目标不是预测哪一枚硬币会上涨或下跌,而是赌两枚(或更多)硬币之间的关系。你会寻找那些通常步调一致的组合,就像在街上并肩行走的恩爱夫妻。有时,他们会因为步伐不一而产生一点距离(价格差距扩大)。你的任务就是押注他们会重新回到同步的状态。

这篇论文讲述了一位名叫 Veliota Drakopoulou 的研究人员提出的一个简单问题:“我挑选的‘伴侣类型’以及我投注的‘规则’,是否比我用来做决策的‘大脑’更重要?”

以下是她的研究结果,使用简单的类比进行说明。

1. “大脑”(人工智能)

研究人员使用了三种不同类型的深度强化学习(Deep Reinforcement Learning)来进行投注:

  • DQN: 一种基于价值的学习者(就像一个通过背诵最佳动作来学习的学生)。
  • PPO & A2C: 基于策略的学习者(就像一个通过试错来学习的学生)。
  • 基准模型 (COIN): 一个简单的、非人工智能的规则,它只是单纯地遵循数学逻辑,而不进行“学习”。

2. 两个大问题

该论文关注了两个经常被忽视的设计选择:

A. “资产宇宙”(舞池上有谁?)
在人工智能开始投注之前,你必须选择哪些加密货币被允许进入游戏。研究人员测试了四个不同的“舞池”:

  • “广泛型”舞池(20 种资产): 一个庞大且拥挤的派对,从比特币到各种冷门代币应有尽有。
  • “基准型”舞池(14 种资产): 一个标准的、混合型的群体。
  • “支付型”舞池(6 种资产): 一个小型的专属俱乐部,仅包含专注于支付功能的硬币(如比特币、莱特币、XRP)。
  • “第一层区块链(Layer-1)”舞池(9 种资产): 一个仅针对大型区块链平台(如以太坊、Solana)的俱乐部。

B. “动作空间”(你的注码有多大?)
一旦人工智能观察到两枚硬币之间出现差距,它该如何投注?

  • 二元制(全有或全无): 人工智能必须将 100% 的资金押在差距缩小上。它不能保留余力。这就像一名冲浪者,要么乘着整波浪潮前进,要么根本不下水。
  • 细粒度(灵活): 人工智能可以投注 100%50%0%(观望)。这就像一名冲浪者,可以只试探性地踩一下水,或者骑上半个浪头,或者等待更好的浪潮。

3. 结果:什么才真正奏效?

发现 #1:“谁在跳舞”比“怎么跳”更重要。
最重要的发现是,选择正确的硬币组合比选择最好的 AI 更重要。

  • 赢家: **“支付型硬币”**组(6 种资产)和 **“基准型”**组(14 种资产)表现最好。人工智能在这里赚取了巨额利润(在一次测试中高达 32%)。
  • 输家: **“广泛型”**组(20 种资产)和 **“Layer-1”**组(9 种资产)简直是灾难。即使是最好的 AI 在这里也会亏损。
  • 教训: 拥有更多的硬币并不意味着你会赚更多的钱。事实上,一个拥挤、嘈杂的派对(广泛型 20)会让 AI 无法找到清晰的模式。一个规模较小、相似度较高的群体(支付型 6)会让这种“舞蹈”变得更容易预测。

发现 #2:“全有或全无”的方法通常在盈利方面表现更好,但仅限于市场表现良好的时候。
令人惊讶的是,二元制(全有或全无)的动作空间通常比灵活的方案赚得更多,但前提是市场表现良好。

  • 当 AI 处于“好”的宇宙(支付型或基准型)时,采取激进策略(投注 100%)回报丰厚。
  • 然而,在“坏”的宇宙(即 AI 正在亏损的宇宙)中,细粒度(灵活)的方法挽救了局面。它允许 AI 说:“这看起来很危险,我只投 0%”,或者“我投 50%”,从而减少了损失的规模。
  • 教训: 灵活性是一个极佳的安全网,但如果信号足够强,“全仓投入”会更有利可图。

发现 #3:运气扮演了巨大的角色(“种子”问题)
研究人员使用不同的随机起始点(称为“种子”)多次运行了实验。

  • 有时,AI 赚取了 30% 的利润。
  • 有时,使用完全相同的设置,它却亏损了 10%。
  • 教训: 你不能信任单次“获胜”的运行。如果一个 AI 赚了一次钱,它可能只是运气好。真正的成功需要该策略在不同的随机起始条件下都能保持一致的表现。

核心结论

这篇论文告诉我们,构建交易 AI 不仅仅是挑选最聪明的算法(DQN、PPO 或 A2C)。更重要的是搭建正确的舞台

  • 不要把所有东西都往墙上扔: 一组规模较小、相似度较高的资产比一个庞大、混乱的列表效果更好。
  • 灵活性是为了防御: 给 AI “观望”的选择有助于它在糟糕的市场中生存,尽管这并不总能帮助它在好的市场中赢得更多。
  • 检查你的运气: 单次的成功测试运行不足以证明其有效性。你需要进行多次测试,以确定它是真的聪明还是仅仅运气好。

简而言之:你为 AI 构建的环境与 AI 本身同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →