← 最新论文
💰 quantitative finance

Reinforcement Learning for Execution under Dynamic Fees in a Closed-Loop DEX Simulator

本文引入了一个闭环 DEX 模拟器,旨在证明在动态费用环境下,一个小型深度 Q 网络(DQN)智能体相比于经过调优的基准模型能显著降低实现缺口,从而为自动做市商中的执行控制提供基于模型条件的反事实证据。

原作者: Wen-Ting Wang

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Wen-Ting Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图在去中心化交易所(DEX)出售一大堆数字饼干的交易员。在过去,出售你的饼干的“费用”是固定费率,就像糖果棒上的固定价格标签一样。但最近,这些交易所开始使用动态费用。这就像是出租车的动态调价算法:如果道路拥堵或天气恶劣,乘车价格就会立即上涨。

研究人员想要回答的核心问题是:一个智能计算机代理是否能比遵循简单规则的人类更好地应对这些变化的费用?

问题所在:“机器中的幽灵”

通常,科学家通过观察旧记录(历史数据)来研究交易。但这里有一个陷阱:在过去,费用变化不大,而且我们并不确切知道交易者做出那些选择的原因。这就像是通过观看一部棋子从未移动过的电影来学习如何下棋。如果游戏不会根据你的动作而改变,你就无法学习游戏是如何对你的动作做出响应的。

为了解决这个问题,作者构建了一个视频游戏模拟器。这是一个“闭环”世界,其中:

  1. (代理)尝试出售你的饼干。
  2. 市场会对你的销售做出反应,从而改变价格和费用。
  3. 其他玩家(噪声交易者和套利者)也会在市场中移动,并对市场做出反应。

至关重要的是,在这个游戏中,费用规则被设计得非常“聪明”。它会根据市场的状态进行变化,就像真实的动态费用系统一样。这使得计算机代理能够真正地学习市场是如何进行反击的。

竞赛:策略阶梯

作者并没有仅仅让他们的 AI 与随机猜测者进行对抗。他们构建了一个比前一个更聪明的对手“阶梯”:

  • 调度策略(The Schedule): 只是以稳定的节奏出售饼干,就像一个遵循计时器的机器人。
  • 单步前瞻(The One-Step Lookahead): 一个聪明的凡人,他观察下一秒的情况,计算出最佳动作,然后停止思考。
  • 规划者(The Planners): 试图模拟未来几步以观察结果的代理。
  • DQN(深度 Q 网络,Deep Q-Network): 这是故事中的“英雄”。这是一个小型、无模型的 AI,它通过试错来学习,试图在不被告知宇宙规则的情况下,弄清楚长期的最佳策略。

大揭秘

作者运行了 1,000 次模拟,使用了不同的随机市场场景(种子)来观察谁能获胜。

结果: 小型 DQN AI 击败了聪明的“单步前瞻”人类。

  • 领先多少? 它在交易成本上节省了大约 13.3 个基点(虽然只是百分之零点几的微小比例,但在交易中却是巨大的)。
  • 胜利源于何处? AI 学会了完美地把握交易时机,以撞上“低费率”窗口。它等待市场平静下来以及费用下降之前再进行销售。
  • 代价: 这种优势存在于动态费用环境中。当研究人员关闭动态费用并将其变为恒定(固定)费用时,AI 和简单的规则表现得完全一样。AI 并非仅仅是运气好;它专门学习了如何利用变化的费用。

AI 做了什么(以及没做什么)

AI 并没有变成一台印钞机。它没有预测未来,也没有找到一个“完美”的解决方案。

  • 它并没有明显击败“规划者”: 令其惊讶的是,那些试图规划 2 或 3 步之后的代理,其表现并没有比简单的单步前瞻人类更好或更差。由于市场噪音太大,他们无法看清全局,因此在统计学上与基准线持平。DQN 是唯一能够以统计确定性击败基准线的学习者。
  • 它并非在真空中运作: 如果 AI 被训练在市场变动之前采取行动,它表现得很好。但如果研究人员强制要求它在市场变动之后采取行动(一种不同的“顺序”),它的表现就会下降。然而,如果他们针对该特定新规则对 AI 进行重新训练,它就能恢复并再次获胜。这证明了 AI 正在学习游戏的特定节奏,而不仅仅是在死记硬背某种技巧。

这篇论文不是在说什么

了解这篇论文排除了什么非常重要:

  • 它不是一段历史课: 结果完全基于模拟。作者明确指出,这不是关于现实中交易者过去如何表现的证据。
  • 它不是利润保证: 论文并未声称在现实交易所部署此 AI 会让你致富。它是一个关于“控制力”的概念验证,而不是一份商业计划书。
  • 它不是一个“已解决”的问题: AI 并没有找到绝对最佳的策略(“事后诸葛亮”式的完美策略仍然优于 AI)。AI 只是找到了一个比我们目前使用的标准智能规则更好的方法。

底线

在这个特定的、模拟的世界里,一个小型学习型 AI 可以学会比遵循简单规则的聪明人类更好地应对动态费用。它学会了等待费用较低的正确时刻,从而在交易中节省了约 13.3 个基点。但这种技能仅适用于费用发生变化的市场;如果费用是固定的,AI 就和现有的简单规则一样。

这篇论文表明,在复杂且不断变化的去中心化金融世界中,学会适应可能是保持领先地位的唯一途径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →