Moira: Language-driven Hierarchical Reinforcement Learning for Pair Trading
本文提出了"Moira",这是一种语言驱动的分层强化学习框架,利用大型语言模型同时执行高层配对选择与底层执行任务,并仅基于文本反馈通过提示更新对其进行优化,以解决配对交易中的信用分配难题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你经营着一家非常精密的交易公司,但你不是雇佣人类团队,而是让两个专业的 AI 助手协同工作。本文介绍了一个名为Moira的系统,它利用这两个 AI 助手通过交易股票对(同时买入一只股票并卖出另一只)来获利。
以下是 Moira 的工作原理,通过简单的类比进行解释:
1. 问题:“推诿游戏”
在传统交易系统中,如果亏损,往往是个谜。是你选错了要交易的股票?还是仅仅买卖时机不对?这就像一位厨师端上了一道糟糕的菜肴,却不知道问题出在食谱(高层计划)还是烹饪过程(底层执行)上。由于反馈(盈利或亏损)要几天甚至几周后才出现,很难确定该责怪谁或如何修正。
2. 解决方案:双经理团队
Moira 通过将工作拆分为两个截然不同的角色来解决这个问题,就像企业拥有战略家和战术家一样。
- 战略家(“选择者”): 这是高层主管。他们唯一的工作是纵观全局——经济新闻、长期趋势和市场情绪——并为下一个月挑选一对股票进行交易。一旦选定一对股票,他们便退居幕后。他们不触碰任何按钮。
- 战术家(“交易员”): 这是亲力亲为的执行者。一旦战略家选定一对股票(例如亚马逊和 Meta),战术家便接手。他们的工作是每分钟监控价格波动,并决定何时买卖以获利。
3. 秘诀:“对话”以提升
通常,AI 通过调整复杂的数学方程(梯度)来学习。Moira 则有所不同:它通过与自己对话来学习。
- 工作原理: 战略家和战术家都由大型语言模型(即生成此解释背后的 AI)驱动。系统不是改变它们内部的数学逻辑,而是改变给它们的指令(提示词)。
- 反馈循环:
- 对于战术家: 在一周的交易后,一个“批评者”AI 会审查已执行的交易。它会用通俗的英语写下一条备注:“你在新闻不利时过早买入。下次,等新闻尘埃落定后再行动。”随后,系统会重写战术家的操作手册,纳入这条建议。
- 对于战略家: 在月末,批评者会审视总利润。它会写下一条备注:“你挑选了一对波动性过大的股票。下次,寻找新闻更稳定的股票对。”系统随即重写战略家的操作手册。
4. 为何这更优越
该研究使用真实的美国股市数据,将此方法与其他方式(如老式数学公式和其他 AI 模型)进行了测试。
- 结果: Moira 比其他方法赚取了显著更多的利润,且承担的风险更小。
- 类比: 想象一个扁平的 AI 试图同时做所有事情(既选股又把握交易时机)。它会感到困惑,就像一个人在写小说的同时还要做晚饭。Moira 将任务分离开来。战略家专注于“故事”(选哪些股票),而战术家专注于“行动”(何时交易)。
- “调优”效应: 研究发现,如果仅仅给 AI 基本指令而不让它通过这些文本更新从错误中“学习”,其表现会很差。但一旦 AI 开始根据反馈重写自己的操作手册,它就会变成一位纪律严明、有利可图的交易者。
总结
Moira 是一个利用语言来教导 AI 如何交易的系统。它将选择交易标的的工作与执行交易的工作分离开来。通过让 AI 用通俗英语“批评”自己的表现并更新其自身指令,它学会了避免错误并捕捉利润,其效果远优于传统方法。
核心要点: 该论文声称,通过将“大局”决策与“琐碎”执行分离,并利用语言来更新 AI 的规则,可以解决那些通常难以确定亏损归咎于谁的复杂金融问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。