← 最新论文
📊 statistics

Learning Stock Trading Policies via Barycenter-Based Adversarial Inverse Reinforcement Learning

本文介绍了 BRaG,这是一个基于重心(barycenter)的对抗性逆强化学习框架,该框架通过 Wasserstein 重心聚合异构专家策略,并结合控制屏障函数来学习稳定的、风险意识型的股票交易策略,从而在全求股票市场中表现优于经典规则和深度强化学习方法。

原作者: Arishi Orra, Himanshu Choudhary, Manoj Thakur

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Arishi Orra, Himanshu Choudhary, Manoj Thakur

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

股票交易的世界是一个庞大且嘈杂的引擎,资金根据预测、模式以及人类恐惧与贪婪的持续波动而流动。几十年来,投资者一直试图构建能够比人类更好地驾驭这种混沌的机器。挑战在于市场本身的性质:它不会给出清晰的指令或即时的反馈。交易者今天可能做出一个决定,但该选择的真实结果——究竟是英明的举措还是代价高昂的错误——可能要在几天、几周甚至几个月后才会显现。这种延迟使得教导计算机如何进行交易变得异常困难,因为机器很难将其行为与很久之后才到来的后果联系起来。此外,市场是不可预测的,并且在不断改变其规则,这意味着今天完美的策略到了明天可能会失效。虽然传统方法依赖于由人类编写的固定规则,而较新的方法则利用人工智能从数据中学习,但两者在面对现实世界金融的复杂性时——特别是在管理风险和避免灾难性损失方面——往往都会失灵。

在最近的一项研究中,来自印度理工学院曼迪分校(IIT Mandi)的研究人员提出了一种教导计算机如何交易的新方法,这种方法旨在借鉴众多专家的智慧,而不是尝试从零开始学习。他们将这个系统称为 BRaG。BRaG 并非要求计算机通过猜测和尝试来摸索最佳交易方式(这往往会导致剧烈波动和危险错误),而是让计算机通过观察一组多元化的成功交易策略来进行学习。想象一下,一名学生正在学习一项复杂的技能;与其仅仅模仿一个人,不如通过观察一个由不同风格组成的专家小组——其中一些人激进,一些人谨慎,一些人追随趋势,而另一些人则押注于反转——会学得更好。研究人员收集了来自五种截然不同的交易风格的数据,涵盖了从简单的移动平均线到更复杂的动量策略。然而,仅仅将这些不同的风格混合在一起会造成混乱。为了解决这个问题,团队开发了一种数学方法,寻找一个代表了所有专家最优秀、最稳定部分的“中心点”。这个中心点作为一个可靠的指南,在计算机接触真正的资金之前,展示了一条安全且有效的路径。

这一过程分为两个不同的阶段。首先,计算机经过预训练,以模仿这种稳定的、综合的专家行为。在这个阶段,机器学习做出看起来像是专家策略中最明智部分的决策,而无需理解其背后的复杂原因,也不需要等待延迟的奖励。这一步至关重要,因为它为计算机打下了坚实的基础,防止它在学习过程中漫无目的地徘徊或进行鲁莽的赌博。一旦计算机内化了这些良好的习惯,第二个阶段就开始了。研究人员随后让计算机在模拟市场中使用真实的财务奖励进行交易。现在,计算机不再仅仅是模仿专家,而是通过完善自己的策略,学习如何适应市场的起伏,同时仍保持着早期学到的安全行为。为了确保计算机不会因为过于贪婪而承担过高风险,该系统包含了一个严格的安全机制。这个机制就像一个护栏,不断检查计算机的投资组合价值。如果一笔交易威胁到投资组合的价值使其偏离最高点过远,系统会自动拦截该交易或对其进行调整,以保持在安全限度内。这确保了即使在计算机学习变得更加激进以赚取更多利润时,也绝不会跨越危险的界限。

研究人员在世界四个主要的股票市场进行了测试:美国、英国、印度和台湾。他们将该系统与广泛的竞争对手进行了比较,包括传统的交易规则、随机猜测以及近年来开发的先进人工智能模型。结果在所有四个市场中都表现得清晰且一致。这个新系统 BRaG 始终优于其他方法,随着时间的推移产生了更高的总回报。更重要的是,它实现了更高的稳定性。虽然其他人工智能模型往往表现出剧烈的性能波动,即经历巨大的收益后紧接着出现大幅下跌,但 BRaG 保持了更平滑、更可靠的增长曲线。它实现了更高的盈亏比,意味着它在承担每一单位风险时能获得更多的利润。它也较少遭受严重损失,在艰难的市场条件下,能有效防止投资组合价值跌落过深。研究表明,该系统并非仅仅靠运气;它具有鲁棒性,即使在测试从未见过的数据时也能表现出色。

这种方法的成功凸显了我们构建金融工具方式的转变。研究人员发现,与其试图设计一套完美的规则,或者寄希望于单一算法能自行搞定一切,不如将多种不同策略的长处结合起来,从而创造出更强大且更安全的结果。通过首先学习平衡的专家行为组合,然后再利用真实的交易经验来精炼这些知识,计算机学会了既能盈利又能审慎。这项研究表明,有效自动化交易的关键不仅在于机器的智能,还在于它所接受指导的质量以及它所遵循的安全限制的严格程度。这种方法为创建能够驾驭复杂且波动的金融世界,而不至于迷失方向或冒着倾家荡产风险的交易系统,提供了一条充满前景的道路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →