← 最新论文
💰 quantitative finance

Self-Supervised Auxiliary Task Discovery for Stable Reinforcement Learning in Stock Trading

本文提出了一种自监督框架,该框架通过元梯度机制自动发现基于通用价值函数(General Value Function)的辅助任务,旨在增强表示学习并稳定跨不同市场机制的股票交易策略。

原作者: Arishi Orra, Himanshu Choudhary, Manoj Thakur

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Arishi Orra, Himanshu Choudhary, Manoj Thakur

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,股票交易领域一直是人类直觉与混乱、多变的市场的博弈之地。几十年来,交易员一直依赖算法来筛选海量数据,希望能找到预测价格上涨或下跌的模式。近年来,一种被称为强化学习的强大人工智能技术已成为执行此项任务的主导工具。想象一下,一个数字智能体并非通过被告知正确答案,而是通过尝试行动、犯错,并从其经历的盈亏中缓慢学习,从而学会如何进行交易。这种方法之所以具有前景,是因为它能够适应变化的环境,不像那些假设市场今日表现与昨日一致的旧方法那样。然而,教导这些智能体既能盈利又保持稳定是非常困难的。金融市场充满噪声且难以预测,往往在很久之后才会针对某个特定决策的好坏向智能体提供明确反馈。由于缺乏清晰的引导,智能体可能会难以学习,变得不稳定,或者无法将其技能泛化到新的市场条件下。

为了帮助这些智能体更快、更可靠地学习,研究人员通常会给它们一些额外的、较小的任务,让它们在实现赚钱这一主目标的同时去解决这些任务。这些被称为辅助任务。传统上,专家必须手动设计这些额外的任务,猜测哪些任务可能有助于智能体更好地理解市场,例如预测下一次价格变化或估计市场的波动程度。但这种手动方法的缺陷在于,市场是在不断变化的。一个在平稳时期表现良好的任务,在动荡时期可能会变得毫无用处甚至有害。如果辅助任务是固定不变的,它们就无法适应不断变化的市场格局,从而使交易智能体获得过时或无关的信息。

来自印度理工学院曼迪分校(IIT Mandi)的一个研究小组开发了一种解决此问题的新方法。他们没有要求人类去猜测哪些额外的任务会有所帮助,而是创建了一个能够自动发现这些任务的系统。他们将这个新框架称为 QUESTrader。其核心思想是让人工智能自行发现它需要学习什么。该系统采用双网络设计:一个网络是主交易员,学习如何买卖股票以实现利润最大化;第二个网络充当“问题生成器”。它会根据研究中使用的每日收盘价数据和技术指标,不断提出新的、简单的、基于当前体验的问题供主交易员回答,例如“未来几天价格会如何变化?”或“市场会如何波动?”。这些问题不是固定的,而是根据系统当前的经历动态生成的。随后,系统会在训练主交易员进行交易的同时,训练其回答这些问题。

这种方法的精妙之处在于系统如何决定哪些问题值得提问。研究人员使用了一种复杂的学习机制,该机制会观察长期结果。它会追问:“回答这个特定的问题是否有助于交易员在稍后做出更好的决策?”如果一个问题带来了更好的交易表现,系统就会调整其参数以继续提问;如果一个问题被证明是一种干扰,系统则会优化其参数以停止生成该问题。这一过程确保了辅助任务始终与当前的市场状况相关。研究人员在四个主要的全球股票市场进行了测试:美国的道琼斯工业平均指数、英国的富时100指数、印度的 Sensex 指数以及台湾的加权指数(TAIEX)。他们将这一新系统与广泛的现有策略进行了对比,包括传统的投资方法、标准的 AI 模型以及其他使用人工设计辅助任务的系统。

结果令人瞩目。在所有四个市场中,QUESTrader 系统始终优于其他方法。在美国市场,它实现了 21.785% 的年回报率,显著高于排名第二的方法(其回报率为 18.176%)。更重要的是,该系统不仅赚得更多,而且表现得更加稳定。它实现了最高的风险调整得分,这意味着它在承担每一单位风险时能创造更多的利润。当市场下跌时,QUESTrader 智能体的亏损也比竞争对手少。例如,在印度市场,它维持了 10.584% 的最大回撤,远低于其他先进模型的 17.783%。该系统在波动剧烈的台湾市场同样表现出色,提供了 30.279% 的年回报率,远超所有其他方法。

研究人员发现,成功的关键在于系统能够实时调整其辅助任务的能力。通过自动发现正确的问题,交易智能体建立了一个更丰富、更准确的市场理解。它学会了识别人类设计的任务可能会遗漏的模式。研究还探讨了系统应同时提出多少个问题,以及在判断一个问题的价值时应向未来看多远。他们发现,适中的问题数量(约 16 到 64 个)效果最好,并且在学习过程中向前看大约十个步骤,可以使系统正确地将未来的成功归功于正确的问题。这种平衡防止了系统因信息过多而过载,或因展望太远而产生困惑。

这项工作表明,自动化交易的未来可能不在于设计更好规则的聪明人类,而在于能够自我教导该关注什么的聪明机器。通过让系统发现自己的学习目标,研究人员创造了一个比依赖静态、人工指令的系统更具鲁棒性、更具适应性且最终更具盈利能力的交易智能体。研究结果表明,在复杂多变的金融世界中,学习“如何学习”的能力与学习“如何交易”的能力同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →