← 最新论文
💻 computer science

A Reinforcement Learning Supervisor with Dynamic Performance-Metric Weighting for Cryptocurrency Portfolio Management

本文提出了一种强化学习监督框架,该框架通过动态权重化多个性能指标,从异构智能体集合中选择最优交易策略,并证明了在非平稳的加密货币市场中,其风险调整后收益优于单个智能体及固定策略。

原作者: Hee-jae Kwon, Su-cheon Lee, Eun-Ji Lee, Se-hun Lee, Tae-Geol Woo, Kang-moon Park

发布于 2026-09-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Hee-jae Kwon, Su-cheon Lee, Eun-Ji Lee, Se-hun Lee, Tae-Geol Woo, Kang-moon Park

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

投资金融市场是一场不断的适应游戏。随着经济从繁荣的增长期转向缓慢的横盘整理,或突然的剧烈衰退,游戏的规则也会随之改变。在这些环境下,一种在繁荣时期表现完美的单一策略,往往会在市场转向时惨遭失败。这就是投资组合管理的核心挑战:在未来充满不确定性且过去无法作为可靠地图的情况下,决定如何将资金分配到不同的资产中。几十年来,投资者一直依赖数学公式来平衡风险与回报,但这些静态模型在市场状况快速变化时往往显得力不从心。最近,计算机科学家转向了一种被称为“强化学习”的人工智能技术。这些计算机程序不是通过被教授特定规则来学习,而是通过试错法,在模拟市场中进行交互,以发现哪些行动能带来最佳的长期结果。虽然这些程序可以学会交易,但它们往往会陷入一种单一的思维模式,无法在市场机制发生变化时进行转型。

韩国交通大学的一个研究小组提出了一种解决这一问题的新方法。他们并没有试图构建一个完美的交易机器人,而是创建了一个类似于“监督者”的系统,负责管理一个由五个不同学习方法的交易机器人组成的团队。监督者本身并不进行交易,而是观察每个机器人在近期内的表现,并决定在任何时刻由哪一个机器人来掌管局面。研究人员使用来自加密货币市场的真实高频数据对该系统进行了测试,而加密货币市场以其极端的波动性和快速变化而闻名。他们发现,这个监督者系统通过动态切换到最适合当前市场状况的智能体,其表现始终优于任何单一机器人以及传统的投资策略。

研究人员首先构建了一个由五个不同智能体组成的团队。每个智能体都是一个旨在做出投资决策的计算机程序,但它们是使用不同的数学方法进行训练的。尽管所有智能体都在同一个投资组合环境中进行训练,并使用相同的奖励函数,但它们截然不同的学习机制使得每个智能体都发展出了独特的“个性”。有的可能非常激进,追求高利润但承担巨大风险;而另一个可能更为谨慎,优先考虑稳定性而非快速收益。在稳定的市场中,激进的智能体可能会脱颖而出;而在动荡的市场中,谨慎的那个可能才是唯一的幸存者。问题在于,没有任何一个智能体能始终在所有情况下都表现最佳。如果投资者只选择一个智能体并坚持使用,那么当市场转向该智能体所厌恶的方向时,很可能会遭受损失。

为了解决这个问题,研究人员引入了一个监督智能体。这个监督者并不了解它所管理的五个智能体的内部代码。相反,它就像一位观察比赛的教练,只看记分牌。它追踪每个智能体的七个不同性能指标,例如利润水平、获取该利润所承担的风险,以及正收益时段的比例。它会在不同的时间跨度上观察这些数字,从过去几小时到过去几天不等。监督者的任务是弄清楚目前哪些指标最为重要。在平静的市场中,监督者可能会认为稳定的持续利润是衡量优秀智能体最重要的信号;而在混乱的市场中,它可能会认为规避大幅亏损才是唯一重要的事。

监督者通过自身的训练过程来学习这种权重分配系统。它观察市场和智能体的近期历史,然后学习为不同的性能指标分配重要性得分。它不仅仅是选择近期利润最高的智能体,而是通过将性能数据与监督者为特定时刻学到的重要性权重相结合,为每个智能体计算一个总分。拥有最高总分的智能体将被选中来管理下一个交易周期的投资组合。这创造了一个不断重新评估自身选择的系统,随着市场环境的变化,在不同智能体之间转移信任。

研究人员使用来自币安(Binance)加密货币交易所的三十分钟价格数据对该系统进行了测试,涵盖了从2021年1月1日到2025年12月31日的时期。他们设置了两种不同的场景:一种包含四种热门加密货币,另一种则增加到五种,通过添加第五种资产来测试系统是否能处理规模稍大的投资组合。他们将这个监督者系统与五个独立的智能体、简单的等权重持有所有资产的策略以及几种传统的投资公式进行了对比。结果显而易见。监督者系统的最终投资组合价值显著高于任何单一智能体或传统策略。在四种资产的情景下,监督者将投资组合价值增长到了初始金额的2.349倍,而表现最好的单个智能体仅达到1.652倍。在五种资产的情景下,监督者达到了初始价值的3.044倍,而表现最好的单个智能体为2.554倍。

至关重要的是,这种额外的增长并非以更高的风险为代价。监督者系统的最大回撤(即最大损失)也比单个智能体更小。这表明该系统不仅是通过加大赌注来获得更高回报,它实际上是通过识别何时切换到更安全的智能体,从而更好地管理了风险。研究人员还将他们的系统与一个仅使用单一固定规则(例如始终选择近期利润最高的智能体)来切换智能体的简化版本进行了比较。监督者系统的表现远超这些单规则策略。这证明了该系统的成功源于其同时权衡多个因素的能力,而非依赖于单一、僵化的标准。

为了准确理解该系统为何奏效,研究人员进行了一系列通过移除系统部分组件来观察结果的测试。他们发现,系统需要所有的七个性能指标和四个时间窗口才能发挥最佳效果。移除利润相关的指标会削弱系统积累财富的能力,而移除风险相关的指标则会削弱其抵御损失的能力。同样,系统需要同时观察短期和长期的表现历史。在四种资产的测试中,长期历史最为重要,而在五种资产的测试中,短期历史则更为关键。这种变化表明,该系统并非在使用固定的规则,而是真正地在根据当前投资组合和市场条件的具体需求进行适应。

研究结论指出,管理投资组合不仅仅是寻找单一的最佳交易算法,更是要创建一个能够根据任务变化而选择合适工具的结构。通过使用一个监督者来动态权衡不同的性能信号,该系统能够比任何单一智能体或静态策略更有效地应对加密货币市场的不确定性。研究人员指出,目前的系统使用的是一组特定的五个智能体和一组特定的市场数据。未来的工作可以通过引入具有不同风险偏好的智能体,或在其他类型的资产上测试该系统来进行扩展。然而,核心发现依然稳健:一种通过基于灵活、多维度性能视角来学习选择策略的分层方法,为应对金融市场的不确定性提供了一种强大的途径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →