Bridging Behavioral Finance and Robust Agentic DRL: A novel computational framework for Portfolio Selection
本研究引入了 RPPO-MPT,这是一种新型鲁棒强化学习框架,它通过将基于扰动的降噪技术与受前景理论启发的奖励塑造相结合,通过更好地在市场不确定性下对齐投资者的行为偏好,从而在股票投资组合优化方面超越传统模型。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位正在波涛汹涌的大洋中航行的船长。这片海洋代表着股市,而你的船就是你的投资组合。
长期以来,船长们(投资者)一直使用两种主要的航行方式:
- 旧地图(传统金融): 假设海洋是可预测的,且水手们都是完美的逻辑机器人,他们只关心如何尽可能快地到达目的地,而不顾及海浪有多可怕。
- 新 GPS(标准人工智能): 这类 AI 使用计算机通过学习过去的风暴来驾驶。然而,大多数 AI 船长仍然表现得像机器人一样。它们会被大浪(收益)激起兴奋,但也会像人类一样在水流变得混乱时轻易陷入恐慌,从而做出并不符合真实人类投资者直觉的决策。
这篇论文介绍了一位全新的、超级智能的 AI 船长,名为 RPPO-MPT。它旨在通过结合三种特定的技巧来更好地应对这场风暴海洋。
新船长的三个技巧
1. “如果……会怎样?”训练(鲁棒性/稳健性)
想象一下你正在进行一场比赛练习。普通的船长在晴朗的日子里练习。如果比赛当天突然遭遇风暴,他们可能会不知所措。
这位新船长则在模拟器中进行练习,计算机会在训练数据中故意加入虚假的暴风雨、阵风和浓雾。它会问:“如果风力增强 5% 会怎样?如果洋流稍微偏移会怎样?”
通过在这些“虚假”的混乱条件下进行训练,船长学会了即使在真实的海洋变得混乱时,也能保持冷静并正确转向。这被称为基于扰动的鲁棒学习。这使得 AI 对噪声的敏感度降低,并且不太可能在市场剧烈波动时做出恐慌性的决策。
2. “人类之心”奖励系统(前景理论)
标准的 AI 船长每赚到一美元就会获得一个“小红星”(奖励)。但真实的人类并不是这样的。
- 恐惧: 损失 100 美元带来的痛苦感,要比发现 100 美元带来的快乐感强烈得多。
- 希望: 我们会对收益感到兴奋,但对损失却感到恐惧。
新船长被编程了一个**“希望-恐惧”奖励系统**。它不仅仅是计算美元,还会根据人类的“感受”来计算得分。 - 如果船只盈利,它会获得一个“希望”分(但随着财富增加,兴奋感的增长会放缓)。
- 如果船只亏损,它会获得一个“恐惧”分(而且这种痛苦会被放大 2.25 倍!)。
这教会了 AI 要比追求收益更自然地关注规避损失,从而模仿了人类真实的投资行为。
3. 混合方法
论文对比了三种版本的船长:
- 基础型船长 (PPO): 使用标准 AI GPS。表现尚可,但有时会被市场的剧烈波动所动摇。
- 强韧型船长 (RPPO): 使用“如果……会怎样?”训练。非常稳健,能很好地处理噪声,但不懂人类的恐惧。
- 超级型船长 (RPPO-MPT): 同时使用了“如果……会怎样?”训练以及“人类之心”奖励系统。
比赛结果
作者使用 15 家大型美国公司(如苹果和亚马逊)的长期数据对这些船长进行了测试(时间跨度为 2010 年至 2025 年)。他们将时间分为两个阶段:“练习”期(2010–2022)和“实战比赛”期(2022–2025)。
以下是发生的情况:
- 基础型船长表现尚可,但有时会被市场的剧烈波动所干扰。
- 强韧型船长更加稳健,并能很好地应对噪声。
- 超级型船长 (RPPO-MPT) 赢得了比赛。
为什么超级型船长赢了?
- 更高的回报: 随着时间的推移,它赚取了更多的利润。
- 更好的安全性: 在比赛最惊险的阶段,它的亏损较少(较低的回撤)。
- 更快乐的投资者: 因为它理解“希望-恐惧”的平衡,它能产生让人的感受更好的结果,提供了更高的“效用”评分。
核心结论
这篇论文声称,通过教导 AI 在虚假的混乱中练习(以建立强韧性)并像人类一样思考(以理解恐惧与希望),你可以创造出一个比标准 AI 模型既更安全又更具盈利能力的投资组合管理者。它弥合了冰冷的数学逻辑与人类复杂、感性的投资现实之间的鸿沟。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。