← 最新论文
💰 quantitative finance

Data-Driven Merton's Strategies via Policy Randomization

本文针对模型参数未知的不完全市场,通过引入高斯策略随机化将经典 Merton 问题转化为连续时间强化学习框架,从而设计出无需估计模型先验的在线与离线演员 - 评论家算法,并证明了其在随机波动率环境下显著优于传统模型驱动方法。

原作者: Min Dai, Yuchao Dong, Yanwei Jia, Xun Yu Zhou

发布于 2026-02-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Min Dai, Yuchao Dong, Yanwei Jia, Xun Yu Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于**“如何在不知道游戏规则的情况下,依然能玩好投资游戏”**的故事。

想象一下,你被扔进一个巨大的、充满迷雾的赌场(金融市场)。这里有两样东西:一个是股票(价格忽上忽下),另一个是市场情绪因子(比如恐慌指数,它会影响股票波动)。你的目标是:在迷雾中通过买卖股票,让手里的钱变得最多。

传统的投资大师(模型派)会怎么做?
他们会先拿出一个放大镜,试图看清迷雾背后的规则。他们会收集过去几十年的数据,用复杂的数学公式去“猜”出股票上涨的平均速度是多少、波动有多大。一旦猜出了这些参数,他们就会把这些数字填进一个完美的公式里,算出“最佳策略”。
问题在于: 金融市场就像天气,永远在变。你想看清规则?太难了!而且,哪怕你猜错了一点点(比如把平均涨幅猜高了 0.1%),最后算出来的“最佳策略”可能会让你亏得底掉。这就是所谓的“先估计,再优化”的**插件法(Plug-in method)**的致命弱点。

这篇论文的作者们(来自港科大、同济、哥伦比亚大学等)提出了一种**“强化学习(RL)”的新思路,就像教一个“盲人摸象”的机器人**去投资。

核心创意:用“随机乱撞”来寻找真理

通常我们认为,投资要“深思熟虑”,不能乱来。但作者们提出了一个反直觉的观点:有时候,故意“乱来”(随机化策略)反而能帮你找到最好的路。

1. 辅助问题:给策略加点“噪音”

作者设计了一个**“辅助游戏”。在这个游戏里,投资者不再只做一个确定的决定(比如“今天买 50% 股票”),而是从一个高斯分布(钟形曲线)**里随机抽取一个决定。

  • 比如,策略说“买 50%",但随机化后,你可能实际买了 48%,也可能买了 52%。
  • 这个“随机性”就像是在迷雾中故意多走几步弯路,去试探一下周围的环境。

2. 关键发现:乱走也能找到正路

作者们证明了一个惊人的数学定理:

虽然你在“辅助游戏”里是随机乱走的,但如果你把这一连串随机决定的平均值拿出来,它竟然完美等于那个在“完美世界”里(知道所有规则)算出来的最优策略

比喻: 想象你在一个巨大的迷宫里找出口。

  • 传统方法:先派侦察兵把墙画下来,算出路线,然后走。如果墙画错了,你就撞墙了。
  • 本文方法:你闭着眼睛,在迷宫里随机乱走(但每次乱走都记录数据)。神奇的是,把你所有乱走的轨迹取个平均,竟然就是一条直通出口的直线!

3. 为什么需要“随机”?(温度参数 λ\lambda

你可能会问:“既然平均值是对的,我直接走直线不行吗?”
不行!因为在这个学习过程中,随机性(噪音)是学习的燃料

  • 如果你不随机(完全确定),当你计算“下一步该怎么走”时,信号会非常微弱,就像在嘈杂的房间里听不清别人说话。
  • 如果你加一点随机(温度参数 λ\lambda),就像给房间通了风,虽然声音有点杂,但你能听清方向,从而快速修正你的策略。
  • 平衡的艺术:随机太多,你会乱跑;随机太少,你学得太慢。作者们找到了一种完美的平衡点。

实验结果:真金白银的较量

作者们用两种数据测试了这种方法:

  1. 模拟数据(合成数据):他们自己造了一个复杂的金融市场环境。
    • 结果:传统的“先猜参数再投资”的方法,一旦参数猜错一点,策略就崩了。而他们的RL 算法,像是一个经验丰富的老手,直接根据市场反馈调整,表现远超传统方法,甚至比那些“全知全能”但参数估计不准的模型还要好。
  2. 真实数据(标普 500 指数,1990-2025)
    • 结果:在经历了互联网泡沫破裂、2008 年金融危机等大风大浪后,RL 策略不仅赚得更多,而且回撤(亏钱)更少,回本更快
    • 特别是在市场大跌时,传统方法因为依赖过去的错误参数,反应迟钝;而 RL 策略能像变色龙一样,迅速感知市场变化并调整仓位。

总结:这篇论文到底说了什么?

  1. 打破迷信:我们不需要知道市场的所有数学公式(模型参数)也能做好投资。
  2. 以退为进:通过引入“随机性”(Policy Randomization),我们构建了一个辅助问题,它的解的平均值就是我们要的最优解。
  3. 技术突破:这是一种**“端到端”**的学习方式。直接从数据(股价、波动率)映射到决策(买多少),跳过了中间那个容易出错的“猜参数”环节。
  4. 现实意义:对于普通投资者,这意味着未来的投资工具将不再依赖那些复杂的、容易过时的经济模型,而是像AlphaGo下围棋一样,通过与市场的实时互动,自我进化,找到最优策略。

一句话总结:
这篇论文告诉我们,在充满不确定性的金融世界里,不要试图去“预测”未来,而要设计一种能“适应”未来的机制。通过巧妙地引入“随机探索”,我们不仅能学会如何在迷雾中行走,还能走出比那些自以为看清了地图的人更稳健、更赚钱的路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →