← 最新论文
💰 quantitative finance

FinSMART: Financial Sentiment Analysis for Algorithmic Trading through Market-Aligned Reinforcement Learning

FinSMART 引入了一种新颖的市场对齐强化学习框架,该框架利用已实现的市场结果而非静态的人类标注来优化金融情绪分析,在盈利能力方面显著优于现有方法,并能够持续适应不断变化的市场动态。

原作者: Giorgos Iacovides, Wuyang Zhou, Danilo Mandic

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Giorgos Iacovides, Wuyang Zhou, Danilo Mandic

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人预测天气。你可以给它看成千上万张陈旧的、布满灰尘的天气图,并要求它记住云朵看起来是什么样子的,以及在那之后是否下雨了。这就是大多数计算机程序如今的学习方式:它们研究过去案例的静态库,并寄希望于未来与过去一模一样。但如果天气突然变化了呢?如果出现了一种旧书中从未记载的新型风暴呢?这个机器人将会陷入困境,只能根据过时的规则进行猜测。这就是那些试图通过阅读财经新闻来预测股价的计算机所面临的问题。它们目前是基于“人工标注数据集”进行训练的——本质上,就是由人类阅读新闻并写下对股市是“好”还是“坏”的判断。但人类的速度太慢、成本太高,而且他们的观点可能并不符合混乱且瞬息万变的股票市场。

欢迎来到“强化学习”的世界。请不要把它想成是在读教科书,而要把它想成是在玩电子游戏。它不是在死记硬背答案,而是通过尝试、犯错并在做得好时获得积分(奖励)来学习。在你即将阅读的这篇论文中,作者介绍了一种教计算机理解财经新闻的新方法。他们称之为 FinSMART。FinSMART 不再要求人类来给计算机的答案打分,而是让股票市场本身成为老师。如果计算机预测某只股票会上涨,而该股票确实上涨了,它就会获得高分。如果它预测错了,它就会得到低分。这使得计算机可以直接从真实、混乱且充满噪声的市场现实中学习,而不是从一个安静、静态的旧数据教室中学习。


问题所在:只会读书的机器人

长期以来,试图预测股市的计算机就像是那些只用去年的考卷来准备考试的学生。它们使用“大语言模型”(LLMs)——即能够像人类一样阅读和写作的超智能 AI——来扫描财经新闻。但这些 AI 通常是使用“监督学习”进行训练的。想象一下,一位老师递给学生一叠已经用红墨水写好了答案的新闻文章:“这是好的”、“这是坏的”。学生记住了这些红墨水写的答案。

问题在于,股票市场是一个每秒都在变化的生命体。去年的“红墨水”答案在今天可能完全错误。此外,雇人来写这些答案既慢又贵。论文指出,依赖这些静态的、人工制作的标签,就像是试图用一张平静湖泊的地图来航行在波涛汹涌的大海中。这些模型是“市场无关”的,这意味着它们并不真正关心在做出预测后现实市场中发生了什么;它们只想匹配人类给出的标签。

解决方案:让市场成为老师

作者引入了 FinSMART,这是一个颠覆性的框架。它不再要求人类来为 AI 打分,而是要求股票市场来为它打分。

以下是这一神奇过程的逐步解析:

  1. 设置: AI 阅读一篇财经新闻文章,并猜测股票会走势向上(正面)、向下(负面)还是持平(中性)。
  2. 现实检验: 系统等待观察当天股票价格的实际表现。
  3. 评分: 如果 AI 预测为“正面”,且股价确实上涨了(具体而言,是如果其涨幅超过了大盘一定程度),AI 就会获得高额奖励。如果它预测为“负面”,且股价崩盘了,它也会获得奖励。但如果它预测为“正面”,而股价却崩盘了,它会受到严厉的惩罚。
  4. 过滤器: 市场是有噪声的。有时一只股票上涨仅仅是因为整个经济环境向好,而不是因为那条新闻。为了解决这个问题,FinSMART 使用了一个聪明的“双重过滤器”系统。只有当股票运动方向正确,且该运动强度足以被视为真实的信号而非随机噪声时,系统才会给予奖励。这就像一位老师,只有当你答对题目并且展示了清晰的解题过程时,才会给你一颗金星,而忽略那些仅仅靠运气答对的情况。

这个过程被称为市场对齐强化学习(Market-Aligned Reinforcement Learning)。AI 通过反复玩转交易这款游戏来学习,并根据市场给出的分数来调整它的“大脑”(即其“权重”)。

秘诀:GRPO 与“小组”游戏

你可能会问:“如果市场如此嘈杂,AI 不会感到困惑吗?”作者使用了一种特殊的训练技巧,叫做群体相对策略优化(Group Relative Policy Optimization,简称 GRPO)

想象一个教室,老师并不告诉学生某个答案是绝对的“正确”或“错误”。相反,老师要求八名学生回答同一个问题。然后,老师说:“得分最高的学生可以获得奖金,而得分最低的学生会扣分。”AI 通过为同一篇新闻文章生成八个不同的猜测来实现这一点。它将这些猜测进行相互比较。如果其中一个猜测比其他猜测带来了更好的市场结果,AI 就会学习更多地做出这种类型的猜测。这有助于 AI 即使在混乱且模糊的市场数据中也能找到最佳信号。

结果:击败旧有的冠军

作者将 FinSMART 与当前的顶尖模型(如 FinDPO 和 FinBERT)以及一些传统的基于词典的方法进行了对比测试。他们模拟了一种交易策略:买入 AI 看好的股票,并卖出(做空)AI 看衰的股票。

结果非常显著:

  • 利润: 在测试期间,FinSMART 策略实现了 264.9% 的累计回报。排名第二的模型 FinDPO 仅实现了 109.8%。这是一个巨大的差距。
  • 风险: FinSMART 不仅赚得更多,而且操作更安全。它的“夏普比率”(衡量单位风险所获得的收益)为 1.97,而排名第二的模型仅为 1.12
  • 适应性: 作者还尝试了一种独特的方法:他们让 AI 每六个月利用新的新闻和新的市场结果进行一次重新训练。这个“定期重新训练”版本的 FinSMART 表现甚至更好,达到了 406.2% 的累计回报。

为什么这很重要

论文表明,通过让市场直接教导 AI,我们可以构建出不仅能记忆过去,而且能适应当下的金融工具。作者发现,旧的方法(静态的人类标签)之所以受限,是因为它无法跟上不断变化的市场动态。然而,FinSMART 可以通过新的文章和真实的现实结果进行持续学习。

简而言之,这篇论文表明,一个通过玩转股票市场游戏,而不是仅仅阅读规则手册来学习的机器人,可以成为一个更优秀的玩家。它预示着金融 AI 的未来不在于更大的教科书,而在于更智能、实时的反馈循环,其中市场本身才是终极的老师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →