✨ 要点🔬 技术摘要
想象一下,你正试图预测明天股票的涨跌。这就像是在预测天气,只不过面对的不是云朵和风,而是人类的情绪、新闻头条和复杂的金融数据。
这篇论文介绍了一种名为 FinMamba 的新型人工智能工具,旨在让这些预测变得更加精准。以下是它的工作原理,通过简单的类比来解释:
FinMamba 解决的两个重大问题
作者指出,目前的工具之所以失败,主要有两个原因:
股票并非直线运动,而是成群起舞。
问题所在: 在股市中,公司往往会同步波动。当整个市场崩盘时,即使是不同行业的公司也会一起下跌;当市场繁荣时,它们也可能一起上涨。然而,旧的计算机模型将这些关系视为静态的(就像一张固定的地图),或者会被“噪声”(随机的一次性事件)所干扰。它们没有意识到,“舞伴”会根据市场是兴奋还是恐惧而发生变化。
类比: 想象一场高中舞会。当音乐缓慢忧伤时,大家可能会聚集成一个个紧密的小圈。当音乐快速激昂时,人们会散开,与不同的舞伴跳舞。旧的模型只拥有一张特定时刻舞池的照片。而 FinMamba 则拥有一个实时视频监控,它观察着音乐(市场指数),并能瞬间更新谁正在与谁共舞。
在嘈杂的海洋中寻找正确的模式。
问题所在: 股价非常混乱。它们有很多“静电”(噪声),而清晰的信号却很少。为了预测未来,你需要找到过去相似的模式(例如:“这只股票三年前看起来像这样,然后它就上涨了”)。旧的 AI 模型(如 Transformer)会同时观察所有 事物,这使得它们容易被数据中奇特的、一次性的异常波动所分散注意力。此外,在查看长期历史记录时,它们也会变得非常缓慢且耗费内存。
类比: 想象试图从一个巨大的录音库中寻找一首特定的歌曲。旧的 AI 就像一个图书管理员,为了找到那首歌要读完每一本书里的每一个字,最终被噪声淹没。而 FinMamba 则像是一个聪明的图书管理员,它知道该去哪一层书架查找,能够忽略背景杂音,并且可以快速翻阅数千年的历史记录而不会感到疲劳。
FinMamba 的工作原理:两步走的魔力
FinMamba 结合了两个智能组件来解决这些问题:
1. “市场感知图谱”(动态舞池)
这个部分构建了一张展示股票如何相互关联的地图。
静态知识: 它知道汽车公司和轮胎公司是相关的(就像知道它们属于同一个家族)。
动态知识: 它观察每日股价走势,以观察今天谁实际上在同步波动。
市场过滤器: 这是其中的核心秘诀。模型会观察整体市场指数(如标普 500 指数)。
当市场崩盘时: 模型意识到所有人都在恐慌,并紧紧地手拉手。因此,它会在地图上保留更多 的连接,因为此时一切都具有相关性。
当市场繁荣时: 模型意识到人们正在散开。它会“修剪”(切断)那些微弱的连接,只保留最强的关系。
结果: 它创建了一个不断更新的地图,反映了当前的市场情绪,而不仅仅是一份静态的行业列表。
2. “多层级 Mamba”(模式侦探)
地图准备好之后,模型需要阅读股票的历史记录。
Mamba 引擎: 这是一种新型的 AI 架构。与那些会被异常值(奇怪的峰值)搞糊涂的旧模型不同,Mamba 使用了一种“选择机制”。它像是一个智能过滤器,记住重要的模式并忘记无关的噪声。
多层级: 股票在不同的时间尺度上运动。
微观层面: 由新闻或传闻引起的分钟级的波动。
宏观层面: 由经济增长或利率引起的月度趋势。
FinMamba 同时通过不同的“透镜”(层级)观察数据。它不仅看日线图,还理解日线图如何融入月度和年度趋势之中。
实验结果
作者在真实的美国股市(如纳斯达克)和中国股市(如沪深 300)上测试了 FinMamba。
准确性: 它对股票走势的预测能力优于他们测试的几乎所有其他方法,包括旧的 AI 模型和传统的投资策略。
盈利能力: 当他们使用 FinMamba 模拟交易策略时,它比其他策略赚得更多,且回撤(亏损幅度)更小。
速度: 由于采用了 Mamba 架构,它运行速度非常快,即使在查看长期的历史数据时,也不需要超级计算机来运行。
总结
FinMamba 是一个比任何人都更擅长理解以下两点的股票预测工具:
语境(Context): 它知道当市场变得恐惧或兴奋时,游戏规则会发生变化,因此它能实时更新其股票关系的地图。
专注(Focus): 它忽略噪声并记住正确的历史模式,跨越不同的时间尺度,从而做出更聪明、更快且更具盈利性的预测。
技术摘要:FinMamba
问题定义
股票走势预测是量化交易中的一项关键任务,但也极具挑战性,因为金融数据具有高波动性、低信噪比以及市场影响的多维复杂性。现有的深度学习方法面临两个主要局限:
静态或有偏差的股票间关系: 当前模型通常依赖于静态先验知识(如行业板块)或纯数据驱动的后验相关性(如 Pearson 系数),未能充分考虑动态的市场状况。具体而言,它们无法捕捉到股票间相关性在市场下跌期间(系统性风险)增强、而在上涨期间减弱的现象,而这一现象是由宏观经济因素驱动的。
效率与模式识别问题: 传统的序列模型(如 Transformer)由于二次方计算复杂度,在处理长历史数据时表现挣扎,且往往过度强调离群值而非循环模式。相反,它们缺乏在维持实时交易所需低延迟的同时,高效建模跨多个时间尺度(从微观层面的分钟级波动到宏观层面的经济趋势)依赖关系的能力。
方法论
作者提出了 FinMamba ,一个集成**市场感知图(Market-Aware Graph, MAG)和 多层 Mamba(Multi-Level Mamba, MLM)**架构的框架,以解决上述局限。
1. 市场感知图 (MAG)
MAG 模块通过融合静态先验知识与动态后验相关性,并结合市场指数反馈进行精炼,从而动态地对股票间关系进行建模。
动态股票相关性图生成: 模型通过结合以下要素构建邻接矩阵 A t A_t A t :
后验相关性 (Q Q Q ): 每日利用回顾窗口 L L L 内的 Spearman 系数计算,以捕捉短期序列相似性。
先验关系 (D D D ): 一个“行业衰减矩阵”,它基于一级和二级行业分类编码长期结构化关系,为同一行业内的股票分配更高的权重。
最终的邻接矩阵计算公式为 A t = Q t ⋅ D A_t = Q_t \cdot D A t = Q t ⋅ D 。
市场感知图稀疏化: 为了适应市场波动,模型采用了剪枝机制。它根据市场指数 M t M_t M t (由目标股票集的均值表示)计算稀疏水平 κ t \kappa_t κ t 。通过使用 Inception 模块和 Sigmoid 函数,模型决定保留多少条边。
机制: 当市场指数较低(高波动/危机)时,模型会保留更多的边(相关性更高)。当指数较高时,模型会剪掉更多边,反映出股票表现的分化。
图注意力聚合: 多头注意力机制从剪枝后的图中聚合来自相邻节点的信号,以生成精炼的股票嵌入(embeddings)。
2. 多层 Mamba (MLM)
MLM 模块处理股票嵌入,以捕捉不同粒度下的时间依赖关系。
多层投影: 输入通过线性映射被投影到 k k k 个不同的层级。这使得模型能够同时提取细粒度的局部细节(微观层面)和更广泛的全局模式(宏观层面)。
选择性状态空间机制: 每个层级由一个 Mamba 模块处理。与 Transformer 不同,Mamba 利用一种选择性机制,使模型能够召回与当前输入相关的特定历史模式,同时丢弃无关信息。这使得模型能够以线性时间复杂度和内存消耗处理长序列。
输出: 所有层级的输出经过重新投影、拼接,并通过一个线性层来预测下一个交易日的排名得分。
3. 优化
模型使用组合损失函数进行端到端训练:
排名与预测损失 (L R P L_{RP} L R P ): 结合了用于点对点回归的均方误差 (MSE) 和用于优化股票相对顺序的成对排名损失 (Pairwise Ranking Loss)。
图信息瓶颈 (GIB) 损失 (L G I B L_{GIB} L G I B ): 一种正则化项,旨在最小化聚合图嵌入与原始输入之间的互信息,确保模型在过滤噪声的同时保留关键的相关性信息。
核心贡献
本文声称了以下贡献:
市场感知图构建: 这是首个在特定宏观市场条件下显式增强股票间关系建模的工作。它整合了静态先验(行业)和动态后验(价格序列),并利用市场指数反馈进行精炼,以根据市场趋势自适应调整相关性。
FinMamba 框架: 提出了一种结合市场感知图与多层 Mamba 的新颖架构。该框架有效地建模了跨多个时间尺度(从微观到宏观)的面向模式的依赖关系,同时保持了极高的计算效率。
达到最先进水平(SOTA)的性能: 在美国(标普 500、纳斯达克 100)和中国(沪深 300、中证 500)股市上的广泛实验表明,FinMamba 与现有的量化投资方法及通用时间序列预测模型相比,实现了卓越的预测准确度和交易盈利能力,同时保持了较低的计算复杂度。
实验结果
作者将 FinMamba 与广泛的基准模型进行了对比评估,包括经典量化策略(BLSW, CSM)、深度强化学习方法(AlphaStock)以及各种深度学习架构(Transformer, Mamba, THGNN, PatchTST 等)。
性能指标: 使用年化收益率 (ARR)、年化波动率 (AVol)、最大回撤 (MDD)、年化夏普比率 (ASR) 和信息比率 (IR) 对模型进行评估。
研究发现:
FinMamba 在大多数指标上,特别是在 ARR、ASR 和 IR 方面,在四个数据集上均取得了最好或第二好的结果。
它优于缺乏基于图的股票间关系建模的通用时间序列预测模型(如 Crossformer, iTransformer)。
它通过将市场指数反馈有效地融入图结构,超越了其他基于图的方法(如 THGNN, VGNN)。
消融实验: 去除行业衰减矩阵、市场感知稀疏化或多层 Mamba 结构会导致性能显著下降,证实了每个组件的必要性。
效率: 随着回顾时界的增加,FinMamba 展示出比基于 Transformer 的模型更低的推理时间和内存占用,验证了其线性复杂度的优势。
案例研究: 对 2023 年美国汽车工人罢工(UAW strike)的分析显示,FinMamba 成功捕捉了传统汽车制造商(通用、福特)与特斯拉之间不断演变的关联动态,反映了从截然不同的市场地位向激烈竞争转变的过程。
重要性与主张
本文将 FinMamba 定位为通过解决动态市场适应性 和计算效率 双重挑战,实现量化交易领域重大进展的研究。作者声称,通过将宏观市场反馈直接整合到图构建过程中,模型可以更好地理解市场动态,尤其是在波动时期。此外,使用多层 Mamba 架构可以在不产生注意力机制计算负担的情况下,高效提取多尺度时间模式,使其适用于实时算法交易。这项工作表明,将基于图的结构先验与 Mamba 的选择性状态空间建模相结合,为金融时间序列预测提供了一个稳健的新范式。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。