想象一下,你正在教一个机器人如何成为一名成功的股票交易员。你希望看看这个机器人能否预测明天哪些股票会上涨或下跌。
长期以来,研究人员一直在为这些机器人构建不同的“大脑”(算法),从简单的数学公式到复杂的人工智能。然而,存在一个重大问题:没有人就如何测试它们达成一致。
这就像拥有一堆不同的汽车(AI 模型),却在不同的赛道(数据集)上、按照不同的规则进行测试。一个团队在平坦的高速公路上测试他们的车,另一个团队在颠簸的土路上测试,他们都声称自己的车是“最快的”。因为测试条件不同,你根本无法判断哪辆车实际上是最好的。
本文介绍了FinTSB,这是一个专为金融时间序列预测设计的新的、超级公平的“驾驶学校”和“测试赛道”。以下是其工作原理,使用简单的类比说明:
1. 问题:旧测试中的“三大漏洞”
作者指出,旧的测试方法存在三个主要漏洞(泄漏),让糟糕的结果得以蒙混过关:
- 多样性差距(“单一天气”问题): 旧测试通常只使用几年数据或仅一种类型的市场数据(例如平静、晴朗的日子)。但真实市场会有风暴、飓风和突如其来的暴风雪。如果你只在晴天训练机器人,当风暴来袭时它就会崩溃。
- 标准化赤字(“不同尺子”问题): 每个人都使用不同的测量工具。一个团队用英里/小时衡量速度,另一个用公里,还有一个用节省了多少汽油来衡量。你无法公平地比较结果。
- 现实世界不匹配(“电子游戏”问题): 许多测试忽略了现实世界的规则。它们忘记了交易费用(如汽油费)、交易限制(如减速带),或者你无法总是立即卖出股票的事实。这就像玩一个永远不会耗尽燃料或撞墙的电子游戏,让机器人看起来完美无缺,而实际上它在现实世界中会失败。
2. 解决方案:FinTSB“超级赛道”
为了解决这个问题,作者构建了FinTSB,一个综合性的基准测试。把它想象成一个巨大的、多功能的驾驶课程。
四个“天气”区域: FinTSB 不再只有一条赛道,而是根据股票走势将市场划分为四种不同的“天气模式”:
- 上涨趋势: 市场正在上涨(平坦的高速公路)。
- 下跌趋势: 市场正在下跌(陡峭的下坡路)。
- 波动性: 市场剧烈上下跳动(颠簸的土路)。
- 黑天鹅事件: 突然的极端崩盘或飙升(龙卷风)。
研究人员将 15 年的真实股票数据切碎,并归类到这四个类别中,以确保机器人接受所有情况的测试,而不仅仅是简单的部分。
统一的“规则手册”: FinTSB 强制每个机器人遵守完全相同的规则。
- 流水线: 他们构建了一个“轻量级”系统(就像标准化的装配线),你只需将机器人插入其中,它就会自动运行相同的测试。不再需要费力调整不同的设置。
- 指标: 他们通过三种方式衡量性能:
- 排名: 机器人是否正确猜出了哪些股票是最好的?
- 投资组合: 如果你真的购买了机器人挑选的股票,你会赚钱吗?(这包括计算费用和风险)。
- 误差: 机器人的预测与实际数值有多接近?
“现实世界”模拟: 该系统增加了现实世界的摩擦。它对每笔交易收取少量费用(交易成本),并遵守诸如“涨停”(股票一天内涨幅不能超过一定幅度)等规则。这确保机器人不仅擅长数学,而且擅长交易。
3. 结果:谁赢得了比赛?
作者在这个新赛道上测试了数十种不同的“大脑”(从简单的数学模型到庞大的人工智能模型)。
- 没有单一赢家: 就像在体育比赛中一样,没有一个机器人在所有项目中都获胜。有些在平静市场中表现出色,有些则在波动市场中表现优异。
- 人工智能的惊喜: 他们发现,最大、最复杂的人工智能模型(大型语言模型)并没有自动获胜。事实上,有时随着模型变大,表现反而变差,直到达到某个“临界规模”,它们突然变得好得多。似乎这些庞大的模型需要大量的“脑力”来解开股票市场混乱的噪音。
- “零样本”奇迹: 最令人兴奋的发现是,在这个多样化的 FinTSB 赛道上训练的机器人,可以被直接部署到全新的市场(2024 年中国股市)中,无需任何额外训练,它们的表现依然非常出色。这证明该赛道教会了它们如何在任何天气下驾驶,而不仅仅是它们练习过的特定天气。
总结
FinTSB 是一个新的、公平的、贴近现实的股票选择人工智能测试场。它阻止研究人员挑选容易的数据,迫使他们使用相同的测量标准,并确保机器人考虑现实世界的成本,如费用和交易限制。这是金融人工智能社区第一次拥有一个标准的“奥运会”,以真正看清哪些模型已准备好面对现实世界。
技术摘要:FinTSB:一个全面且实用的金融时间序列预测基准
1. 问题陈述
金融时间序列预测(FinTSF)是量化金融中的关键领域,但该领域存在三个系统性局限,阻碍了预测模型的可靠评估与实际部署:
- 多样性差距:现有的评估数据集往往无法捕捉股票走势模式的全谱系(例如上涨趋势、下跌趋势、波动性以及黑天鹅事件),或覆盖的时间范围不足。这导致模型在面对未见过的市场体制时缺乏泛化能力。此外,许多研究仅关注单一市场,忽视了不同市场间的结构性差异(例如中国 A 股的高散户参与度与美国市场的机构混合结构)。
- 标准化缺失:缺乏统一的评估协议。评估指标(排序类、组合类或误差类)的差异,以及缺乏标准化且用户友好的流程,使得跨研究性能比较无效。在专有设置下重新运行最先进(SOTA)模型往往劳动密集且容易产生偏差。
- 现实世界不匹配:许多评估忽略了关键的市场约束,如交易费用、卖空限制(例如中国 A 股)以及停牌(涨跌停)。这导致性能指标虚高,无法转化为实盘交易环境中的实际盈利能力。
2. 方法论:FinTSB 框架
为了解决这些局限,作者提出了FinTSB,这是一个旨在标准化评估并与现实交易条件相一致的综合实用基准。
2.1 数据集构建与分词化
- 数据来源:该基准利用了来自多个金融市场的 15 年历史股票数据。
- 模式分类:数据被划分为不重叠的 250 天周期。基于日收益率(δ),股票被归类为四种不同的走势模式:
- 上涨趋势:高频率的正向收益。
- 下跌趋势:高频率的负向收益。
- 波动性:频繁波动但无明确方向性趋势。
- 黑天鹅事件(极端):显著且剧烈的价格波动。
- 选择策略:对于每种模式,选取排名前 300 的股票(上涨趋势按正向变化率选取前 300,下跌趋势选取后 300,其余用于波动性)。极端异常值被单独分类。
- 预处理:敏感信息被分词化(匿名化)。在每个交易日按股票维度进行归一化,以防止未来信息泄露。
- 结构:最终基准包含 20 个数据集(每种模式 5 个),每个数据集包含 300 只股票在 250 天内的数据,划分为训练集/验证集/测试集(7:1:2)。
2.2 序列特征分析
FinTSB 使用四种序列特征来评估数据质量和内在属性:
- 走势模式:由正/负收益的频率和波动幅度定义。
- 非平稳性:通过增广迪基 - 富勒(ADF)检验来测量,以确认单位根的存在,这是金融数据的典型特征。
- 自相关性:衡量过去价格对未来行为的影响。
- 可预测性:利用频域属性(熵)进行评估,以确定序列的理论可预测性。
2.3 统一评估流程
FinTSB 引入了一个轻量级、用户友好的流程,包含四个层级:
- 数据层:处理分词化、归一化以及针对特定走势模式的动态数据加载。
- 训练层:集成来自六种骨干架构的模型:
- 经典策略(例如 CSM, BLSW)
- 机器学习(例如 XGBoost, LightGBM, ARIMA)
- 深度学习(例如 LSTM, Transformer, Mamba, GNNs)
- 强化学习(例如 PPO, DDPG)
- 生成模型(例如 Diffusion, VAEs)
- 基于大语言模型(LLM)的方法(例如 TimeMoe, Chronos)
- 回测层:使用Top-K-Drop策略模拟现实交易。该策略保留表现最佳的股票,仅替换表现不佳者,从而降低换手率。至关重要的是,它纳入了**交易费用(0.1%)**并遵守市场约束(例如在特定情境下禁止卖空)。
- 反馈层:归档日志并提供可视化工具以跟踪性能。
2.4 评估指标
该基准采用三个维度的 11 项指标以确保全面评估:
- 排序指标:信息系数(IC)、IC 信息比率(ICIR)、RankIC 和 RankICIR。这些指标衡量预测得分与实际收益之间的一致性。
- 基于组合的指标:年化收益率(ARR)、年化波动率(AVol)、最大回撤(MDD)、年化夏普比率(ASR)和信息比率(IR)。这些指标评估盈利能力和风险调整后收益。
- 误差指标:均方误差(MSE)和平均绝对误差(MAE)。作者指出,较低的误差并不能保证盈利能力,但为了完整性而包含在内。
3. 主要贡献
论文概述了四项主要贡献:
- 多样性纳入:创建 FinTSB,对历史数据进行分词化和预处理,以捕捉不同市场中所有主要的走势模式,解决多样性差距问题。
- 标准化一致性:提出一个统一的评估框架,涵盖排序、组合和误差指标,实现公平且可复现的比较。
- 现实世界对齐:设计严格遵循市场约束(费用、停牌、卖空规则)的投资策略,弥合理论指标与实际适用性之间的差距。
- 深入评估:对广泛的 FinTSF 方法进行综合评估,提供在不同市场条件下模型性能的关键见解。
4. 实验结果
在 FinTSB 上使用统一流程进行了广泛的实验:
- 性能异质性:没有任何单一方法在所有三个指标维度上均取得最佳性能。即使在相同的骨干架构类别内部也存在显著异质性,表明捕捉时间依赖关系和横截面关系高度依赖于具体方法。
- 大语言模型(LLM)性能:基于 LLM 的方法表现出“悖论式”的扩展模式。性能最初随着模型扩展而恶化,但在更大规模下显示出显著改善(例如 Chronos-boltBase)。这表明金融时间序列能力可能仅在超过解耦复杂市场噪声所需的临界参数阈值后才会显现。
- 深度学习与传统方法:与预期相反,现代深度学习技术在组合收益方面并未普遍优于传统量化策略或基于树的模型(例如 XGBoost, LightGBM)。
- 迁移学习:在 FinTSB 上预训练的模型在零样本迁移到 2024 年沪深 300 市场时表现出惊人的一致性,实现了优越的风险调整后收益。这验证了该基准捕捉不同市场体制(牛市、熊市和过渡期)中稳健且可泛化模式的能力。
- 效率:研究包括对推理效率的分析,在 ASR 性能与计算成本及内存占用之间取得平衡。
5. 意义与主张
作者声称,FinTSB 提供了一个新颖且全面的平台,用于改进和评估 FinTSF 方法。通过解决多样性差距、标准化缺失和现实世界不匹配问题,该基准旨在:
- 为 FinTSF 社区的模型评估奠定坚实基础。
- 指导研究人员在不同市场条件下选择合适的模型。
- 推动该领域向更实用、更贴近现实世界的投资策略发展。
论文结论指出,严格的基准测试对于超越碎片化结果至关重要,而 FinTSB 是将理论预测模型与实际金融市场的复杂性相一致的必要步骤。代码和数据集已公开,以促进进一步研究。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。