想象一下,你正在尝试预测某个特定、微小街区的天气。那里极其混乱:一栋房子可能阳光明媚,而隔壁却在遭遇冰雹。现在,想象一下先尝试预测整个国家的天气。宏观图景要平滑得多,也更容易理解,因为各个街区的剧烈波动被平均化了。
本文讲述的是利用一个超级聪明的计算机大脑(称为Transformer)来预测股票价格,作者发现,在要求它预测“街区级”天气之前,最好先让它学习“国家级”天气。
以下是他们研究历程的分解:
1. 问题:股市是混乱的
预测单只股票明天是涨是跌,就像试图猜测飓风中被吹起的一片树叶的确切路径。市场杂乱无章,瞬息万变,且充满噪音。传统的计算机模型(如LSTM和XGBoost)曾试图解决这一问题,但它们往往举步维艰,因为它们在每次面对新股票时都要从头开始学习。
2. 解决方案:“学徒”策略(预训练)
作者决定尝试一种名为迁移学习的新教学方法。这就像培训一位主厨:
- 步骤 1(预训练): 不是立即教主厨烹饪某道特定的怪异菜肴,而是先让他们在一锅巨大且平滑的汤(TSX 市场指数)上练习。这锅汤代表了整个股票市场。它比单只股票要少一些混乱。主厨在没有被某种怪异食材分心的情况下,学会了烹饪的通用规则(风味如何相互作用、热量如何运作)。
- 步骤 2(微调): 一旦主厨理解了这锅大汤的基本原理,你就交给他一份特定的、棘手的食谱(单只股票)。因为他们已经掌握了基础,所以学习特定食谱的速度和质量都远胜于从零开始。
3. 工具:Transformer 与老牌劲旅
该团队使用了一种名为Transformer的现代人工智能架构(与驱动 ChatGPT 等工具的技术相同)。他们将其与更古老、可靠的工具进行了比较:
- LSTM: 一种擅长记忆序列的旧式人工智能。
- XGBoost: 一种强大的统计工具,通过构建多棵决策树来寻找模式。
- 集成模型(Ensemble): 一个“委员会”,它平均了上述所有模型的预测结果。
4. 他们的发现(结果)
实验有两个主要目标:猜测方向(涨或跌)和猜测确切数值(涨多少)。
“方向”游戏(分类):
- 当 Transformer 试图从头学习单只股票时,它感到困惑且表现不佳。
- 当他们使用“学徒策略”(先在大型市场指数上进行预训练)时,Transformer 在猜测股票涨跌方面有了显著提升。
- 然而,老牌XGBoost模型在单纯猜对“涨或跌”方面仍然是最好的。
“确切数值”游戏(回归):
- 在尝试预测确切的回报率百分比时,微调后的 Transformer和微调后的 LSTM击败了 XGBoost 模型。它们在计算具体数值方面更加准确。
- 但这里有个转折: 尽管 Transformer 在计算数值方面更准确,但在模拟交易测试中,集成模型(委员会)实际上赚到了最多的钱。
- 为什么? Transformer 非常谨慎,预测的数值非常接近零(保守的赌注),而 XGBoost/集成模型则愿意押注波动更大的股票。在股市中,有时过于“安全”意味着你会错失大赚的机会。
5. 现实世界的工具
研究人员并没有止步于理论。他们构建了一个实时交易应用程序(使用名为 Streamlit 的工具)。
- 你可以输入股票代码(如"TD"或"RY")。
- 该应用程序获取最新数据,将其输入他们的模型,并告诉你哪 5 只股票看起来涨幅最大,哪 5 只看起来会崩盘。
- 这就像拥有一个为你个人投资组合提供每日天气预报的天气应用程序。
核心结论
论文总结道,虽然没有模型是完美的(股市仍然极难预测),但先让 AI 学习宏观市场图景有助于它更好地理解微观图景。
Transformer 模型是理解股票走势细微差别的有力竞争者,但在本次特定测试中,老牌方法(如 XGBoost)和“委员会”方法在创造最大利润方面仍居首位。作者计划在未来让 Transformer 变得更大、更聪明,也许是通过教它阅读全球新闻和经济报告,而不仅仅是过去的价格图表。
技术摘要:从指数到个股:预训练 Transformer 用于股票收益预测
问题陈述
由于金融市场具有混乱且非平稳的特性,并受到经济、政治和社会因素复杂相互作用的影響,预测股票价格仍然是一项艰巨的挑战。传统的预测模型往往难以应对训练期与测试期之间固有的波动性和分布偏移。尽管 Transformer 架构在金融预测中的近期应用显示出希望,但它们通常需要海量数据集才能有效学习上下文关系。本研究旨在通过利用迁移学习策略,解决提高多伦多证券交易所(TSX)个股预测精度的具体挑战。核心假设是:在聚合市场数据(TSX 指数)上进行预训练,可以帮助模型在针对波动性更大且噪声更多的个股数据进行微调之前,学习到通用的模式。
方法论
数据与特征工程
本研究利用了一个包含 1,853 个 TSX 股票代码的数据集,时间跨度从 1980 年 3 月 17 日至 2023 年 7 月 4 日,包含超过 490 万条每日记录。数据通过 Yahoo Finance API 获取。
- 目标变量:本研究解决了两个任务:
- 分类:预测日内收益的方向(正 vs. 负)。
- 回归:预测日内收益的具体数值。
- 特征:输入特征包括历史滞后数据以及金融业界广泛使用的一系列技术指标,如随机指标%K、价格变化率(ROC)、相对强弱指数(RSI)、累积分布振荡器(AccDO)、移动平均收敛散度(MACD)以及各种指数移动平均线(EMA)。
- 输入结构:对于深度学习模型(Transformers 和 LSTMs),输入被构建为 10 天的序列,每天包含 15 个特征。对于 XGBoost,这些特征被展平为 150 维的特征向量。
- 预处理:数据根据训练集统计信息进行了最小 - 最大缩放。技术指标中的异常值(由除以零错误引起)被替换为中性值(%K 为 50,AccDO 为 0),极端日内收益(>2)被截断以减轻缩放失真。排除了每只股票的第一年数据,以减少不可预测的初始行为。
模型架构与训练策略
研究比较了以下几种架构:
- Transformer:一个由四个编码器块 followed by 三个全连接密集层(128、64 和 32 个节点)组成的模型。
- LSTM:一个基准模型,用四个 LSTM 层替换 Transformer 编码器块。
- XGBoost:一个梯度提升模型,使用特定超参数训练(100 个估计器,学习率 0.03,最大深度 9)。
- 集成模型:微调后的深度学习模型与 XGBoost 模型预测结果的平均值。
预训练方法:
核心方法论贡献是一个两阶段训练过程:
- 预训练:模型首先在 TSX 指数数据上进行训练,以预测日内收益的方向。此阶段利用聚合市场数据来学习通用的市场动态。
- 微调:将预训练的权重转移到针对个股数据训练的模型上。对于回归任务,通过替换输出层以预测连续收益值,对分类模型进行进一步微调。
实验设置
- 数据划分:训练数据覆盖 2010–2022 年;验证数据来自 2022 年;保留测试集覆盖 2023 年直至 2023 年 12 月 1 日。
- 评估指标:
- 分类:准确率、精确率、F1 分数和二分类交叉熵损失。
- 回归:均方误差(MSE)。
- 投资组合表现:基于每日买入预测最高的 5 只股票并做空预测最低的 5 只股票的策略所产生的平均日收益。
- 应用:开发了一个基于 Streamlit 的应用程序,用于可视化实时预测和技术指标,展示了模型的实际部署。
关键结果
分类性能
在 TSX 指数上进行预训练显著提高了 Transformer 泛化到个股的能力。
- 损失降低:预训练将个股预测的二分类交叉熵损失从0.6942(随机初始化)降低至0.6404。
- 准确率与 F1:虽然基线 Transformer 实现了最高的测试准确率(0.6667),但它未能有效预测少数类(正收益),导致精确率和 F1 分数均为 0.0000。XGBoost 模型实现了最强的整体分类性能,拥有最高的 F1 分数(测试 F1:0.5675)和精确率。
- 比较:微调后的 Transformer 在分类指标上优于微调后的 LSTM,但被 XGBoost 超越。
回归性能
在回归任务中,带有预训练的深度学习模型在最小化误差方面表现出更高的精度。
- MSE:微调后的 Transformer 实现了最低的测试 MSE(5.682e-9),略优于微调后的 LSTM(5.683e-9)。在回归精度方面,这两个深度学习模型均显著优于 XGBoost(9.923e-9)和集成模型(6.147e-9)。
- 投资组合收益:尽管 Transformer 具有更优越的回归精度,但集成模型产生了最高的平均日投资组合收益(0.0069),其次是 XGBoost(0.0059)。Transformer 和 LSTM 模型产生的收益较低(分别为 0.0003 和 0.0002)。
- 分析:作者指出,MSE 较低(Transformer/LSTM)的模型倾向于选择预测收益接近零的股票,而 XGBoost 和集成模型则选择了收益变化更大的股票,导致在此特定回测场景中实现了更高的实际利润。
意义与主张
本文谦逊地主张,虽然实现的绝对收益为正但相对有限,但该研究为迁移学习在金融预测中的有效性提供了证据。
- 预训练价值:主要发现是,在聚合市场指数数据上进行预训练有助于模型学习通用模式,平滑个股数据中固有的混乱波动。与随机初始化相比,这种方法成功降低了损失并提高了回归精度。
- 架构权衡:研究强调了最小化预测误差(MSE)与最大化交易盈利能力之间的区别。虽然 Transformer 在回归精度方面表现出色,但在这一特定背景下,集成方法和基于树的模型(XGBoost)被证明在捕捉盈利交易策略所需的波动性方面更为有效。
- 实际应用:功能应用程序的开发证明了将这些模型集成到实时交易支持系统中的可行性。
作者总结道,虽然股票市场的固有难度限制了性能,但所提出的方法为改进个股预测提供了一个有前景的方向。未来的工作提议增加模型容量,纳入更广泛的全球指标,并整合风险管理策略以过滤掉低可预测性的股票。
每周获取最佳 quantitative finance 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。