✨ 要点🔬 技术摘要
想象一下,你拥有一个非常聪明、训练有素的金融水晶球。你花了数周时间来教它如何预测未来 10、20 或 30 天的市场波动率(即价格的“跳动性”)。
在过去,一旦你完成了这个水晶球的训练,你就会按照设计好的方式直接使用它:它会观察今天的数据,然后一次性吐出对整个未来时段的单一巨大预测。作者们称这种方法为“默认 MIMO”法。
核心理念:你的水晶球有一个“秘密菜单”
这篇论文认为,你实际上是在浪费你训练好的水晶球的潜力。仅仅因为你训练它去一次性给出 3ing 天的预测,并不意味着你必须 那样使用它。
把你的训练模型想象成一位名厨 ,他已经学会了如何在一顿饭的时间内烹饪出一场宏大的 30 道菜的盛宴。所谓的“默认”方式是直接把整场盛宴端上来。但论文建议,这位同样的厨师也可以被要求:
只做前 5 道菜,品尝一下,根据反馈调整下一批次的制作,然后再做接下来的 5 道菜。
或者先做前 10 道菜,停顿一下,然后再继续。
即使厨师(模型)拥有完全相同的技能和知识(训练好的参数),你要求他们烹饪的方式 (“展开规则/rollout rule”)也会改变这顿饭最终的味道。
他们的发现
研究人员在 20 种不同的股票上测试了这个想法,并使用了各种类型的 AI 模型(从简单的数学公式到复杂的“Transformer”网络)。他们有了以下发现,并使用了简单的类比:
“一刀切”的陷阱: 他们发现,使用模型的标准方式(完整的 30 道菜盛宴)往往不是 最好的方式。有时,要求厨师分小批次烹饪(比如每次 5 道菜)反而能做出更美味的饭菜(更准确的预测)。
没有唯一的最佳食谱: 然而,并没有一种单一的“最佳”批次大小。对于一种类型的厨师(模型)和一场盛宴(预测时界),每次烹饪 5 道菜可能是完美的。而对于另一种厨师或不同的时间框架,批次为 10 可能更好。这就像是在说“辣味食物总是更好”,但有时你想要清淡,有时你想要辛辣。因为最佳选择变化如此之大,你无法只选定一个新规则并永远坚持下去。
“试味”策略(验证): 由于你无法预先知道完美的规则是什么,作者建议了一种聪明的策略:在向你的客户(真实市场)端上最终的饭菜之前,先在“练习菜单”(验证数据)上进行一次“试味”。你尝试不同的批次大小,并挑选出对该特定厨师来说味道最好的那一个。
廉价的胜利: 有时,仅仅挑选单一的最佳批次大小(“单体/singleton”)就能以极低的额外成本获得更好的饭菜。
“集体拥抱”(集成/Ensembles): 有时,将几种不同批次大小的预测混合在一起(就像一个由厨师组成的委员会进行投票),可以得到更出色的结果,尽管这需要更多的计算时间。
“指标”不匹配: 这是一个至关重要的点。在金融领域,判断一个预测是否“好”有不同的方式。
MSE(均方误差): 这就像是通过观察温度与目标的接近程度来评判一顿饭。
QLILED(QLIKE): 这是一种金融特定的指标,它根据饭菜处理风险 的能力来评判。
问题所在: 根据温度测试(MSE)让饭菜味道达到“完美”的批次大小,并不一定能让这顿饭在风险测试(QLIKE)中表现得最安全或最盈利。如果你根据一种测试来选择策略,它在另一种测试面前可能会失败。
底线
论文的结论是,如何使用一个训练好的模型与模型本身同样重要。
你不应该把训练好的 AI 仅仅视为一个单一、僵化的工具,只需开启即可;你应该将其视为一个灵活的工具包 。通过改变你“展开(roll out)”预测的方式(即批次大小)并在练习运行中进行测试,你通常可以在无需重新训练 AI 或构建新模型的情况下获得更好的结果。
这就像是意识到,如果不要强迫你的训练好的厨师一次性完成整个菜单,而是让他根据练习中表现最好的步骤,分步、更聪明地进行烹饪,他能做出更好的晚餐。
技术摘要:多时界波动率预测中的部署侧自适应性
1. 问题陈述
在金融预测,特别是多时界(multi-horizon)波动率预测领域,标准的评估范式假设一个训练好的模型定义了一个单一的可部署预测器。本文挑战了这一假设,认为对于多输入多输出(MIME)预测器而言,训练过程仅是故事的一半。使用该模型进行部署的方法——即推理时的展开规则(rollout rules)——从根本上改变了预测器的行为、准确性和计算成本。
本文解决的核心问题是:通过改变推理时的策略(例如,改变已提交输出的块大小),一个单一训练好的 MIMO 预测器是否可以生成一系列不同的、可部署的预测器,而无需重新训练。作者研究了“默认”的直接 MIMO 部署是否是最优的,或者替代的展开规则是否能在特定约束(延迟、计算预算)和评估指标(MSE vs. QLIKE)下诱导出更好的预测器。
2. 方法论
2.1 诱导规则族
作者提出将一个训练好的 MIMO 模型视为一个预测器族(family of predictors)的生成器,而非一个固定的预测器。
机制: 标准 MIMO 模型通过一次传递预测整个时界 H H H 。作者引入了一种“块递归”(block-recursive)部署方式,即每次调用仅提交 s s s 个步骤(1 ≤ s ≤ H 1 \le s \le H 1 ≤ s ≤ H )。
展开过程: 将提交的 s s s 个预测值附加到输入窗口中,更新状态,然后再次调用相同的训练函数 f θ f_\theta f θ 来预测接下来的 s s s 个步骤。此过程重复进行,直到覆盖整个时界。
诱导预测器: 通过改变块大小 s s s (或展开比例 r = s / H r = s/H r = s / H ),相同的固定参数 θ \theta θ 生成了不同的有效预测器 g θ , s g_{\theta, s} g θ , s 。这创建了一个从完全递归(s = 1 s=1 s = 1 )到默认 MIMO(s = H s=H s = H )的各种部署规则组成的“规则族”。
2.2 实验设置
数据: 来自 VOLARE 存档(20 个单变量序列)的每日股票波动率序列。目标是对数已实现方差(基于 5 分钟子采样数据计算)。
时界: 三个预测时界(H ∈ { 10 , 20 , 30 } H \in \{10, 20, 30\} H ∈ { 10 , 20 , 30 } 天)。
架构: 五类模型,范围从线性模型到深度学习模型:LinearNet, MLP, LSTM, N-BEATS, 和 PatchTST。
训练: 所有模型均作为直接多输出预测器进行训练(一次性预测完整 H H H ),并使用 Adam 优化器和 MSE 损失函数。
评估指标:
MSE: 对数波动率尺度上的均方误差(主要训练目标)。
QLIKE: 原始方差尺度上的拟似然损失(金融标准指标)。
成本: 推理时间,通过模型调用次数(⌈ H / s ⌉ \lceil H/s \rceil ⌈ H / s ⌉ )来衡量。
2.3 部署策略
研究评估了以下选择或组合规则族的策略:
默认 MIMO: 标准的 s = H s=H s = H 部署。
单体(Singletons): 部署单个非默认规则(s < H s < H s < H )。
基于验证集选择的单体: 根据验证集 MSE 选择最佳的单个 s s s 。
子集集成(Subset Ensembles):
简单型: 对规则子集进行均匀平均。
线性型: 通过在验证集上进行普通最小二乘法(OLS)学习权重进行加权平均。
选择过程通过贪婪前向选择进行,以在固定的子集规模 k k k 下优化验证集 MSE。
全集成(Full Ensembles): 聚合整个规则池。
3. 核心贡献
MIMO 的诱导规则视角: 本文引入了这样一个概念:通过推理时的展开选择,一个训练好的 MIMO 预测器定义了一个可部署的预测器族,而非一个静态的预测器。
部署余量(Deployment Headroom): 作者证明了非默认的展开规则在 MSE 方面经常优于默认的 MIMO 部署。然而,最优的固定规则高度依赖于模型架构和预测时界,因此不存在可靠的“全局”替代规则。
基于验证的策略: 研究表明,基于验证的选择(单体)和小型子集集成(例如 k = 3 k=3 k = 3 )可以利用这种余量,在仅花费极小代价的情况下,实现相对于默认 MIMO 的显著 MSE 提升。
指标敏感性: 一个关键发现是部署策略具有指标敏感性。针对验证集 MSE 优化的策略并不统一转化为 QLIKE 性能的提升。具体而言,学习到的线性组合虽然能带来强劲的 MSE 增益,但与更简单的策略(如单体或简单平均)相比,在 QLIKE 方面的表现不够一致。
成本效率 vs. 重新训练: 本文将诱导策略与“规则扫描”(rule sweep)替代方案进行了比较(即为每个块大小分别训练模型)。诱导策略在达到近似预测性能的同时,所需的重新训练成本大幅降低(仅需训练一个模型,而非每个候选块大小都需要一个模型)。
4. 关键结果
规则级性能: 非 MIMO 单体规则经常击败默认 MIMO(对于像 PatchTST 这样的先进模型,胜率通常 >60-80%),但获胜的块大小在不同架构和时界之间存在显著差异。
准确性-成本权衡:
基于验证选择的单体: 提供低成本的改进(推理成本通常 <2 倍于 MIMO),并带来适度的 MSE 增益。
小型子集 (k = 3 k=3 k = 3 ): 提供了一个强大的折中方案。规模为 3 的贪婪线性子集实现了最大的中位数 MSE 降幅(通常相对于 MIMO 减少 5-15% 的误差),且推理成本适中(例如,约为 MIMO 成本的 10-20 倍,但仍远低于全集成)。
全集成: 虽然它们提供了最低的误差,但相对于显著增加的推理成本,其相对于小型子集的边际收益往往很小。
指标迁移:
通过 MSE 选择的策略并不保证 QLIKE 的提升。
简单策略(单体、简单平均)在 MSE 和 QLIKE 之间的迁移表现更为可靠。
学习到的线性组合虽然对 MSE 有效,但在操作损失函数为 QLIKE 时鲁棒性较差。
诱导 vs. 分别训练: 针对特定块大小单独训练的模型相比诱导策略仅有微小的 MSE 提升。“奥拉克比率”(Oracle Ratio,指诱导策略相对于单独训练模型的成本)表明,诱导策略仅需约 10-30% 的重新训练成本即可获得相当的性能。
5. 重要性与主张
本文的主张是:推理时的部署是金融预测中一个重要的自适应来源 。其主要意义在于将评估重点从“哪种模型架构更好”转向了“如何部署训练好的模型”。
实际意义: 从业者不应假设默认的 MIMO 输出就是最终产品。通过将训练好的模型视为一个紧凑的部署空间,人们可以根据特定的约束和损失函数(MSE vs. QLIKE),在平衡准确性、成本和操作损失的情况下,选择一种策略(单体或小型子集),而无需承担重新训练多个模型的沉重代价。
评估设计: 作者认为,部署策略应当与模型架构一同进行评估。只有当部署策略针对特定的金融用例(包括约束和损失函数)进行了优化时,模型的真正潜力才能得到发挥。
局限性说明: 作者承认了局限性,指出研究结果是基于单变量每日波动率,且研究结论涉及的是预测准确性,而非下游的投资组合效用或风险控制表现。他们并非提出一种新的波动率架构,而是提出一种利用现有训练模型的全新视角。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。