想象一下,你试图预测一个庞大市场中哪些股票明天会上涨或下跌。这就像试图在飓风中听清一声低语。信号(股票变动的真实原因)非常微弱,而噪声(随机的市场杂音)则压倒一切。
这篇论文介绍了一种名为PRISM-VQ的新型人工智能系统,旨在解决这一问题。它就像一个高科技的“棱镜”,将股票市场中混乱、杂乱的光线分解成清晰、有序的彩虹图案。
以下是其工作原理的简单步骤分解:
1. 问题:“嘈杂的房间”
传统方法就像试图通过看单个温度计来猜测天气;它们过于僵化。较新的人工智能方法就像拥有一台超快计算机,基于模式进行猜测,但它们常常被噪声搞糊涂,并忘记了经济学的基本规则(例如“低价通常意味着价值”)。
2. 解决方案:"PRISM"方法
作者构建了一个两阶段系统,它既像一个过滤器,又像一支由聪明专家组成的团队。
第一阶段:“离散过滤器”(向量量化)
想象你有一大桶混合在一起的乐高积木(股票数据)。有些是红色的,有些是蓝色的,有些是坏的,有些只是灰尘。
- PRISM 的作用:它迫使这些积木进入特定的、预定义的“桶”中(称为代码本)。它不会说一块积木是"50% 红色和 51% 蓝色”,而是强制做出决定:“这块积木绝对是第 42 号红桶。”
- 这为何有帮助:通过将数据“ snap"进这些固定的桶中,系统忽略了微小的随机灰尘(噪声),只保留强大且重复的模式。这就像将一堆杂乱的邮件分拣到 500 个特定的邮箱中;一旦分拣完毕,你就能清晰地看到模式。
- “对比”技巧:该系统还学习确保本应在一起的积木在同一个桶中,而不同的积木则被推得远远的。这创建了一个清晰的市场结构地图。
第二阶段:“智能团队”(混合专家模型)
现在数据已被分类到干净的桶中,系统需要预测未来。
- 设置:想象一个由 8 位不同金融专家组成的团队(例如价值专家、成长专家、动量专家)。
- 开关:过去,一个 AI 模型试图包揽一切。而在 PRISM 中,股票在第一阶段被分到的“桶”充当开关。
- 如果一只股票落入“第 42 号桶”(代表特定的市场模式),系统会自动将该股票路由到第 6 号专家。
- 如果它落入“第 10 号桶”,则进入第 2 号专家。
- 结果:每位专家专门针对特定类型的市场条件。他们不会同时尝试猜测;正确的专家会在正确的情况下被调用。这使得预测更加准确且更具适应性。
3. “安全网”(金融先验)
该系统并非从零开始学习;它尊重金融的“旧规则”。
- 想象 AI 是一名学生。“金融先验”就是学生必须阅读的教科书。
- 系统以既定的经济因素(如“价值”、“规模”和“动量”)作为起点。它利用这些因素作为锚点,确保其疯狂的猜测不会偏离现实太远。即使市场变得疯狂,这也能保持模型的稳定性。
4. 结果:更优的投资组合
作者在两个主要市场上测试了该系统:CSI 300(中国)和S&P 500(美国)。
- 得分:与其他顶级 AI 模型和传统方法相比,PRISM-VQ 始终能更好地预测股票排名。
- 收益:当他们根据这些预测构建投资组合(一篮子股票)时,他们以更低的风险(更高的“夏普比率”)和更少的巨额损失(更低的“回撤”)赚取了更多资金。
- 原因:该系统之所以有效,是因为它成功过滤掉了噪声(第一阶段),为正确的情况使用了正确的专家(第二阶段),并且没有忘记经济学的基本规则(先验)。
总结类比
将股票市场想象成一个拥挤、嘈杂的舞池。
- 旧 AI 试图通过听所有人同时大喊大叫来预测下一步动作。
- PRISM-VQ 首先根据人们的舞蹈方式将每个人放入特定的安静房间(第一阶段:向量量化)。然后,它派遣一位专门的舞蹈教练到每个房间,教授下一步动作(第二阶段:混合专家模型)。最后,它提醒教练们舞蹈的基本步伐(金融先验)。
结果是,对舞者(股票)下一步将移动到哪里的预测变得更加清晰、准确。
技术摘要:PRISM-VQ
问题陈述
预测横截面股票回报是量化金融中的一个根本性挑战,主要源于三大障碍:持续低信噪比(SNR)、复杂且不断演变的跨资产依赖关系,以及频繁的市场体制转换。经典线性因子模型具有可解释性,但缺乏捕捉非线性交互和时变动态的灵活性。相反,深度学习方法虽然强大,但在噪声环境中往往正则化不足,未能基于不断演变的横截面结构进行条件建模,且未能充分利用既定的金融先验知识。现有方法通常难以在神经网络的表达能力与投资组合构建所需的可解释性和鲁棒性之间取得平衡。
方法论:PRISM-VQ
作者提出了PRISM-VQ(基于先验信息的向量量化股票模型),这是一个统一的框架,旨在通过两阶段学习范式来解决上述局限,该范式整合了离散表示学习、结构条件时序建模以及领域先验知识。
1. 核心架构
PRISM-VQ 将问题分解为空间学习(阶段 1)和时序学习(阶段 2):
阶段 1:空间学习(离散因子发现)
- 目标:发现一种可复用的离散横截面结构,作为信息瓶颈,在抑制噪声的同时保留市场结构。
- 机制:每只股票的时间特征通过 GRU 编码,随后由跨资产 Transformer 处理以聚合横截面信息。这些连续嵌入使用**向量量化(VQ)**相对于一个可学习的码本进行离散化。
- 正则化:为确保离散代码具有语义意义而非任意划分,模型采用:
- 对比学习:扩大分配码字与竞争原型之间的间隔。
- 重构:一个 FiLM 条件解码器从量化代码重构输入特征。
- 多期限预测:一个辅助任务预测未来回报,以使代码与前瞻性信号对齐。
- 输出:每只股票被分配一个离散代码 zq,i,它作为潜在因子值和结构信号。
阶段 2:时序学习(动态因子载荷)
- 目标:生成以学习到的横截面结构为条件的时变因子载荷。
- 机制:基于 Transformer 架构构建的结构条件混合专家(MoE)。
- 路由:阶段 1 的离散代码 zq,i 充当门控信号。它决定了在特定时间针对特定股票激活哪些专家(子网络)。
- 因子整合:模型为专家先验因子(例如来自 JKP 全球因子库的价值、动量因子)和学习到的潜在因子生成动态载荷。最终预测是线性组合:yi=αi+βp,iTfp+βl,iTfl,i。
- 训练:码本在阶段 1 之后冻结。阶段 2 端到端地优化时序 Transformer 和 MoE 参数,使用负载均衡正则化器以防止专家崩溃。
2. 关键设计选择
- 作为归纳偏置的向量量化:通过将连续嵌入映射到有限的一组原型,模型抑制了特质噪声,并鼓励重用稳定的横截面模式。
- 离散代码门控的 MoE:该机制允许模型针对离散代码识别的不同市场体制,为不同的专家进行专业化处理,从而在保持可解释性的同时实现自适应因子载荷。
- 两阶段解耦:将结构发现与时序建模分离,防止码本崩溃并强制形成清晰的信息瓶颈,确保时序模型基于稳定的市场结构表示进行条件建模。
主要贡献
- 统一框架:PRISM-VQ 是首个在单一基于因子的模型中整合向量量化离散因子、对比表示学习、专家先验因子以及离散代码条件时序建模的框架。
- 有效的归纳偏置:论文证明,向量量化为金融表示学习提供了鲁棒的归纳偏置,在低信噪比环境中始终优于连续潜在替代方案。
- 结构条件动态:引入离散代码门控的 MoE 实现了动态因子载荷生成,使其能够适应不断演变的市场结构,同时保持清晰的因子解释。
- 实证验证:在沪深 300 和标普 500 市场上的广泛实验显示,其表现一致优于强基准模型。
实验结果
该模型使用 2022–2024 年的数据(严格样本外)在沪深 300(中国)和标普 500(美国)市场上进行了评估。
- 性能指标:
- 沪深 300:实现了0.0646 的 RankIC和1.57 的夏普比率,优于所有基准模型,包括基于 Transformer 的模型(如 DTML、MASTER)和自编码器变体。
- 标普 500:实现了0.0141 的 RankIC和0.67 的夏普比率,RankIC 比最佳基准(DTML)提高了 58.4%。
- 消融研究:
- 移除离散码本导致了最显著的性能下降(沪深 300 的 RankIC 下降约 27%,标普 500 变为负值),突显了离散瓶颈的必要性。
- 移除专家先验因子显著降低了性能,特别是在高效的标普 500 市场中,证实了领域知识的正则化作用。
- 用单一网络替换MoE降低了性能,验证了结构条件专业化的必要性。
- 可解释性:
- t-SNE 可视化:学习到的代码形成了聚类,这些聚类并不严格与行业分类或市值对齐,表明捕捉到了更丰富的横截面结构。
- 因子暴露:代码与标准金融因子(如盈利能力、动量)表现出系统性但适度的相关性,表明它们捕捉的是多维因子组合,而非复制单一因子。
- 专家专业化:MoE 中的不同专家在不同的市场体制下激活,具有统计上截然不同的激活模式和低时间重叠。
意义与主张
作者声称,PRISM-VQ 解决了经典因子模型的可解释性与深度学习的预测能力之间的关键差距。通过将向量量化视为信息瓶颈,并利用离散代码门控专家网络,该模型成功应对了金融数据的低信噪比和非平稳特性。
论文提出,将离散信息瓶颈与先验信息条件计算相结合是金融回报预测的有效设计原则。结果表明,这种方法不仅提高了排序准确率和投资组合表现(更高的夏普比率、更低的回撤),还保留了金融分析所需的可解释性,为不断演变的市场体制下的投资组合构建提供了稳健的解决方案。作者强调,他们的方法不依赖于预定义的关联拓扑(如图),而是学习隐式的横截面结构,从而增强了在不同市场间的可迁移性。
每周获取最佳 quantitative finance 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。