请将股市想象成一个巨大的、繁忙的城市,而非一系列孤立的岛屿,在这里,新闻像病毒一样传播。通常情况下,当一条坏消息冲击某家公司(例如台湾的一家工厂倒闭)时,传统的计算机模型只会观察该特定公司的价格历史。它们对于“新闻可能会传播到与其相关的其他公司(如供应商或客户)”这一事实是“盲目”的,直到这些其他公司的价格已经开始波动。到那时,就太晚了。
本文介绍了一种旨在捕捉这种“传染”的新系统,它能在新闻爆发的瞬间,预测哪些其他公司接下来会受到冲击。其运作方式如下,分为几个简单的部分:
1. 超高速扫描器(Rust 的优势)
将新闻流想象成一个巨大的、高速运转的文本信息传送带。
- 问题: 大多数计算机读取这些信息的速度太慢。当标准计算机读完一条标题时,市场已经做出反应了。
- 解决方案: 作者使用一种名为 Rust 的编程语言构建了一个“扫描器”。它就像一个专门的机器人,在阅读文本时从不停止思考或在笔记本上记录信息(这被称为“零拷贝”)。
- 速度: 它读取一条新闻记录大约需要 100 纳秒(十亿分之一秒)。换句话说,人类眨一下眼的时间大约是它的 3 亿倍。它可以在你打个响指的时间内,扫描出 47 家不同公司的列表。
2. “感染”追踪器(神经霍克斯过程)
一旦扫描器读取了新闻,它就会将其传递给一个用 Python 构建的“大脑”。这个大脑不仅看文字,还观察公司之间的联系。
- 比喻: 想象一个图谱,其中每家公司都是一个节点(点),而连接它们的线代表了它们彼此关注的程度。
- 学习方式: 该系统使用一种特殊的数学方法,称为神经霍克斯过程(Neural Hawkes Process)。你可以把它看作是一种“传染模型”。如果 A 公司遭受冲击(如丑闻),模型会计算这种冲击如何“激发”或“感染” B 公司、C 公司等。
- 转折点: 与那些将所有连接视为平等的旧模型不同,这个模型学习到这种连接是单向的。关于芯片制造商的新闻可能会对手机制造商产生重大影响,但反过来并不总是如此。该系统捕捉到了这种方向性。
3. “修剪”机制(保持整洁)
在实时流中,连接理论上会无限增长,导致计算机变慢。
- 修复方案: 系统有一个自动“园丁”。如果两家公司之间的连接变得过于微弱(“感染”消退),系统就会切断这条线。这确保了无论涌入多少新闻,计算机都不会变得臃符。
4. 结果:捕捉浪潮
团队在一个月的真实财经新闻上测试了这个系统,涉及 47 家主要公司(如苹果、英伟达和微软)。
- 测试: 他们问道:“当一个新闻事件冲击 A 公司时,系统能否预测哪家其他公司会在第二天出现大幅价格波动?”
- 结果:
- 随机猜测: 如果你只是随机挑选公司,你的准确率只有 8.9%。
- 同行业猜测: 如果你只是猜测同一行业的公司(例如,当一家科技公司发生新闻时,猜测另一家科技公司),你的准确率只有 4.5%。
- 本系统: 它的准确率达到了 15.1%。
- 结论: 这比随机猜测高出 1.7 倍,比仅在同行业内猜测高出 3.3 倍。
5. “顿悟”时刻
研究人员最重要的发现是一个“对照实验”。他们关闭了“连接图谱”(图)并让系统对公司进行单独处理。
- 结果: 系统的准确率降至 零。
- 意义: 这证明了系统的成功并非源于新闻读取或数学本身;而是完全因为它理解了公司是如何相互连接的。“传染”是驱动信号的唯一因素。
总结
本文描述了一个系统,它充当了财经新闻的高速雷达。它能瞬间读取文本,绘制出公司之间的关联图谱,并预测对一家公司的冲击将如何通过网络波及其他公司。虽然目前它运行在标准的计算机芯片上,但作者表明,通过更快的硬件,它可以运行得足够快,从而足以用于高频交易,在市场波动完全发生之前就洞察先机。
关键局限性: 论文指出,虽然该系统处理新闻的速度极快(毫秒级),但实际测试数据仅包含每日价格更新。因此,虽然该系统在理论上可以实时运行,但其预测“同日内”波动的能力仍有待未来的研究证明。
技术摘要:零拷贝语义传染 (Zero-Copy Semantic Contagion)
问题陈述
目前的金融预测模型目前处于孤岛化运行状态,将每个股票代码视为独立的序列。虽然数值信号(价格跳动、成交量)可以在微秒级进行套利,但定性信息(新闻)需要经过语义解析才能影响价格,其演变过程通常在 20–60 分钟的周期内展开。现有方法无法捕捉跨公司传播:例如,供应链中断(如台湾的一家晶圆厂出现问题)在单资产模型中,直到该资产的价格发生变动或该资产在文本中被明确提及之前,都无法产生反应。
两个工程障碍阻碍了在微秒级延迟下解决这一问题:
- 延迟: 通用的语义提取器会引入数百毫秒的延迟,超过了预测时限。
- 表示: 静态图无法很好地表示注意力机制,因为注意力会在事件之间迅速衰减,并且需要显式的连续时间动力学。
方法论
作者提出了一种异构 Rust-Python 流式架构,该架构通过直接从文本驱动的连续时间图来映射跨公司注意力。该系统解耦为微秒级的摄取边缘和毫秒级的推理引擎。
1. 系统架构
- 摄取边缘 (Rust): 一个零拷贝解析器处理 CSV/FIX 记录而不进行堆内存分配,返回输入缓冲区的字节切片引用。它强制执行单调时间戳,并执行语义聚类门控,根据余弦相似度过滤冗余标题。
- 性能: 解析记录约需 100 ns,扫描 47 个股票代码的宇宙(universe)约需 1.2 µs。
- 推理引擎 (PyTorch): 一个多元神经霍克斯过程 (Multivariate Neural Hawkes Process),在 N=47 个权益节点上的内存中连续时间注意力图中进行更新。
- 连续时间 LSTM (c-LSTM): 每个节点维护一个隐藏状态,该状态在事件之间呈指数级衰减,并在事件到达时通过标准的 LSTM 门控进行更新,并受投影文本嵌入的调节。
- 双线性潜变量投影 (Bilinear Latent Projection): 有向激发 (αij) 通过双线性注意力机制计算。这允许非对称的边权重 (αij=αji),从而捕捉定向传染(例如,从供应商到客户)而非对称相关性。
- 自适应边剪枝 (Adaptive Edge Pruning): 一种算法规则,当边的瞬时激发量低于阈值时将其剪枝,从而保证无论流长度如何,图密度始终保持有界(每个节点的摊余成本为 O(1))。
2. 图构建
初始邻接矩阵是三个数据驱动源的可学习凸组合:
- 共同提及 (Acm): 文章中共同出现的频率。
- 语义相似度 (Asem): 平均文章嵌入的余弦相似度。
- 收益相关性 (Acorr): 日对数收益率的皮尔逊相关系数。
这些权重在最大似然训练过程中与模型参数进行联合优化。
3. 训练目标
通过最大化观测到的事件序列的对数似然来优化参数。损失函数奖励观测到的事件处的高强度,同时惩罚静止期间的背景激活,以防止平凡的强度提升。
核心贡献
- 零拷贝 Rust 摄取: 一个解析速度约为 100 ns 且在通用硬件(Apple M2)上扫描 47 个股票代码仅需 1.2 µs 的解析器,通过使用 RDTSC 和内核旁路网络,在 x86-64 上具有进一步降低延迟的潜力。
- 非对称神经霍克斯过程: 一个连续时间模型,具有每节点 c-LSTM 状态和双线性潜变量投影,能够实现定向、上下文相关的边权重,这是对称构造所缺乏的能力。
- 有界计算成本: 一个自适应剪枝规则(命题 1),保证了有界的图密度,确保系统在永久流式传输中保持可扩展性。
- 传染检测协议: 一个不同于单股票价格预测的评估框架,专注于识别在新闻事件发生后,哪些其他公司将会经历异常收益。
实验结果
系统在 FNSPID 语料库(638 篇文章,47 个股票代码,2022 年 7 月)的一个月时间留出集上进行了评估。
- 精度提升: 在第 90 百分位次日收益阈值下,全模型实现了 15.1% 的精度。
- 这代表了相对于均匀随机选择(8.9%)的 1.70 倍提升。
- 这代表了相对于同行业启发式方法(4.5%)的 3.36 倍提升。
- 消融研究:
- 图拓扑结构: 移除图(将邻接矩阵设为零)会导致所有阈值下的精度降至 0.000,证实了图是跨公司信号的唯一驱动力。
- 双线性投影: 在此特定语料库上,双线性权重并未比静态邻接矩阵显著提高精度,但提供了必要的结构方向性。
- 剪枝: 在这种天然稀疏的语料库上,剪枝对精度没有产生经验性的影响,但在最坏情况下的计算保证方面仍然至关重要。
- 延迟: 在单个 CPU 上,每条记录的端到端处理延迟为 ~13 ms。Rust 摄取层对总延迟的贡献不到 0.02%。
- 投资组合信号: 基于强度加权的做多/做空策略(按强度做多前 10 名,做空后 10 名)在留出期间产生了正的年化收益,日胜率为 57.1%。
重要性与主张
论文声称解决了传统单股票预测的互补任务:给定一个公司的冲击,预测哪些其他公司会发生变动以及何时发生。
- 架构不变性: 数学模型对于部署目标是保持不变的;只有摄取层需要针对不同的硬件进行重新编译(例如,从 ARM 迁移到使用内核旁路网络的 x86-64)。
- 信号来源: 结果证实,动态注意力网络是该架构中跨公司信号的唯一驱动力;如果没有图拓扑结构,c-LSTM 动力学和基准率无法提供跨股票的判别能力。
- 可扩展性: 系统预计在单个 ARM 核心上每秒可处理超过 400,000 条记录,并利用批量计算在更大的宇宙规模下实现亚 10 ms 的推理。
作者指出,由于次日收益的复杂性,绝对精度(15.1%)虽然看似不高,但相对于基准的系统性提升证明了该架构成功捕捉到了孤立模型所忽略的结构性传染。未来的工作将转向日内评估和更高阶的传播建模。
每周获取最佳 quantitative finance 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。