← 最新论文
📈 economics

DART: Domain Aware Relational Transformer for Stock Prediction

本文提出了 DART,一种领域感知关系 Transformer(Domain-Aware Relational Transformer),它结合了多尺度时间融合模块和领域知识引导的稀疏注意力机制,以实现最先进的股票预测性能,并显著降低在大规模数据集上的计算成本。

原作者: Ruoyu Huang, Xiaoyu Lin, Yibao Mao, Jiqiang Yan

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruoyu Huang, Xiaoyu Lin, Yibao Mao, Jiqiang Yan

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图预测天气,但你观察的不是云朵,而是股票市场。这就是量化金融的世界,科学家和投资者试图猜测哪些股票在明天会上涨或下跌。长期以来,人们认为市场就像一次完美的公平抛硬币,因为每个人都已经掌握了所有信息,所以没有人能真正预测未来。但随后,聪明的人意识到人类并不是完美的机器人;我们会感到恐惧、兴奋并随大流,这使得市场变得有些混乱,但实际上也是可以预测的。今天,我们使用强大的计算机和“深度学习”(一种从模式中学习的人工智能)来寻找这些隐藏在噪声中的信号。然而,大问题在于,存在着数以千计的股票,它们以复杂的方式相互影响。试图弄清楚每一只股票是如何与每一只其他股票进行交流的,就像试图同时聆听体育场内每一个人之间的对话一样——对于计算机来说,信息量太大,会导致其不堪重负。

这就是一个名为 DART(领域感知关系变换器,Domain-Aware Relational Transformer)的新研究所提出的巧妙解决方案。请把 DART 想象成一个解决问题的方案。过去,如果你想知道谁在和谁说话,你可能会尝试同时聆听所有正在进行的对话,但这太慢了,而且会让你头痛不已。DART 背后的研究人员意识到,人们主要是在自己的群体内进行交谈——比如零食桌旁的那些孩子,或者在果汁碗旁边的成年人。他们通常不会对着完全不同群体的某个人大声喊叫。因此,Dert 不再倾听所有人,它只倾听同一个“行业组”内的对话(例如,科技公司与其它科技公司之间的对话)。这使得计算机的工作效率大大提高。

论文指出,通过使用这种“分组聆听”策略,结合一种特殊的时间观察方式(同时检查短期趋势、中期趋势和长期趋势),该模型可以比旧方法更好地预测股票回报。在利用来自纳斯达克(NASDAQ)、纽约证券交易所(NYSE)和标准普尔 500 指数(S&P 500)的真实数据进行测试时,DART 模型显示出它能做出比其他顶尖模型更明智的投资选择,并能更好地处理风险。它还证明了,通过忽略无关股票的“噪声”,计算机可以比以前节省约 84% 的能量。虽然该模型并非保证利润的魔力水晶球,但作者认为,它是应对复杂且拥挤的股票市场的一个更实用且高效的工具。

DART 的故事:一种更聪明的市场聆听方式

问题所在:过多的噪声,过多的连接

想象你正在参加一场有数千人的大型音乐会。如果你想知道正在播放哪首歌,你可以尝试同时听取每个人的声音。但这几乎是不可能的;那只是一片嘈杂的噪音。这正是计算机在试图预测股票时面临的问题。存在着数以千计的股票,并且每一只股票都与其它所有股票相连。旧的计算机模型试图同时聆听“所有人”。这被称为“全注意力”(full attention)。从理论上讲它非常准确,但它太慢、太昂贵,以至于在处理拥有数千只股票的现实世界交易时几乎无法使用。这就像是通过逐一对比每一个拼图碎片来解决谜题;当谜题变得太大时,你的大脑(或计算机)就会崩溃。

解决方案:“行业邻里”规则

研究人员提出了一个简单而强大的想法:同一行业的股票是最好的朋友;不同行业的股票只是点头之交。

把股票市场想象成一座被划分为不同社区的大城市。有一个“科技社区”,一个“食品社区”,还有一个“汽车社区”。科技社区的人经常互相交流,因为他们共享相同的资讯和趋势。但是,科技社区的人很少与食品社区的人进行直接且紧迫的对话。

DART 模型使用了这一规则。它不再聆听整个城市,而是只聆听每个“社区”内部发生的对话。这被称为领域知识引导的稀疏注意力(Domain-Knowledge-Guided Sparse Attention, DSA)

  • 运作方式: 计算机观察一只股票,询问:“它属于哪个社区?”然后它只关注该社区内的其他股票。
  • 结果: 它忽略了来自无关股票的无用噪声。论文显示,这减少了大约 84% 的计算机工作量(具体而言,在他们的测试中,从 0.23 GFLOPs 降至 0.04 GFLOPs)。这就像是从试图在飓风中捕捉耳语,转变为仅仅是在咖啡馆里听一场安静的聊天。

时间机器:分层观察过去

预测未来不仅仅关乎谁在和谁说话,还关乎事情发生的“时间”。股票在不同的时钟下运行。有些移动很快(分钟级),有些移动中速(每日趋势),有些移动缓慢(月度或年度趋势)。

旧的模型通常试图仅用一副眼镜来看待时间,这意味着它们要么错过了宏观大局,要么错过了微观细节。DART 使用了一个**多尺度时间融合(Multi-Scale Temporal Fusion, MSTF)**模块。

  • 类比: 想象你在看电影。你有一个变焦镜头,可以让你看到演员脸部的微小细节(短期);一个广角镜头,可以展示整个场景(中期);以及一个无人机镜头,可以展示整个城市(长期)。DART 同时使用这三种镜头。
  • 神奇之处: 然后它使用一个特殊的“渐进式时间融合”(Progressive Temporal Fusion)网络将这些视角堆叠在一起。这就像制作一个三明治,每一层都增加了更多的风味,帮助计算机理解今天的微小变化是如何累积成明天的巨大趋势的。

研究发现:更快且更聪明

研究人员使用来自美国股市(纳斯达克、纽约证券交易所和标准普尔 500 指数)2020 年至 2024 年的真实数据,将他们的新模型 DART 与几种著名的模型(如 LSTM、GCN 甚至更新的 MambaStock)进行了对比。

以下是数据所表明的结果:

  1. 更高的回报: DART 不仅仅是预测得更好,它还帮助构建了一个更好的“投资组合”(一系列股票的集合)。在测试中,它在纳斯达克和标准普尔 500 指数上实现了最高的夏普比率(Sharpe Ratio,一个衡量收益与风险比值的指标)。例如,在纳斯达克上,DART 的夏普比率为 2.432,而排名第二的模型的得分是 1.827
  2. 顶级选股: 当模型挑选出它认为表现最好的前 10 只股票时,它的准确率比其他模型更高(这是一个被称为 Precision@10 的指标)。在纽约证券交易所,它对前 10 名选股的准确率达到了 58.7%,击败了竞争对手。
  3. “禁区”: 研究明确显示,如果移除“社区”规则并让计算机聆听所有人(全注意力),模型的表现会变得混乱且大幅下降。这证明了忽略无关的连接实际上对模型是有利的。

总结

论文指出,DART 是未来投资领域的一个实用且高效的工具。它并不声称自己是保证你会发财的魔力棒,但它确实表明,通过使用智能规则(例如只聆听自己的社区)并分层观察时间,计算机可以更好地理解混乱的股票市场。它通过变得具有选择性,解决了“数据过多”的问题,使得在不耗尽资金或计算资源的情况下,对数千只股票使用强大的 AI 成为可能。

正如作者所言,仍有提升空间。目前,该模型仅基于静态的行业列表来观察“社区”。在未来,他们希望使这些社区变成动态的,以便模型能够观察到一家科技公司突然开始表现得像一家食品公司,或者突发新闻将两个完全不同的群体联系在一起。但就目前而言,DART 是教导计算机如何驾驭金融世界的强大且高效的一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →