← 最新论文
💻 computer science

An Inter-variable Relationship-Aware Mixture-of-Experts Model for Stock Closing-Price Prediction

该论文提出了 IR-MoE,一种变量间关系感知混合专家 Transformer,它通过显式建模交易变量间的动态依赖关系,并采用稀疏路由结合股票级打乱训练策略,实现了在不同全球股票市场中卓越的预测准确率和零样本泛化能力。

原作者: Zhenjiang Chen, Bin Liu, Pei-Gen Ye, Yang Lv, Jun Zheng

发布于 2026-09-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenjiang Chen, Bin Liu, Pei-Gen Ye, Yang Lv, Jun Zheng

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

预测股票未来的价格是金融领域最持久的挑战之一。市场是一个混沌之地,受从全球新闻、政府政策到数百万投资者集体情绪等各种因素的影响。正因如此,股价并不遵循简单的直线运动;它们是充满噪声、反复无常且不断变化的。几十年来,专家们一直试图在这些混沌中寻找规律,通常通过观察一组标准的五个每日数值:开盘价、最高价、最低价、收盘价以及成交量。难点不仅在于随着时间的推移追踪这些数字,还在于理解它们是如何相互“对话”的。伴随大量成交量的价格上涨,与成交量极低时的价格上涨所传递的信息截然不同,然而许多计算机模型却将这五个数字视为彼此独立的、不相关的流数据。

研究人员面临的核心问题是,单个计算机程序是否能够学习股票市场复杂且多变的规则,并将其应用于新的、未见过的股票,而无需从头开始重新训练。传统方法往往难以应对这一点,要么无法捕捉价格与成交量之间微妙的关系,要么变得过于专门化于某一家特定公司,以至于无法适应另一家。这种局限性使得构建一个能够跨越不同国家和市场环境进行投资分析的通用工具变得十分困难。

在最近的一项研究中,来自北京理工大学的一个研究团队提出了一种解决该问题的新方法。他们开发了一个名为 IR-MoE 的系统,全称为“基于变量间关系感知的混合专家模型”(Inter-variable Relationship-Aware Mixture-of-Experts)。这个名字准确地描述了该系统的功能:它旨在感知不同交易变量之间的相互关系,并利用“混合专家”来进行预测。该系统并非强迫计算机为所有股票学习单一、僵化的规则,而是允许模型的不同部分专注于不同的市场状况。它的构建理念是:虽然每只股票都是独特的,但价格与成交量之间的相互作用方式往往遵循可以被学习并迁移的可识别模式。

研究人员首先从四个不同的金融市场收集了大量的历史数据:中国 A 股市场、美国、香港和日本。他们从这些地区选择了数百只具有代表性的股票,涵盖了广泛的行业和市场行为。研究人员并没有为这数百只股票分别训练单独的模型,而是将所有数据输入到一个统一的系统中。这种“联合训练”策略使模型能够学习共享的市场动态,例如成交量的激增如何信号化价格方向的转变,无论该股票是位于上海还是纽约。

该系统的核心是一个由两部分组成的架构。第一部分侧重于理解这五个每日数值之间的关系。研究人员将每个数字——开盘价、最高价、最低价、收盘价和成交量——视为一个独立的信息单元(或称“标记/token”),并使用一种受现代语言模型启发的机制让它们相互作用。这使得系统能够显式地学习,例如,收盘价是如何受到当天成交量影响的。通过对这些相互作用进行可视化,研究人员发现,模型在试图理解价格变动时,会持续关注成交量。这种注意力并非随机的;在市场剧烈波动期间,这种关注度变得更强,这表明模型已经学到了在市场动荡时期,成交量会成为一个更为关键的线索。

系统的第二部分是“混合专家”。想象一下一支专家团队,每位专家都精通某种特定的市场行为,例如稳步上升的趋势、突然的崩盘或平淡的横盘整理。当系统接收到新股票的数据时,它并不会询问所有专家。相反,一个路由机制会观察当前的 시장状况,并仅选择少数几个最相关的专家来进行预测。这使得系统能够即时适应不同的情况。如果市场表现得反复无常,它可能会调用在处理高波动模式方面经过训练的专家;如果市场很平静,它则可能依赖那些在稳定趋势方面经过训练的专家。这种灵活性使其能够处理全球股票市场多样且多变的本质。

研究结果在所有四个市场中进行了测试,包括一项严苛的测试,即要求模型在没有任何额外训练的情况下,预测它从未见过的股票价格。在这些“零样本”(zero-shot)测试中,新系统优于几种现有的方法,包括将数据拆分为更小部分的复杂模型,以及其他专为时间序列预测设计的先进人工智能系统。在中国 A 股市场上,该模型的预测误差率约为 1.10%,而在美国市场上,其误差率约为 1.32%。这些数据始终优于研究中表现最好的替代方案。

或许最显著的是,该模型证明了它可以在不同国界间转移知识。当该系统在从中国股票数据中训练后,直接应用于美国、香港和日本未见过的股票时,它依然保持了高度的准确性。这表明,价格与成交量之间的基本关系具有足够的普适性,可以被学习一次并应用到任何地方。研究人员还发现,当系统在多样化但规模适度的股票数量上进行训练时效果最好。增加数据最初会有所帮助,但超过一定程度后,收益就会递减,这表明关键在于覆盖广泛的市场行为,而非仅仅向系统喂入更多的数字。

为了确保系统正常运行,研究人员还检查了“专家”是如何被使用的。他们发现,如果没有特定的平衡机制,系统往往会过度依赖少数几个专家,导致其他专家处于闲置状态。通过添加一条强制系统更均匀地分配工作的规则,他们确保了模型的各个专门部分都能活跃并进行学习。这种在训练过程中的细节关注对于系统的稳定性和性能至关重要。

该研究得出结论,通过显式建模交易变量之间的相互作用,并使用灵活的专业预测器团队,构建一个更稳健、更具适应性的股票预测工具是可能的。研究人员指出,他们的方法为金融分析提供了一条充满前景的路径,即从僵化的、单一用途的模型转向能够理解市场复杂且多变语言的系统。虽然这项研究并不声称已经解开了股市的奥秘,但它证明了通过深入理解每日交易数据的内在联系,可以实现更准确且更具泛化能力的预测。这项工作为未来的研究打开了大门,未来可以纳入更多类型的数据,如新闻报道或日内交易细节,以进一步完善我们驾驭金融世界的能力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →