这篇论文介绍了一个名为 Quantformer 的“超级选股机器人”。为了让你轻松理解,我们可以把股票投资想象成在茫茫大海中捕鱼,而这篇论文就是介绍一种全新的、更聪明的“捕鱼网”。
1. 背景:传统的捕鱼方式 vs. 现在的挑战
- 传统方法(老渔夫): 以前的量化交易(用数学模型炒股)就像老渔夫,他们主要看几个固定的指标,比如“鱼的大小”(股价)、“网的大小”(成交量)。他们用的工具比较死板,像马克维茨投资组合理论,主要是算算怎么分配鱼网最安全。
- 现在的挑战(变幻莫测的海): 现在的股市太复杂了,就像大海的天气说变就变。不仅有长期的趋势(比如季节变化),还有瞬间的情绪(比如突然刮起的风暴)。老渔夫的工具很难捕捉到这些长期的、细微的信号,也很难把“鱼群的情绪”(市场情绪)和“鱼的数据”(价格、成交量)结合起来看。
2. 主角登场:Quantformer(聪明的“翻译官”)
作者们发明了一个叫 Quantformer 的新模型。你可以把它想象成一个从“读小说”跨界到“看数据”的天才翻译官。
- 它的出身(Transformer): 这个模型原本是用来读小说、写文章的(比如现在的 ChatGPT 就是这种架构)。它最擅长的本事是理解长句子,知道这句话里的“苹果”和前面那个“红色的”有什么关系,哪怕它们隔了很远。
- 它的跨界(从文字到数字): 以前,这种模型只能处理文字(把单词变成向量)。但股票数据全是数字(今天涨了多少,换手率是多少),没有“单词”可换。
- 创新点: 作者把模型里的“单词翻译器”(Word Embedding)换成了一个简单的**“数字转换器”**(线性层)。
- 去掉了“位置标签”: 在写文章时,我们需要知道“第几个字”;但在看股票数据时,时间顺序是天然存在的(昨天就是昨天,今天就是今天),所以作者干脆把模型里用来标记位置的“定位器”也拆掉了,让模型更专注于数据本身。
3. 它是如何工作的?(捕鱼过程)
想象一下,Quantformer 是这样捕鱼的:
- 收集线索(输入): 它不只看今天的股价,而是像侦探一样,把过去 20 天的股价涨幅和交易热度(换手率)全部串起来,形成一条长长的“线索链”。
- 理解情绪(市场感知): 它不仅能看数字,还能像读懂文章情绪一样,读懂这些数字背后代表的市场情绪。比如,如果某只股票突然交易量巨大但价格没动,它可能判断出这是“有人在悄悄布局”或者“有人想逃跑”。
- 预测未来(输出): 它不直接告诉你“明天买哪只”,而是给每只股票打分,预测它未来是大涨、小涨、横盘、小跌还是大跌。
- 制定策略(下注): 根据预测,它只买那些它认为“大概率大涨”的股票,并且根据预测的准确度来分配买多少(权重)。
4. 战绩如何?(捕鱼成果)
作者用中国股市过去 14 年(2010-2023)的数据,让 Quantformer 和100 种传统的选股方法进行了一场“捕鱼大赛”。
- 对手们: 那些传统的“老渔夫”(基于价格、成交量等 100 种常见因子),平均每年不仅没赚到钱,还亏了不少(平均年化收益 -3.78%)。
- Quantformer 的表现:
- 赚得多: 在月度策略中,它实现了**17.35%**的年化收益,远超大盘(CSI 300 指数只有 1.77%)。
- 风险低: 它的“翻船率”(最大回撤风险)控制得很好,比大多数对手都稳。
- 胜率高: 它的胜率(赚钱的天数比例)接近 58%,意味着它大部分时间都在赚钱。
5. 核心启示
这篇论文告诉我们一个道理:把处理复杂语言(如写诗、翻译)的超级大脑,稍微改造一下,用来处理复杂的数字(如股票),效果出奇的好。
- 以前: 我们觉得股票是冷冰冰的数字,只能算数。
- 现在: 股票数据里藏着像“故事”一样的逻辑和情绪,用能读懂“故事”的 AI 模型(Transformer)来读,反而能发现别人看不到的赚钱机会。
一句话总结:
Quantformer 就像是一个把“读故事”的天赋用在了“看 K 线图”上的超级渔夫,它通过理解过去 20 天的“数字故事”,精准地预测未来的“鱼群动向”,从而在波涛汹涌的股市里,比传统方法捕到了更多、更肥的鱼。
以下是基于论文《Quantformer: from attention to profit with a quantitative transformer trading strategy》的详细技术总结:
1. 研究背景与问题 (Problem)
核心挑战:
传统的量化交易策略(如基于 Fama-French 多因子模型)主要依赖静态的基本面分析或简单的线性计算,难以捕捉金融市场中复杂的非线性关系和长程依赖。虽然机器学习(如 SVM、LSTM、GRU)已被引入,但在处理金融时间序列数据时仍面临两大瓶颈:
- 输入数据类型不匹配: 自然语言处理(NLP)中的 Transformer 模型通常处理文本(词向量),而金融数据主要是数值型(价格、换手率)和类别型(行业)。传统的 Word Embedding 无法直接处理数值序列。
- 任务目标差异: 标准 Transformer 多用于 Seq2Seq(序列到序列)任务(如翻译),需要解码器和掩码(Masking)机制。而股票预测的目标通常是预测未来一段时间内的收益率分布(分类或回归),不需要生成序列,现有的 Transformer 架构直接应用效果不佳。
研究目标:
构建一种能够直接处理数值型时间序列数据、捕捉长程依赖并结合市场情绪信息,从而生成高质量投资因子(Investment Factors)的神经网络架构,以优化股票选择策略。
2. 方法论 (Methodology)
论文提出了 Quantformer,一种针对量化金融任务改进的 Transformer 架构。
2.1 数据预处理
- 输入特征: 选取 20 个连续时间步(如 20 个月/周/天)的历史数据。
- 特征维度: 每个时间步包含两个核心特征:
- 累计日收益率 (r):反映价格波动。
- 累计日换手率 (v):反映市场情绪和交易活跃度。
- 标准化: 使用 Z-score 对输入数据进行零均值、单位方差归一化,以消除异常值影响并增强特征可比性。
- 标签构建 (Target Labels):
- 将未来一期的股票收益率进行排序,根据经验分位数 CDF 将股票划分为不同的桶(Bins)。
- 采用 One-hot 编码:例如 ϱ=3 时,将前 20%(高收益)、中间 20%、后 20%(低收益)分别标记,中间区间标记为全零向量(Null-label),以此作为分类任务的标签。
2.2 Quantformer 架构创新
Quantformer 对原始 Transformer 进行了关键修改以适应数值数据:
- 移除位置编码 (Positional Encoding): 认为时间序列数据本身具有天然的时间顺序,无需额外的位置编码模块。
- 线性嵌入层 (Linear Embedding): 用标准的线性层(Linear Layer)替代 NLP 中的 Word Embedding 层,直接处理数值输入,将输入维度映射到隐藏层维度 d。
- 简化解码器 (Simplified Decoder):
- 移除了自回归预测机制和掩码操作(Masking)。
- 直接输出未来收益率的概率分布(Softmax),而非生成序列。
- 多头自注意力机制 (Multi-head Self-Attention): 保留核心注意力机制,用于捕捉不同时间步之间的长程依赖关系和特征间的交互。
2.3 交易策略
- 因子应用: 将 Quantformer 预测的股票收益率概率分布作为排序因子。
- 组合构建: 根据预测概率对股票进行排序,选取排名靠前的股票构建等权投资组合。
- 回测设置: 基于中国 A 股市场(2010-2023 年,4601 只股票),测试了月频、周频和日频三种交易频率,并考虑了交易成本(0.3%)。
3. 关键贡献 (Key Contributions)
- 架构创新: 提出了 Quantformer,成功将 Transformer 从 NLP 领域迁移至量化金融领域。通过移除位置编码和替换嵌入层,使其能够直接处理纯数值型时间序列数据。
- 迁移学习思路: 借鉴了情感分析(Sentiment Analysis)的思想,将换手率等指标视为反映“市场情绪”的信号,利用 Transformer 强大的序列建模能力捕捉这些非线性特征。
- 大规模实证研究: 使用了中国资本市场过去 14 年(2010-2023)超过 500 万条滚动数据,涵盖了 4601 只股票,进行了不同频率和不同训练规模(不同分位点截断)的广泛测试。
- 超越传统因子: 证明了基于深度学习的 Transformer 因子在预测能力和风险控制上显著优于传统的 100 个价格 - 成交量类因子。
4. 实验结果 (Results)
4.1 整体表现
- 月度策略 (Month 1): 表现最佳。年化收益率 (AR) 达到 17.35%,年化超额收益 (AER) 为 19.43%。
- 夏普比率 (Sharpe Ratio): 达到 0.915,显著高于对比的其他因子策略(最高仅为 0.243)。
- 风险控制: 99% 的在险价值 (VaR) 仅为 2.81%,表明在极端市场条件下损失可控。
- 对比基准: 相比 CSI 300 指数(年化收益 1.77%)和 100 个传统因子(平均年化收益 -3.78%),Quantformer 策略具有显著的超额收益。
4.2 不同训练规模的影响
- 实验测试了选取不同比例股票(Top 20%, 10%, 5%, 1%)作为训练目标的效果。
- QF 1% 策略: 虽然波动率较高,但取得了最高的年化收益率 24.71% 和超额收益 35.74%,证明了模型在捕捉极端 Alpha 方面的潜力。
- 鲁棒性: 模型在不同频率(月/周/日)和不同训练集规模下均表现出优于基准的稳定性。
4.3 可视化对比
- 回测曲线显示,Quantformer 策略的累计收益曲线显著高于基准指数(CSI 300)和其他传统因子策略(如 EMAC20, MAC20, ROC20 等)。
5. 意义与展望 (Significance)
- 量化交易的新范式: 证明了 Transformer 架构在处理金融时间序列数据方面的有效性,为量化因子挖掘提供了新的技术路径。
- 解决数据异构性: 通过线性嵌入和架构简化,解决了数值型金融数据无法直接输入 Transformer 的难题,使得模型能够同时利用价格、成交量和市场情绪等多维信息。
- 实际应用价值: 该策略不仅理论可行,且经过长周期、大规模数据的回测验证,具备实盘应用的潜力。代码已开源,促进了学术界和工业界的进一步研究。
- 未来方向: 论文指出,结合市场情绪信息(如换手率)与 Transformer 的长程记忆能力,可以显著提升交易信号的准确性,未来可进一步探索多模态数据(如新闻文本 + 数值数据)的融合。
总结: 本文提出的 Quantformer 成功地将注意力机制转化为利润,通过改进的 Transformer 架构捕捉金融市场的复杂动态,在预测股票趋势和构建投资组合方面展现了超越传统量化方法的卓越性能。
每周获取最佳 quantitative finance 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。