← 最新论文
🤖 AI

AlphaMemo: Structured Search-Process Memory for Self-Evolving Alpha Mining Agents

AlphaMemo 是一个用于阿尔法挖掘(alpha mining)的自进化大语言模型(LLM)智能体,它通过利用结构化搜索过程记忆来记录并利用可重用的编辑基元(edit motifs)、置信度门控残差(confidence-gated residuals)以及针对失败模式的非对称否决控制(asymmetric veto controls),从而提升了发现效率和样本外表现。

原作者: Hang Yu, Zifan Zheng, Jeff Z. Pan, Tongliang Liu, Zhiyong Wang, Fengxiang He

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Hang Yu, Zifan Zheng, Jeff Z. Pan, Tongliang Liu, Zhiyong Wang, Fengxiang He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图寻找一个完美的食谱,制作出一道能卖出数百万份的菜肴。你拥有一个庞大的现有食谱库(即“搜索账本”),并希望通过对旧食谱进行微调来创造新食谱。

在金融领域,这被称为 Alpha Mining(Alpha 挖掘)。这里不再是食物,而是被称为“食谱”的数学公式,它们用于预测股票价格。目标是找到既准确又独特,且不只是在盲目模仿他人的公式。

这篇论文介绍了一种名为 AlphaMemo 的智能计算机代理,旨在比以往更好地完成这项“搜寻食谱”的工作。以下是它的工作原理,通过简单的类比进行解释:

问题所在:“盲目厨师”

以往试图寻找这些股票公式的 AI 代理就像是那些只能记住成品味道的厨师。

  • 问题在于: 如果一道菜味道好,厨师就会尝试再做一次;如果味道不好,他们就会避开它。
  • 缺陷: 这种方式过于简单。有时候,一道菜味道好可能仅仅是因为运气(这对长期投资不利)。有时候,厨师做了一个微小的、特定的改动(比如把糖换成了盐),导致了失败,但 AI 并不知道究竟是哪个改动导致了失败。它只看到“坏掉的菜”然后就放弃了。这会导致时间的浪费和重复犯错。

解决方案:AlphaMemo 的“厨房笔记”

AlphaMemo 与众不同,因为它保留了一份 结构化搜索过程记忆(Structured Search-Process Memory)。它不仅记住最终的菜肴,还记录了烹饪过程的详细笔记。

以下是 AlphaMemo 的四个主要成分:

1. “编辑基元”(Edit Motif,即特定的微调)

当一位厨师修改食谱时,他们不会只说“我改了它”,而是会说:“我把烘焙时间从 20 分钟改成了 25 分钟。”

  • AlphaMemo 的做法: 它观察旧公式和新公式的数学“骨架”(称为抽象语法树,AST)。它识别出精确的“编辑基元”——即 AI 做出的具体动作(例如:“增加了时间延迟”、“更换了排序算子”)。
  • 益处: 它能学习到这种特定的动作,在应用到这种特定类型的食谱时,通常是奏效还是失效。

2. “置信度门控”(Confidence Gate,即安全阀)

想象一位新手厨师非常兴奋地宣称:“我试着加了一点辣椒,效果惊人!”但他们只试过一次。你应该相信他们吗?可能并不。

  • AlphaMemo 的做法: 它拥有一个置信度门控。在记忆影响决策之前,它不会让记忆发挥作用,直到它多次观察到相同的“编辑”产生成功(或失败)的结果。如果数据具有噪声或稀缺,代理会忽略记忆,转而遵循其基础且安全的搜索规则。这可以防止 AI 被早期的运气所迷惑。

3. “残差修正”(Residual Correction,即精细调节器)

该代理拥有一套强大的基础规则库(“搜索账本”),根据历史记录告诉它哪些食谱通常是优秀的。

  • AlphaMemo 的做法: 记忆并不会试图重写整个规则库。相反,它扮演着精细调节器的角色。它会问:“规则库说这个食谱应该是 7/10 分。但根据我们过去对这种特定微调的经验,它通常能额外获得 1 分。”
  • 益处: 它在不颠覆整个系统的情况下修正微小的盲点,保持搜索的稳定性。

4. “非对称否决”(Asymmetric Veto,即严格的批评家)

这是最聪明的部分。在金融领域,寻找一个“获胜”的公式是困难且脆弱的(它可能下个月就不奏效了)。但寻找一个“失败”的模式通常很容易且具有永久性(例如,一个在数学上是错误的或过于复杂的公式)。

  • AlphaMemo 的做法: 它对正面和负面记忆采取不同的处理方式。
    • 正面记忆(好的编辑)被视为一种“软建议”。它们会提供一点提升,但不会强迫代理前往那里。
    • 负面记忆(坏的编辑)则被视为硬否决。如果代理看到一个曾经以高置信度失败过的模式,它会立即说:“不,不要那样做”,并封锁那条路径。
  • 益处: 它能积极地避开已知的陷阱,同时对发现脆弱的成功保持开放态度。

结果:更好的搜索

作者在两个主要的股票市场进行了测试:中证 500 指数(中国)和 标普 500 指数(美国)。

  • 更好的预测能力: AlphaMemo 找到的公式比其他方法能更准确地预测股票走势。
  • 更低的冗余度: 它找到了更多独特且有用的公式,而没有在重复的内容上浪费时间。
  • 稳定性: 由于有了“置信度门控”和“非对称否决”,它不会被早期的噪声或运气带来的惊喜所迷惑。

总结

请不要把 AlphaMemo 看作是一个只记得好菜的厨师,而要把它看作是一位资深副厨,他记录了每一次具体的食材替换和烹饪技巧。他清楚地知道哪些微小的改动往往会毁掉一道菜(并立即拦截它们),以及哪些微小的调整有助于提升菜肴(并谨慎地提出建议),同时依靠扎实的基础烹饪知识来确保搜索不偏离轨道。

这种方法使 AI 能够通过学习其搜索过程来实现“自我进化”,使其成为寻找金融信号的一种更高效、更可靠的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →