这篇论文介绍了一种让 AI 变得更聪明的新方法,我们把它叫做"推理记忆"(Reasoning Memory)。
为了让你轻松理解,我们可以把现在的 AI 模型想象成一个正在参加考试的超级天才学生。
1. 现在的困境:天才也会“死记硬背”
以前的 AI 考试策略(被称为“测试时扩展”)是这样的:遇到一道难题,AI 会想:“我不确定,那我再多花点时间思考吧!”于是它开始写长长的解题步骤,反复尝试,直到算出答案。
但这有个大问题:它每次都是“从零开始”思考。
就像那个天才学生,虽然很聪明,但每次遇到新题,他都要重新推导一遍“勾股定理”怎么用,或者重新想一遍“遇到这种几何题该先画辅助线还是先算面积”。他虽然脑子里有知识,但不知道如何把旧经验灵活地套用到新问题上。他缺乏的是“解题套路”或“思维捷径”。
2. 核心创新:建立“解题秘籍库”
这篇论文的作者们想:“既然 AI 以前做过那么多题,为什么不让它把那些成功的解题思路存下来,变成一本‘秘籍’呢?”
于是,他们做了三件大事:
**第一步:拆解“思维过程” **(把长故事变短句)
他们收集了 AI 以前做过的 3200 万道数学、科学和编程题的解题过程。这些过程通常很长很啰嗦。
- 比喻:就像把一本厚厚的《侦探小说全集》拆散,提取出每一个精彩的“破案技巧”。比如,把“先检查指纹,再比对数据库,最后锁定嫌疑人”这一长串过程,提炼成一条简短的子问题(“怎么锁定嫌疑人?”)和对应的子程序(“先查指纹库,再比对”)。
- 最终,他们建立了一个包含 3200 万个“解题小锦囊”的数据库。
**第二步:考试时的“灵光一闪” **(实时检索)
当 AI 现在遇到一道新题时,它不再只是闷头苦想。
- 比喻:当 AI 读到题目,它会在心里对自己说:“等等,这道题好像以前见过类似的!让我先问问自己:‘这道题的核心难点是什么?’"
- 然后,它立刻去那个“解题秘籍库”里搜索。比如,它发现这道题需要“计算三角形面积”,它就会从库里调出之前存好的“如何计算三角形面积”的通用步骤,直接贴在它的思考过程中。
- 这就像学生在考场上,突然想起了老师以前讲过的一个万能解题模板,直接套用,思路瞬间清晰了。
**第三步:多路尝试 **(广撒网)
为了保险起见,AI 会同时调用几个不同的“解题锦囊”,尝试几种不同的解题路径,最后选出最靠谱的那个答案。
3. 为什么这很厉害?
论文通过实验发现,这种方法比传统的“查资料”(检索网页文档)或者“死磕”(单纯增加思考时间)都要强得多。
- 传统查资料:就像学生遇到难题去翻百科全书,找到的可能是“三角形的定义”,但这对他怎么解题帮助不大。
- 推理记忆:找到的直接是“遇到这种三角形,先算半周长,再用海伦公式”的操作指南。
数据说话:
在数学、科学和编程的顶级难题测试中,使用这种方法的 AI,准确率比不用任何辅助的 AI 提高了近 20%,比目前最强的“死磕”策略也提高了近 8%。
4. 总结:从“蛮力”到“智慧”
这篇论文的核心思想是:真正的智能不仅仅是“想得更多”,而是“记得更巧”。
- 以前的 AI:像是一个勤奋但缺乏经验的学徒,每次都要重新发明轮子。
- 现在的 AI(加上推理记忆):像是一个经验丰富的老手,手里拿着一本厚厚的“错题集”和“解题套路书”,遇到新问题时,能迅速调取过去的经验,知道该用什么招数。
这就好比教孩子学数学,我们不应该只让他死记硬背公式,而应该教他如何拆解问题、如何寻找解题模式。这篇论文就是让 AI 学会了这种“元认知”能力——学会如何思考,而不仅仅是思考什么。
这是一份关于论文《Procedural Knowledge at Scale Improves Reasoning》(大规模过程性知识提升推理能力)的详细技术总结。
1. 研究背景与问题 (Problem)
背景:
测试时扩展(Test-time scaling)已成为提升大语言模型(LLM)在数学、科学和编程等复杂推理任务上表现的有效范式。现有的推理模型(如 OpenAI o1, DeepSeek R1)通过生成更长的“思考”(Thinking)序列来提升性能。
核心问题:
尽管测试时扩展取得了进展,但现有方法存在显著局限:
- 知识孤立: 大多数方法将每个问题视为孤立事件,未能系统性地重用过往推理轨迹中的知识。
- 过程性知识(Procedural Knowledge)利用不足: 现有方法主要关注事实性知识(定义、公式),而忽略了更关键的过程性知识——即“如何重构问题”、“如何分解子问题”、“如何选择策略”以及“何时验证或回溯”。
- 检索增强生成(RAG)的错位: 传统的文档级 RAG 检索的是通用背景知识,往往与模型当前的推理状态(如具体的子问题)对齐度低,导致检索内容对推理过程的指导作用有限,甚至可能引入噪声。
2. 方法论 (Methodology)
作者提出了 Reasoning Memory,这是一个专为推理模型设计的检索增强生成(RAG)框架,旨在在大规模上检索并重用过程性知识。
2.1 过程性知识数据构建 (Datastore Construction)
- 数据源: 利用公开的 Nemotron V1 语料库(包含数学、科学和编程的推理轨迹)。
- 分解策略: 将冗长且嘈杂的原始推理轨迹分解为自包含的“子问题 - 子程序”对(Subquestion-Subroutine Pairs)。
- 子问题 (Subquestion, SQ): 捕捉推理过程中的关键中间目标(例如:“如何将任意进制转换为十进制?”)。
- 子程序 (Subroutine, SR): 针对该子问题的高层解决策略摘要,抽象掉具体的数值计算和试错过程,保留通用的解题步骤。
- 规模: 最终构建了一个包含 3200 万 个紧凑过程性知识条目的数据商店。
2.2 推理时的主动检索 (In-Thought Active Retrieval)
- 思维劫持提示 (Thought-Hijacking Prompt): 在模型开始思考时,插入一个元提示(Meta-prompt),引导模型将当前的子问题“口头化”(Verbalize)为一个简洁的搜索查询(Query)。
- 示例提示: “现在,让我搜索一个类似的基础问题,其解决方案能帮助我解决当前步骤。让我将其表述为一个更高层的 Google 搜索查询:”
- 检索与注入: 使用密集检索器(ReasonIR-8B)根据生成的查询检索最相关的子问题和子程序。
- 隐式先验: 将检索到的子程序作为“提示(Hint)”直接注入到模型的推理流中,作为隐式的过程先验(Procedural Priors),引导模型继续推理。
2.3 基于检索的测试时扩展 (Inference-Time Scaling)
- 多样性采样: 给定推理预算(采样次数 m),模型利用检索到的 k 个子程序,为每个子程序分配采样预算(⌊m/k⌋),生成多条推理轨迹。
- 不确定性过滤: 使用生成长度作为不确定性代理指标(Uncertainty Proxy)。直觉是:不确定的推理往往会导致更多的分支和回溯,从而产生更长的轨迹。
- 计算每条轨迹的长度,归一化后,保留较短(更自信)的轨迹。
- 根据子程序的平均质量分数筛选子程序,最终选择置信度最高的 n 个样本作为最终答案。
3. 关键贡献 (Key Contributions)
- 提出了过程性知识数据商店: 首次构建了包含 3200 万条“子问题 - 子程序”对的大规模过程性知识数据商店,将非结构化的推理轨迹转化为可检索、可重用的结构化知识。
- 设计了“思维内”检索机制: 提出了一种轻量级的思维劫持提示,使模型能够在推理过程中主动生成查询并检索相关策略,实现了检索与推理流的无缝融合。
- 验证了过程性知识优于事实性知识: 通过对比实验证明,对于推理模型,检索过程性指导(如何解题)比检索事实性背景知识(是什么)更有效。
- 实现了可扩展的测试时扩展: 证明了通过检索多样化的过程先验并配合长度过滤,可以在不增加模型参数量的情况下,显著提升推理性能,且性能随推理预算增加而持续上升。
4. 实验结果 (Results)
实验在数学(AIME 2024/2025, MATH500)、科学(GPQA-Diamond)和编程(LiveCodeBench)等多个前沿基准上进行了评估,使用了 DeepSeek-R1-Distill-Llama-8B, OpenThinker3-7B, Qwen3-32B 等模型。
- 性能提升:
- Reasoning Memory 在所有任务类型上均一致优于无检索基线(No RAG)。
- 在较高的推理预算下(m=30),相比无检索基线,准确率最高提升了 19.2%。
- 相比最强的计算量匹配基线(Length Scaling,即仅增加采样次数而不检索),性能提升了 7.9%。
- 对比其他 RAG 方法:
- 显著优于文档级 RAG(检索通用网页文档):文档级 RAG 对推理模型甚至产生负面效果,因为通用文档与具体推理步骤对齐度差。
- 优于轨迹级 RAG(检索完整轨迹)和模板级 RAG(检索固定模板):细粒度的“子问题 - 子程序”分解比整体轨迹或固定模板更具灵活性和适用性。
- 消融实验:
- 分解的重要性: 移除子问题分解(直接检索完整轨迹)会导致性能大幅下降,证明细粒度分解对匹配不同推理阶段至关重要。
- 自生成查询的重要性: 使用原始问题作为查询而非模型自生成的子问题查询,会导致性能下降,特别是在编程任务中。
- 数据多样性: 混合领域(数学 + 科学 + 代码)的数据商店效果优于单一领域,表明跨领域的过程性知识迁移有效。
5. 意义与结论 (Significance)
- 范式转变: 该研究表明,测试时计算力的分配不应仅用于生成更长的思维链,还应用于结构化地重用过往的解题经验。
- RAG 的新方向: 为 RAG 社区提供了新视角:在推理任务中,检索的内容应从“事实/文档”转向“过程/策略”。
- 通用性与可扩展性: 该方法模型无关(Model-Agnostic),适用于各种开源推理模型,且随着数据商店规模和推理预算的增加,性能呈现良好的扩展性。
- 未来展望: 这项工作展示了构建能够随时间积累、检索并重用过程性知识的系统的巨大潜力,为提升 AI 在复杂任务中的推理能力提供了一条切实可行的路径。
总结: 论文通过构建大规模过程性知识数据商店,并结合“思维内”检索策略,成功解决了推理模型在测试时无法有效复用过往经验的问题,显著提升了模型在数学、科学和编程领域的推理能力。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。