← 最新论文
💬 NLP

MILES: Modular Instruction Memory with Learnable Selection for Self-Improving LLM Reasoning

MILES 是一个用于自我改进大语言模型推理的新型框架,它通过动态扩展由逐步指令对组成的模块化记忆,并采用一种从粗到精的可学习选择机制,以在现实的测试时约束下优化记忆组合与推理准确性。

原作者: Ruilin Tong, Dong Gong

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruilin Tong, Dong Gong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于 MILES 论文的解释,通过简单的概念和富有创意的类比进行了拆解。

大局观:AI 的“智能笔记本”

想象你有一个聪明但固执的朋友(AI),他非常擅长解谜题,但记性极差。每次你问他一个新的数学问题时,他表现得就像从未见过这个问题一样。他能解出题目,但如果你稍后问一个类似的问题,他必须从头开始。

通常情况下,为了让这个朋友变得更聪明,你需要送他回学校学习好几年(这被称为“训练”或更新模型的参数)。但如果你的这个朋友是一个“封闭的书籍”,你无法送他回学校怎么办?你无法改变他的大脑。

MILES 是一种新的方法,可以在不改变其大脑的情况下,帮助他在工作时变得更聪明。它给了他一个动态的、可学习的笔记本,让他可以实时地在上面记录并查阅。

旧版笔记本的问题

以往给 AI 提供“记忆”的方法主要有两个缺陷:

  1. “完整方案”型笔记本: 一些方法会存储过去问题的完整答案。如果你问的问题与旧问题有 90% 的相似度,效果很好。但如果问题稍有不同(一个“新颖”的问题),旧答案就没用了。这就像试图用“苹果派”的食谱去烤“蓝莓玛芬”。
  2. “启发式”型笔记本: 其他方法存储的是微小的步骤(比如“除以 2”或“检查单位”)。但 AI 必须仅通过观察词汇的相似度来猜测下一步该使用哪个步骤。这就像厨师因为标签看起来很像,就随手抓起一个香料罐,然后祈祷一切顺利。

MILES 的解决方案:一个“模块化”且“可学习”的系统

MILES 通过将推理视为一套 乐高积木 而非一块完整的混凝土,改变了游戏规则。

1. 建筑模块:“子目标”与“子指令”

MILES 不再存储整个答案,而是将问题分解为微小的、可重复使用的乐高积木。

  • 子目标 (Sub-goal)(标签): 关于下一步需要做什么的简短描述(例如:“简化分数”)。
  • 子指令 (Sub-instruction)(积木): 关于如何执行该操作的具体自然语言提示(例如:“将分子和分母同时除以它们的最大公约数”)。

你可以把它想象成一个工具箱,里面的每件工具都有清晰的标签。

2. “智能选择器”(可学习的头部)

这是神奇之处。在过去,AI 只是抓取与当前问题看起来最相似的工具。MILES 为工具箱中的每一个工具都配备了一个私人助理(“选择头”)。

  • 它是如何学习的: 当 AI 自信地解决一个问题(得到正确答案)时,MI 莱斯会回顾它所采取的步骤。它会问:“嘿,当我们使用‘简化分数’这个工具时,它对我们得到正确答案有帮助吗?”
  • 训练过程: 如果答案是“是”,助手就会学习在类似情况下信任该工具。如果答案是“否”,助手就会学习在类似情况下避开该工具。
  • 无需重返学校: AI 的大脑保持冻结状态。只有这些“助手”(非常小的计算机程序)会被更新。

3. 两步搜索过程

当 AI 面临新问题时,MILES 使用“由粗到精”的搜索方式,就像在图书馆找书一样:

  • 第一层(粗略搜索): AI 快速扫描标签(子目标),找到几个有潜力的工具。这就像是在“数学”书架区域走动,并抓取几本可能相关的书。
  • 第二层(专家评审): “助手们”(选择头)会对这些候选工具进行评分,根据以往的经验给出评价。“等等,这个工具在代数中表现很好,但在几何中失败了。让我们选另一个。”

它是如何实时运作的(“自信 vs 不确定”流程)

系统根据 AI 的确定程度以两种模式运行:

  1. “自信”模式(学习阶段):
    如果 AI 轻松解决了问题并得到了正确答案,它会将此视为一次“训练课程”。它会分解成功的步骤,将它们存为笔记本中的新乐高积木,并教导它的助手哪些工具在特定情况下效果最好。随着每一次成功,笔记本变得更加丰富。

  2. “不确定”模式(求助阶段):
    如果 AI 陷入困境或感到不确定,它会停止瞎猜。它会打开笔记本,向它的助手寻求建议,并利用最好的工具来引导思考。这就像学生在遇到困难时举手向老师请教提示一样。

为什么这很重要(结果)

论文在困难的数学和科学考试(如 AIME 和 MATH-500)上测试了 MILES。

  • 更高的准确率: 它始终比使用记忆或搜索的其他方法解决更多的正确问题。
  • 高效性: 它不会浪费大量的计算资源去尝试随机猜测;它利用“学习到的”记忆更快地挑选出正确的路径。
  • 可迁移性: 由一个 AI 模型构建的笔记本实际上可以帮助另一个 AI 模型解决问题。这就像一位名厨写了一本食谱,即使从未见过这位名厨,初级厨师也能立即拿起并使用。

总结类比

想象你在玩电子游戏。

  • 旧方法: 你尝试通过猜测来打通每个关卡。如果你死了,你就重新开始。
  • 之前的记忆方法: 你保留了一份针对特定关卡的“获胜策略”清单。如果你看到第 5 关,你就使用第 5 关的策略。如果你看到第 5.1 关,你就卡住了。
  • MILES 方法: 你拥有一份动态更新的攻略指南。当你打赢一个关卡时,攻略指南会自动记录下在特定情况下表现最好的具体动作。下次当你面对一个棘手的跳跃时,攻略指南不仅仅是显示一个列表;它还有一个“智能过滤器”会说:“根据你过去的获胜记录,‘二段跳’在此处成功的概率为 90%。”

MILES 让 AI 能够积累经验并随着时间的推移变得更聪明,这并不是通过重新训练其大脑,而是通过学习如何更好地利用其不断增长的技巧库。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →