← 最新论文
💬 NLP

Retrieved In-Context Principles from Previous Mistakes

该论文提出了检索式上下文原则(RICP),这是一种师生框架,通过分析并聚类学生模型的错误,生成定制化的任务级原则,以提升大语言模型在各类推理基准测试中的性能。

原作者: Hao Sun, Yong Jiang, Bo Wang, Yingyan Hou, Yan Zhang, Pengjun Xie, Fei Huang

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Sun, Yong Jiang, Bo Wang, Yingyan Hou, Yan Zhang, Pengjun Xie, Fei Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一名学生(学生模型)如何解决棘手的谜题。通常,我们通过展示完美的正确范例来教导他们。但这篇论文认为,通过展示他们出错的地方并解释原因,我们可以教得更好。

作者将他们的新方法称为RICP(检索式上下文原则)。这就像是一个由教师学生组成的智能、两步辅导系统。

以下是其工作原理,使用一个简单的类比:

问题:“一刀切”的教科书

以前的方法试图从错误中学习,但它们就像 handing 给学生一本标题为“如何避免错误”的通用教科书章节。

  • 缺陷:如果学生卡在一个关于披萨的数学问题上,阅读关于“检查你的工作”的通用规则可能帮助不大。反之,如果学生在解决逻辑谜题,关于“披萨数学”的规则则毫无用处。
  • 结果:建议要么太模糊,要么没有涵盖足够多种类的错误。

解决方案:“个性化导师”(RICP)

RICP 方法就像一位大师级教师,他观察学生参加练习测试,分析他们的具体错误,然后为下一次测试创建定制的学习指南。

第一步:“错误尸检”(洞察生成)

首先,学生模型尝试解决一堆练习题。教师模型(一个更智能的 AI)查看学生答错的那些题目。

  • 教师做什么:教师不只是说“错了”,而是撰写一份报告。它识别根本原因(例如,“你忘了在披萨价格上加上小费”),并提供具体的洞察(例如,“始终检查是否包含了总成本的每一部分”)。

第二步:“课程库”(原则构建)

这是魔法发生的地方。教师将这些错误组织成两类建议:

  1. “通用规则”(任务级原则)

    • 类比:想象一个教科书章节
    • 教师将相似的错误分组(例如,所有关于比例的数学错误)。从这些组中,它编写适用于任何数学问题的广泛规则。
    • 示例:“始终仔细检查你的算术运算。”
  2. “个人作弊条”(问题级原则)

    • 类比:想象一张贴在你当前正在查看的特定问题上的便利贴
    • 对于学生即将回答的确切问题,教师会在库中搜索最相似的历史错误。然后,它提取出适用于这种情况的具体建议。
    • 示例:“对于这道特定的披萨问题,记得在小费计算之前将其加到基础价格上,而不仅仅是计算小费。”

第三步:“考试日”(原则利用)

当学生面对新问题时:

  1. 它获得通用规则(教科书章节)以保持正确的方向。
  2. 它获得针对该特定问题量身定制的个人作弊条(便利贴)。
  3. 它将这些与其常规指令结合以解决问题。

关键在于:教师在考试期间不需要在场。学生只需使用教师之前准备的笔记。这使得运行速度快且成本低。

为什么这更好?

该论文在七个不同的“考试委员会”(数据集)上测试了这一点,涉及数学、常识和逻辑。

  • 定制化:与给所有人相同建议的旧方法不同,RICP 为特定问题提供正确的建议。
  • 覆盖面:通过分组错误,它确保学生从各种各样的错误中学习,而不仅仅是最常见的错误。
  • 结果:当他们将这些“错误笔记”添加到标准的 AI 提示方法中时,学生模型变得显著更聪明、更准确,特别是在困难的逻辑和数学问题上。

一句话总结

这种方法不是仅仅向 AI 展示如何把事情做对,而是通过分析其过去的失败来教导它如何避免做错。它创建了一个混合指南,既提供广泛的智慧(用于一般安全),又提供具体的提示(用于即时问题),帮助 AI 更像人类一样从自己的错误中学习并进行推理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →