← 最新论文
💬 NLP

Many-Shot CoT-ICL: Making In-Context Learning Truly Learn

本文揭示,多示例思维链上下文学习表现为上下文测试时学习而非简单的模式匹配,表明标准缩放规律在推理任务中失效,并提出曲线演示选择(CDS)以优化演示顺序从而获得显著的性能提升。

原作者: Tsz Ting Chung, Lemao Liu, Mo Yu, Dit-Yan Yeung

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Tsz Ting Chung, Lemao Liu, Mo Yu, Dit-Yan Yeung

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一位非常聪明但缺乏经验的学生如何解一道复杂的谜题。你有一本巨大的笔记本(即“长上下文窗口”),可以在其中写下数百个示例来帮助他们。

本文研究了当你用数百个示例填满那本笔记本时会发生什么,这些示例不仅包含问题和答案,还包含用于解决问题的逐步思考过程(称为“思维链”)。

以下是研究人员发现内容的简要分解:

1. 旧规则与新现实

旧规则(针对简单任务):
如果你教学生分拣邮件(一项简单任务),无论你展示 20 个示例还是 200 个示例,或者以随机顺序展示,都无关紧要。你提供的示例越多,他们表现越好,而且顺序其实并不重要。这就像把一堆红球扔进桶里;它们看起来都一样,所以顺序无关紧要。

新现实(针对推理任务):
当任务很困难时——比如解决几何证明或侦探谜案——旧规则就会失效。

  • 更多并不总是更好: 如果你只是将数百个推理示例随意堆入标准 AI 模型的笔记本中,它往往会变得困惑,表现反而更差。
  • 顺序至关重要: 与分拣邮件不同,呈现这些复杂推理步骤的顺序是至关重要的。如果你从简单概念过快跳跃到超级难的概念,学生会迷失方向。

2. 为什么“相似”的示例会失败

通常,当我们想帮助学生时,我们会寻找与当前问题相似的示例。

  • 陷阱: 该论文发现,对于推理任务,挑选那些看起来相似的示例(例如,两个都是关于三角形的数学题)实际上是个坏主意。
  • 类比: 想象你在教某人如何烤蛋糕。你给他们看巧克力蛋糕的食谱,然后让他们烤海绵蛋糕。它们看起来相似(都是蛋糕),但过程(步骤)是不同的。如果学生试图将巧克力蛋糕的步骤照搬到海绵蛋糕上,他们就会失败。
  • 发现: 对于推理而言,“步骤”(过程)比“主题”(表面相似性)更重要。两个问题可能看起来相似,但需要完全不同的思维路径。如果 AI 试图复制错误的路径,它就会失败。

3. “课程”方法

作者意识到,为了让 AI 真正从长长的示例列表中“学习”,该列表必须像学校课程一样运作,而不仅仅是一堆书籍。

  • 原则一:可理解性。 示例必须以一种特定的 AI 能够理解的方式编写。如果 AI 比较“弱”,向其展示由“天才”AI 编写的示例可能会过于令人困惑。它最擅长从与其当前思维水平相匹配的示例中学习。
  • 原则二:平滑过渡。 示例的排列顺序需要让概念从一个到另一个平稳流动。你不能在没有中间步骤的情况下从“加法”跳跃到“微积分”。

4. 解决方案:“曲线演示选择”(CDS)

为了解决排序问题,研究人员发明了一种称为CDS的方法。

  • 隐喻: 想象示例是地图上的点。如果你以随机顺序连接它们,你可能不得不做出尖锐、令人眩晕的转弯(高“曲率”)。如果你将它们排列成路径平滑且温和(低“曲率”),学生就能轻松走过这条路径。
  • 结果: 通过排列数百个示例,使“思维路径”平滑且渐进,与随机排序相比,他们在几何问题上的 AI 性能提高了约5.4%

总结

该论文认为,向 AI 提供数百个推理示例不仅仅是关于“更多数据”。关键在于如何呈现这些数据。

  • 不要仅仅抓取看起来相似的示例。
  • 像平滑的课程计划那样排列它们,从简单概念到更难概念平稳过渡。
  • 确保示例是用特定的 AI 实际上能够理解的语言编写的。

通过将长长的示例列表视为结构化课程而非检索缓冲区,AI 实际上可以在实时中“学习”推理过程,而不仅仅是基于模式进行猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →