← 最新论文
💬 NLP

Activation-Based Active Learning for In-Context Learning: Challenges and Insights

本文研究了利用 MLP 激活信号在大型语言模型中进行上下文示例选择的潜力,但结论认为由于缺乏与任务性能的相关性,此类方法是无效的,并建议未来的研究应探索如稀疏自编码器(Sparse Autoencoders)之类的技术,以解决底层的叠加(superposition)问题。

原作者: Yaseen M. Osman, Geoff V. Merrett, Stuart E. Middleton

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaseen M. Osman, Geoff V. Merrett, Stuart E. Middleton

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明但完全是新手的学生(一个大语言模型)如何解决一种特定类型的谜题。你没有给他们一本厚厚的教科书去研读,而是在考试前给了他们几个例子。这被称为上下文学习(In-Context Learning)

研究人员一直在思考一个核心问题:我们应该挑选哪些例子? 如果我们挑选了“最好”的例子,学生就能取得更好的成绩。如果我们选错了,他们可能会感到困惑。

核心理念:倾听学生的“脑电波”

这篇论文的作者提出了一个聪明的假设。他们认为:“也许我们可以观察学生在看一个例子时的脑部活动,以此来判断它是否是一个好的例子。”

在计算机术语中,这些“脑电波”被称为激活值(activations)。当模型处理一个例子时,其内部机制的某些部分(特别是被称为 MLP 层,即模型的“记忆库”)会亮起来。研究人员想要测量这些灯光闪烁的亮度。他们认为:

  • 更亮的灯光 = 一个更重要、更高质量的例子。
  • 更暗的灯光 = 一个无聊、没用的例子。

他们尝试利用这些“脑电波读数”来自动为学生挑选最好的例子。他们甚至尝试了让学生接触例子的不同方式(比如是让其一次阅读整页内容,还是逐行阅读),以观察这是否会改变脑电波的模式。

实验:测试理论

团队进行了一场大规模实验。他们使用了两个流行的 AI 模型(Llama 和 Qwen),并在四种不同类型的任务上进行了测试:

  1. 是非题 (BoolQ)
  2. 多选题科学题 (ARC-Challenge, OpenBookQA)
  3. 数学应用题 (GSM8K)

对于每项任务,他们都提取了 1,000 个潜在的例子。他们使用不同的数学工具(例如检查平均亮度、分布范围或最大的单次闪烁强度)来测量每个例子的“脑电波”(激活值)。然后,他们实际测试了模型,以观察模型的表现如何。

最后,他们将脑电波得分实际测试得分进行了对比。他们试图寻找一种强关联:那些脑电波最亮的例子,是否真的能帮助模型取得更好的成绩?

结果:一个“负面”发现

这里是结论:行不通。

研究人员发现,脑电波模式与模型的表现之间几乎没有任何联系

  • 相关性极其微弱(充其量只有 0.33/1.0 的得分,这仅仅是一丝若有若无的关系)。
  • 有时,那些脑电波最“亮”的例子,反而比随机挑选的例子让模型的表现更差。
  • 即使他们尝试了不同的掩码方式(通过隐藏部分文本来改变模型的阅读方式),结果也是一样的:脑电波并不能预测成功。

为什么失败了?“叠加(Superposition)”类比

作者提出了一个理论来解释为什么会发生这种情况,他们使用了**叠加(Superposition)**的概念。

想象一个拥挤的房间,每个人都在同时说话。在一个正常的房间里,如果你想听某个人说话,你只需要听他的声音。但在这个 AI 模型的“房间”(其内部维度)里,发生的对话比可以听到的听众还要多。

为了将所有这些对话塞进有限的空间里,模型将它们混合在了一起。单个“大脑中的光”并不只是关于某个特定的事实,它是一个由许多不同事实和想法组成的复杂且纠缠在一起的混合体。由于信号如此混乱且交织在一起,仅仅观察这些“光”的原始亮度并不能告诉你某个特定的例子是好是坏。这就像试图仅通过观察整杯饮料的颜色来判断某种特定食材的品质一样;颜色太融合了,以至于无法分辨出里面到底是什么。

总结

论文得出结论:你不能使用原始的脑电波测量值(MLP 激活值)来挑选 AI 的优质例子。 对于这种特定的方法来说,这是一个死胡同。

然而,作者提出了一个前进的方向。既然信号如此混乱,我们可能需要一个特殊的工具先将它们“解混”。他们建议使用一种叫做**稀疏自编码器(Sparse Autoencoders, SAEs)**的工具,它就像一个精密的过滤器,可以将房间里纠缠在一起的对话分离出来,这样我们才能真正听到每一个独立的个体声音。在拥有这种过滤器之前,我们不应该依赖这些激活信号来选择我们的例子。

简而言之: 利用 AI 内部的“光芒”来挑选例子的想法是一个伟大的理论,但实验表明,由于 AI 的内部信号过于混乱,直接解读它们在实践中是行不通的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →