← 最新论文
🤖 machine learning

Can In-Context Learning Support Intrinsic Curiosity?

本文研究了上下文学习是否可以取代用于内在好奇心驱动数据选择的高昂梯度更新,并证明了尽管在一般的马尔可夫决策过程中无法实现无偏的学习进度估计,但在主动学习和贝叶斯实验设计等非时序场景中,这种估计是可行且有效的。

原作者: Eric Elmoznino, Sangnie Bhardwaj, Johannes von Oswald, Rajai Nasser, Blaise Agüera y Arcas, João Sacramento, Rif A. Saurous, Guillaume Lajoie

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Eric Elmoznino, Sangnie Bhardwaj, Johannes von Oswald, Rajai Nasser, Blaise Agüera y Arcas, João Sacramento, Rif A. Saurous, Guillaume Lajoie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名侦探,正在试图破解一个从未见过的房间里的谜团。你有一个笔记本(你的“世界模型”),你在上面记录下你认为正在发生的事情。为了更好地破解谜团,你需要决定下一步该看哪里

你应该盯着一个随机闪烁的灯泡,还是去检查一个可能藏有线索的锁着的盒子?

这篇论文探讨的是:能否让一个超级聪明的 AI 学会变得好奇,并挑选出正确的观察对象,而不需要不断地重写自己的大脑?

以下是利用简单的类比对他们发现进行的拆解。

1. 旧方法:“重写大脑”问题

传统上,为了教会 AI 变得好奇,研究人员使用了一种叫做“学习进度”(Learning Progress)的方法。

  • 核心思想: AI 观察某样东西,更新它的脑子(重写它的笔记本),然后检查:“在我观察它之后,我对它的理解是否变好了?”如果是,它会获得一个“好奇心奖励”。
  • 问题所在: 为了做到这一点,AI 必须停下来,在自己的脑海中运行复杂的数学模拟来更新大脑,然后再检查结果。这就像你试图学习一门新语言,却在说每一句话之前都要停下来重写一遍整本词典。对于大型 AI 模型来说,这太慢、太昂贵的。

2. 新工具:“上下文学习”(即时先知)

作者使用了一种特殊的 AI 类型(类似于现代聊天机器人背后的技术),它具有**上下文学习(In-Context Learning, ICL)**能力。

  • 类比: 想象一位读遍了图书馆所有书籍的天才。你不需要教他任何新知识。相反,你只需要递给他几页故事(“上下文”),他就能立刻知道接下来的剧情。他不需要重写大脑;他只需利用你给他的故事来进行预测。
  • 目标: 我们能否利用这个“即时天才”来告诉我们的智能体(Agent)该看什么,而不需要智能体停下来重写大脑?

3. 重大发现:这取决于房间

论文证明了这种“即时天才”的技巧在某些情况下有效,但在另一些情况下会失效。

❌ 陷阱:“嘈杂的电视机”(通用环境)

在一个混乱、复杂的世界里(比如一个通用的视频游戏),即时天才会被欺骗。

  • 类比: 想象房间里有一台播放着静电噪音的电视机。一个简单的好奇心系统会说:“哇,那台电视真不可预测!我通过盯着它获得了巨大的奖励!”
  • 结果: AI 会永远坐在静电噪音前,学不到任何有用的东西。论文证明,在这些混乱的世界中,你无法轻易地通过“即时天才”来让它忽略噪音并专注于真正的线索。如果不进行昂贵的大脑更新,数学逻辑就无法成立。

✅ 成功:“受控实验室”(贝叶斯实验设计)

然而,在一种特定的实验环境下(比如你正在进行一系列实验,如测试不同的药物或破解密码),这个技巧运作得非常完美。

  • 类比: 想象你在一个实验室里,你丢下一个球,观察它的落点。这里的“噪音”(风、颠簸)与“线索”(重力)是分离的。
  • 结果: 作者创建了一种衡量好奇心的新方法(称为 rsumr_{sum}),它使用了这个“即时天才”。
    • 它会问:“如果我没有看到这个特定的线索,我对实验剩余部分的预测会变差多少?”
    • 如果答案是“很多”,AI 就知道它找到了一个关键线索。
    • 如果答案是“没多少”,那它只是噪音。

4. 实验:测试理论

团队在三个不同的“房间”中测试了这一点:

  1. 制图师(高斯过程): 尝试绘制一张平滑的崎岖地形图。
    • 结果: 旧方法(盯着噪音看)惨败。新方法(rsumr_{sum})成功地忽略了那些崎岖、多噪的部分,专注于平滑且重要的部分。
  2. 破译者(摩斯密码/猜颜色游戏): 试图猜出一个秘密的颜色代码。
    • 结果: 当他们加入“邪恶”的随机噪音时,旧方法变得混乱并开始随机玩耍。新方法则保持了完美的破译能力。
  3. 炼金术士(炼金术): 试图弄清楚哪些药水能把石头变成其他石头。
    • 结果: 同样,新方法忽略了虚假的、随机的反应,并学会了真实的规则。

核心结论

论文声称,上下文学习可以支持“内在好奇心”,但前提是你处于一个受控的实验设置中。

  • 它的作用: 它允许 AI 在无需每秒都停下来重新训练大脑的情况下,搞清楚哪些数据是有价值的收集对象。
  • 它避免了什么: 它避免了 AI 被随机混沌所分心的“嘈杂电视机”问题。
  • 局限性: 它最适合于 AI 正在运行一系列独立的实验(就像实验室里的科学家),而不一定适用于在混乱、连续的世界中航行的场景(比如视频游戏或自动驾驶汽车,至少目前还不是这样)。

简而言之:他们找到了一种利用“预读”技巧来激发 AI 好奇心的方法,但目前这是一种属于实验室科学家的超能力,而非荒野探险家的技能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →