← 最新论文
🤖 machine learning

Interestingness as an Inductive Heuristic for Future Compression Progress

本文将“趣味性”形式化为一种面向未来压缩进展的归纳启发式方法,通过理论分析与实证实验证明,过去的突破性进展呈指数级地预测未来的发现,且算法先验相较于长度先验提供了显著更为乐观的预测。

原作者: Vincent Herrmann, Jürgen Schmidhuber

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Vincent Herrmann, Jürgen Schmidhuber

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《将“趣味性”作为未来压缩进展的归纳启发式》的解释,使用通俗易懂的类比语言翻译而成。

核心难题:如何实现永不停歇的学习

想象你有一个机器人,它的任务是永远学习,在没有人类教师的情况下自主变得越来越聪明。这被称为“开放式智能”。

这个机器人有两项工作:

  1. 学习:它研究数据以寻找规律(就像学生阅读教科书)。
  2. 生成:它创造新的问题或数据以供下一步研究(就像老师制作新的测验)。

困难的部分在于生成阶段。如果机器人只是制造随机噪音,它就学不到任何东西。如果它制造的是它已经知道的东西,它就会感到无聊。它需要一种方法来挑选完美的新谜题:既不太容易(无聊),也不太困难(不可能),而是恰到好处,能教会它新东西。

这篇论文提出了一个问题:机器人在尝试解决新谜题之前,如何知道哪个新谜题是“有趣”的?

核心理念:“趣味性”是一个水晶球

作者认为,“趣味性”并不是指某样东西看起来有多酷。它是一种预测工具。它是一种猜测的方式:“如果我花时间研究这个,稍后我会有‘顿悟’的时刻吗?”

他们称之为压缩进展

  • 压缩就像把长篇故事总结成简短的一句话。如果你能用一个简单的规则概括大量数据,你就已经“压缩”了它。
  • 进展发生在你发现一个新规则,使你的总结变得更短的时候。

这篇论文建议,一个好的“趣味性”检测器应该查看机器人的历史,并问自己:“基于我们迄今为止的学习方式,我们很快找到新捷径的可能性大吗?”

实验:“停滞”计量器

为了验证这一点,作者将机器人学习的历史视为一张图表。想象一个徒步者正在下山(这座山代表数据的难度)。

  • 每当徒步者发现一条更短的新路径下山时,这就是图表中的一个“突破”或“下降”。
  • 停滞长度:这是徒步者自上次发现捷径以来走过的距离。

主要发现:
这篇论文从数学上证明了时间比规模更重要

  • 如果机器人昨天找到了一个突破,那么它今天再找到一个突破的可能性很高。
  • 如果机器人很长时间没有发现突破,那么很快找到突破的概率会像悬崖一样急剧下降。

这就像钓鱼。如果你刚刚钓到了一条大鱼,那里的水里很可能还有很多鱼,所以你应该继续在那个地方抛竿。如果你已经在同一个地方抛竿三个小时却没有咬钩,那么现在钓到鱼的几率几乎为零。你应该换个新地方。

三个“世界”(先验)

作者在三个不同的“宇宙”(数据生成方式的数学模型)中测试了这个想法,看看这个规则是否成立。

  1. “随机打字”世界(长度先验):想象一只猴子在键盘上打字。短字符串比长字符串更常见。在这个世界里,如果你很久没有发现捷径,那么很快发现捷径的可能性非常小。
  2. “简单程序”世界(算法先验):想象宇宙是由最简单的计算机程序生成的。这是最“乐观”的世界。在这里,即使你卡住了一段时间,仍然有相当大的机会迎来重大突破,但它仍然更有可能在上次突破之后很快发生。
  3. “快速执行”世界(速度先验):这个世界讨厌缓慢的程序。如果存在捷径,它早就被发现了。在这个世界里,如果你没有找到捷径,你可能永远也找不到。这是最悲观的观点。

结果:在所有三个世界中,规则都成立:最近的突破是下一次突破的最佳预测指标。 你等待胜利的时间越长,胜利即将到来的可能性就越小。

“乐观”与“悲观”的机器人

这篇论文在“简单程序”世界(算法先验)中发现了一个令人惊讶的现象。它比“随机打字”世界乐观得多。

  • 在“随机”世界中,如果你卡住了,你可能永远都会卡住。
  • 在“简单程序”世界中,如果你卡住了,你可能只是在等待下一个重大发现,而且潜在的回报是巨大的(呈二次方增长)。

这表明,如果我们的 AI 假设世界是由简单、可发现的规律组成的,那么即使已经过了一段时间,它也应该继续尝试从最近教会它新东西的事物中学习。

现实世界的测试

作者不仅做了数学推导,还使用三种不同类型的“计算机”(2-Tag 系统、Rule 110 元胞自动机和 Brainfuck 代码)进行了实际的计算机模拟。

  • 他们生成了数百万个程序,并观察它们如何“学习”(压缩数据)。
  • 结果:现实世界的数据与数学预测完美吻合。“停滞长度”(自上次胜利以来的时间)是判断新胜利是否即将到来的最强信号。

结论

为了让一个机器人在没有人类老板的情况下永远学习,它需要一条简单的规则来选择下一步学习什么:
“专注于最近教会你新东西的事物。”

如果一项任务已经无聊了很长时间,就停止浪费时间在它上面。如果它刚刚给了你新的见解,就坚持下去,因为下一个重大突破很可能就在拐角处。这种“趣味性的归纳属性”是让自我改进系统不断前进的指南针。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →