← 最新论文
🔬 condensed matter

Learning Pseudorandom Numbers with Transformers: Permuted Congruential Generators, Curricula, and Interpretability

本文表明,通过课程学习和发现位旋转不变表示,Transformer 模型能够成功学习并预测来自复杂置换同余生成器(PCG)的序列,并揭示了一种所需上下文长度随模数平方根增长的缩放法则。

原作者: Tao Tao, Maissam Barkeshli

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Tao Tao, Maissam Barkeshli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人预测魔术中的下一个数字。你向它展示一个序列,比如 3, 7, 15, 31,然后它必须猜出下一个数字是什么。在现实世界中,计算机使用被称为“伪随机数生成器”(PRNG)的特殊配方来创建看起来完全随机的数字,比如一副扑克牌的洗牌过程,或是旧电视上的雪花噪声。但对计算机而言,这些数字绝非随机,而是遵循着严格且隐藏的数学规则。如果你知道这个规则和起始数字,你就能完美预测整个序列的未来。

长期以来,科学家们一直在思考:现代人工智能,特别是被称为“Transformer”的一种模型类型(也就是许多聊天机器人和图像生成器背后的那种“大脑”),能否仅仅通过观察示例就推导出这些隐藏的规则?这就像是在问,一名学生能否仅通过观察几次别人开锁的过程,就在不被告知锁是如何运作的情况下,破解出锁的秘密代码。这意义重大,因为这些数字生成器是计算机安全的基石。如果 AI 能如此轻易地破解它们,可能意味着我们的数字锁并不像我们想象得那样安全。但如果 AI 无法 破解它们,则说明了这些模型是如何学习模式的,以及它们的局限性在哪里,这具有深刻的启示意义。

论文的故事:带有转折的破解密码

在这篇论文中,作者为 Transformer 设置了一个挑战,使用的是一类特定的、难度极高的数字生成器,称为“置换线性同余生成器”(PCG)。把标准的数字生成器想象成一个简单的机器,它通过加法和乘法来获取下一个数字。而 PCG 是同一个机器,但它带有一个转折:在向你展示结果之前,它会利用一系列位移、翻转和旋转操作来打乱比特位(构成数字的微小 0 和 1)。这就像是把一条秘密信息写下来,然后通过移动字母使其看起来像乱码,尽管原始信息本身是非常逻辑严密的。

研究人员发现,Transformer 的表现出奇地好。即使计算机只能看到输出中极小的一块被扰乱的部分——有时甚至只是一个比特(例如一个简单的“是”或“否”)——该模型仍然能以很高的准确度预测下一个数字。这仿佛机器人在观察一张被扰乱图像中的单个像素,却不知为何能洞察整幅图像的模样。模型学会了这样做,而无需被告知规则;它们只是通过提供的示例推导出了模式。

然而,这里有一个陷阱。谜题越难,机器人需要的帮助就越多。作者发现了一个“缩放法则”:随着数字变得越来越大(具体来说,随着模数,即数字池的大小增长),模型需要看到更多连续的示例才能解开谜题。如果数字较小,模型需要看到大约 128 个示例。如果数字非常巨大(例如 2222^{22}),模型则需要看到大约 m\sqrt{m} 个示例,这意味着上下文长度必须显著增加。这就像是在玩拼图:如果碎片很小,你就需要手里握住更多的碎片才能看清全貌。

最令人兴奋的发现是关于模型如何学习的。当研究人员尝试直接在最难、最大的谜题上训练模型时,模型卡住了。模型盯着数据看了很久,几乎没有任何进展,就像一个学生盯着自己无法理解的数学题发呆。但当他们使用“课程学习”(一种教学策略,即从简单的、小的谜题开始,然后逐渐引入更难的谜题)时,模型突然掌握了。这就像是模型需要先学会走路才能奔跑。通过从小规模开始,模型学习了数字生成的底层“语法”,然后它就能将这些知识应用到庞大且复杂的谜题中。

作者还窥探了模型的“大脑”(其内部数据表示),并发现了令人着迷的现象。模型不仅仅是在死记硬背数字,它还根据二进制结构对数字进行了组织。它将具有相似 0 和 1 模式的数字归为一类,即便这些数字在表面上看起来完全不同。这表明模型发现,用于生成器的“打乱”规则会将某些比特模式视为相同,并且它学会了尊重这些规则。这说明模型并非仅仅在猜测,它正在构建关于隐藏数学对称性的心理地图。

简而言之,这篇论文表明,Transformer 可以学习预测复杂的、经过打乱的数字序列,即使信息被大量削减。但它们需要正确的训练路径:从小处着手,循序渐进。虽然它们可以胜过一些传统的黑客方法,但在没有这种辅助性课程的情况下,面对过大的数字时仍会撞墙。这告诉我们,尽管 AI 在寻找隐藏模式方面变得越来越强,但它仍然依赖于一种结构化的学习方式,就像人类学生一样,去应对最困难的数学奥秘。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →