← 最新论文
💬 NLP

Weights to Code: Extracting Interpretable Algorithms from the Discrete Transformer

本文提出了“离散 Transformer"架构,通过引入温度退火采样机制解决 Transformer 中表征纠缠问题,从而能够从模型权重中直接提取可解释的符号算法,实现了无需人类代码演示的算法发现与模型可解释性提升。

原作者: Yifan Zhang, Wei Bi, Kechi Zhang, Dongming Jin, Jie Fu, Zhi Jin

发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifan Zhang, Wei Bi, Kechi Zhang, Dongming Jin, Jie Fu, Zhi Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为**“离散 Transformer"(Discrete Transformer)的新方法。简单来说,它的目标是从黑盒般的神经网络中,直接“榨”出人类能读懂的、像教科书一样的数学公式或代码**。

为了让你更容易理解,我们可以用几个生动的比喻来拆解这项技术:

1. 核心问题:为什么以前的 AI 很难被“读懂”?

想象一下,传统的 Transformer(现在的很多大模型)就像一个超级复杂的“混沌大锅”

  • 现象:在这个锅里,所有的信息(比如数字、逻辑)都被搅拌在一起,混成了连续的、模糊的“汤”。
  • 问题:虽然这锅汤能做出美味的菜(解决复杂问题),但如果你问厨师(AI):“你是怎么把盐放得这么准的?”厨师会指着那锅混在一起的汤说:“就是在那儿,但我说不清哪一滴是盐,哪一滴是糖。”
  • 学术术语:这叫“特征纠缠”(Representation Entanglement)。所有的逻辑都混在一起,导致我们无法从中提取出清晰的“如果...就..."这样的规则。

2. 解决方案:给 AI 戴上“分格餐盘”

这篇论文提出的“离散 Transformer",就像给这个混沌大锅换了一个带有严格隔板的“分格餐盘”

  • 强制分工
    • 格子 A(数值注意力机制):只负责**“搬运”**。比如,“把上一秒的数据拿过来”、“把第 3 个数据移到第 5 个位置”。它不计算,只负责指路。
    • 格子 B(数值多层感知机):只负责**“计算”**。比如,“做加法”、“做乘法”、“取最大值”。它不负责搬运,只负责在原地算数。
  • 效果:因为格子被物理隔开了,逻辑变得非常清晰。搬运的归搬运,计算的归计算,不再是一锅乱炖。

3. 关键魔法:从“模糊”到“清晰”的降温过程

为了让这个分格餐盘真正发挥作用,作者使用了一个叫**“温度退火”(Temperature Annealing)**的技巧。

  • 比喻:想象你在玩一个**“橡皮泥捏模型”**的游戏。
    • 高温(开始训练):橡皮泥很软,你可以随意拉伸、混合。这时候 AI 在“探索”各种可能性,虽然模糊,但很灵活。
    • 降温(训练后期):慢慢降低温度,橡皮泥开始变硬、定型。
    • 低温(训练结束):橡皮泥完全硬化,变成了坚硬的积木。
  • 结果:在这个过程中,AI 被迫把那些模糊的、连续的“软逻辑”,强行变成了清晰的、离散的“硬逻辑”(比如:要么选这个,要么选那个,没有中间状态)。一旦变硬,我们就能清楚地看到它的结构了。

4. 提取代码:像侦探一样“逆向工程”

当 AI 训练完成并“变硬”后,作者们就派出了两个**“侦探”**来提取代码:

  1. 侦探 A(负责搬运的格子)

    • 它不看复杂的数学,只看**“指向哪里”**。
    • 它会发现:“哦,原来这个头总是指向‘前一个位置’",或者“总是指向‘窗口里的最大值’"。
    • 产出:像 prev = cur[-1] 这样的简单指令。
  2. 侦探 B(负责计算的格子)

    • 它把搬运来的数字收集起来,用**“符号回归”**(一种自动找公式的技术)去猜公式。
    • 它会发现:“原来这两个数加起来,再减去它们的乘积,就等于结果”。
    • 产出:像 y = x + x_prev - 2*x*x_prev 这样的数学公式。

最后,把这两个侦探的线索拼起来,就得到了一段人类能读懂的 Python 代码

5. 这项技术的厉害之处

  • 不仅懂整数,还懂小数:以前的方法(如 MIPS)只能处理整数(比如 1, 2, 3),一旦遇到物理世界中的小数(比如重力加速度、温度变化),它们就抓瞎了。而这个新模型天生就能处理连续的小数,所以能提取出物理公式(比如自由落体高度公式)。
  • 不仅是模仿,更是发现:它不需要人类教它写代码,而是自己从数据中“悟”出了算法。甚至能发现人类没想到的、但数学上等价的新公式。
  • 可控性:如果你不想让它用复杂的乘法,你可以强行把计算格子关掉,它就能学会用“搬运”的方式(比如直接找最大值)来解决问题。这就像你可以指挥 AI 换一种解题思路。

总结

这篇论文就像是在教 AI**“如何把复杂的思考过程,写成清晰的步骤说明书”**。

以前,AI 像个天才但沉默寡言的数学家,算得对但说不出过程;现在,通过“离散 Transformer",我们给这位数学家戴上了**“分格眼镜”,并让它“慢慢冷静下来”,最终它不仅能算出答案,还能把解题过程写成一段人类一看就懂的、优雅的代码**。这对于理解 AI 到底在想什么,以及让 AI 帮助科学家发现新定律,都有着巨大的意义。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →