← 最新论文
🤖 AI

Certified Circuits: Stability Guarantees for Mechanistic Circuits

本文介绍了“认证电路”(Certified Circuits),这是一个通过使用随机数据子采样来增强机械解释性稳定性与可靠性的框架,旨在为所发现的神经电路在面对数据集扰动时保持不变性提供可证明的保证,从而在多种架构和任务中实现更紧凑且更准确的解释。

原作者: Alaa Anani, Tobias Lorenz, Bernt Schiele, Mario Fritz, Jonas Fischer

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Alaa Anani, Tobias Lorenz, Bernt Schiele, Mario Fritz, Jonas Fischer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图弄清楚一位才华横溢但神秘的厨师(神经网络)是如何烹饪一道特定的菜肴,比如“鳄鱼汤”。你想确切知道哪些食材和步骤是这道食谱中必不可少的。

问题所在:不稳定的食谱
过去,当科学家试图在计算机内部寻找这个“食谱”(称为电路)时,他们使用了一种非常脆弱的方法。这就像是问厨师:“是什么让这碗汤喝起来有鳄鱼味?”而你仅仅是给厨师看了一张鳄鱼在沙滩上的照片。

厨师可能会说:“啊!是牙齿鳞片!”但如果你给厨师看一张鳄鱼在沼泽里的照片,或者一张卡通画,厨师可能会突然改口说:“不,不!其实是泥泞的水和旁边坐着的!”

问题的核心在于,厨师(计算机)正在记忆针对那一张特定照片的线索(比如那只鸟或那团泥),而不是真正的“鳄鱼”概念。如果你稍微改变照片,科学家找到的“食谱”就会完全改变。这使得解释变得不可靠。

解决方案:认证电路
这篇论文介绍了一种被称为**认证电路(Certified Circuits)**的新方法。你可以把它想象成一种对食谱进行的“稳定性测试”。

他们不是只针对一张照片询问厨师,而是这样做:

  1. 洗牌(The Shuffle): 他们拿出一大叠鳄鱼照片,随机丢弃其中的几张,交换一些,或者增加一些新的照片。他们这样做数百次,创造出数千个略有不同的“照片堆栈”。
  2. 投票(The Vote): 对于每一个照片堆栈,他们都会问厨师:“这其中最重要的部分是什么?”
  3. 共识(The Consensus): 他们观察这些答案。
    • 如果厨师在 99% 的不同照片堆栈中都说“牙齿”,他们就会说:“认证通过!牙齿绝对是食谱的一部分。”
    • 如果厨师在 50% 的堆栈中说“鸟”,而在另外 50% 的堆栈中说“牙齿”,他们就会说:“弃权。” 他们拒绝将“鸟”纳入最终食谱,因为这太不稳定了。这可能只是一个巧合。

这实现了什么
通过只保留那些无论你如何打乱照片顺序,厨师都会认同的部分,研究人员得到了更好的结果:

  • 更精简、更纯净: 最终的食谱要短得多。他们剔除了所有的“噪声”(比如让原始方法感到困惑的鸟或泥巴)。
  • 更准确: 因为他们移除了那些令人困惑、不稳定的线索,所以食谱的效果更好。在论文中,这在处理棘手的、未见过的示例时,将准确率提高了高达 56%。
  • 适用性广: 如果食谱是基于“鳄鱼”的真实概念(牙齿、鳞片、吻部)构建的,那么无论你给厨师看的是真实的鳄鱼、卡通鳄鱼,还是沼泽里的鳄鱼,它都能奏效。这种“认证”后的食谱具有良好的泛化能力,因为它忽略了那些仅在原始照片中有效的脆弱线索。

底线
该论文声称,通过使用这种“投票”系统(他们称之为随机平滑/randomized smoothing),他们可以证明他们所发现的“电路”(计算机执行工作的部分)是稳定的。

他们不仅仅是在猜测;他们可以在数学上保证,如果输入数据在一定限度内发生轻微变化,他们找到的核心食谱不会改变。这把“食谱”从一个脆弱的猜测变成了一个关于计算机实际思维方式的、稳固且值得信赖的解释。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →