← 最新论文
💻 computer science

A Distributional View for Visual Mechanistic Interpretability: KL-Minimal Soft-Constraint Principle

本文提出了一种面向视觉机械可解释性的分布视角,将任务表述为最小化KL散度的优化问题以解决现有范式中的统计偏差,并引入通过能量引导扩散后验采样实现的KL最小软约束原则,从而在可解释性与忠实性之间达成理论平衡。

原作者: Guancheng Zhou, Yisi Luo, Zhengfu He, Zhenyu Jin, Xuyang Ge, Wentao Shu, Deyu Meng, Xipeng Qiu

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Guancheng Zhou, Yisi Luo, Zhengfu He, Zhenyu Jin, Xuyang Ge, Wentao Shu, Deyu Meng, Xipeng Qiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一个超级智能的 AI,它能查看照片并理解其中的内容。但对我们而言,这个 AI 是一个“黑盒”。我们可以看到它处理的图片,也能看到它给出的最终答案,但内部数百万个微小的齿轮和开关(即神经元)却是个谜。我们想知道:这个特定的小开关到底在思考什么?

本文提出了一种窥探该黑盒的新方法,专门针对视觉模型。以下是使用简单类比进行的拆解。

问题所在:“糟糕的侦探”式方法

目前,研究人员试图通过两种主要方法来理解这些 AI 开关,但这两种方法都存在缺陷:

  1. “寻宝游戏”(数据集搜索):他们翻阅巨大的现有照片库,寻找那些能让开关发出最响亮“叮”声的照片。
    • 缺陷:这就像试图通过只查看图书馆中 100 张最棒的狗的照片来理解一个“狗”检测器。你可能会错过那些怪异、独特的狗,或者你找到的只是几张碰巧像狗的幸运图片,但这并非 AI 真正“思考”的内容。这种方法受限于图书馆中已有的内容。
  2. “梦境编织者”(优化):他们从一个空白、充满噪点的屏幕开始,通过数学方式调整像素,直到开关发出尽可能响亮的“叮”声。
    • 缺陷:这通常会产生“超刺激”——对 AI 而言在数学上完美的图像,但在人类看来却像外星噪点或奇怪的图案。这就像调频收音机直到你听到震耳欲聋的声音,但那声音只是纯粹的噪音,而非歌曲。AI 很满意,但人类无法理解。

新想法:“分布视角”

作者建议我们停止关注单张图像,转而思考分布(或可能性的“云”)。

想象 AI 对世界的理解是一团巨大的、模糊的“自然图像”云(真实猫、狗、树等的照片)。当 AI 内部的一个特定开关被激活时,它不仅仅是挑选一张照片,而是重塑整团云。它的意思是:“好吧,在这团所有可能图像的云中,我现在正专注于看起来像这个特定特征的部分。”

目标是找到一组新的图像云,满足:

  1. 忠实性:它确实能强烈激活该开关。
  2. 可解释性:它看起来仍然像一团自然的、现实世界的照片云,而不是外星噪点。

解决方案:“软约束”原则

作者引入了一项名为KL 最小化软约束的原则。

  • 旧方法(硬约束):想象俱乐部门口的保镖说:“如果你的分数不正好高于 90,你就被拒之门外。”这会突然切断云的底部。它创造了一个尖锐的边缘,图像在此处突然变得毫无意义。
  • 新方法(软约束):想象一位保镖说:“我们想要高分的人,但让我们温柔地将整个人群推向贵宾区,而不是把其他人踢出去。”这保持了人群(分布)的平滑与自然,只是略微向 AI 关心的特征方向偏移。

这种“软约束”确保了我们生成的图像仍然可被识别为真实照片(可解释),同时又能证明它们确实触发了 AI 的开关(忠实)。

工具:能量引导扩散(EnergyDPS)

为了实际生成这些图像,他们使用了一种名为EnergyDPS的工具。

扩散模型想象成一位大师级画家,他懂得如何从零开始绘制任何逼真的场景。通常,这位画家独自工作。

  • 创新之处:作者给画家提供了一根“磁性指南针”(能量函数)。这根指南针就是他们想要理解的 AI 开关。
  • 工作原理:当画家开始勾勒随机图像时,指南针会温柔地将笔触拉向那些能让 AI 开关感到满意的模式。
  • 结果:画家创作出一幅美丽、逼真的图像,其中自然地包含了 AI 正在寻找的特征,而无需通过奇怪的文本提示强行注入,也无需扫描数百万张现有照片。

为何这很重要

该论文在现代视觉模型(DINOv3)上测试了这种方法。他们发现:

  • 旧方法 往往生成的图像要么怪异得难以理解,要么实际上并不能代表 AI 的真实思维。
  • 他们的新方法 生成的图像人类可以轻松识别(例如“心形”或“翅膀图案”),且 AI 确认这些图像具有高度相关性。

简而言之:与其用僵硬的规则或混乱的搜索强迫 AI 向我们展示其底牌,他们温柔地引导一位生成艺术家,画出 AI 正在思考的内容,同时保持结果看起来像自然、现实世界的照片。这为我们提供了一个更清晰、更诚实的窗口,得以窥见 AI 的“大脑”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →