Certification from Examples is Hard for Circuits and Transformers under Minimal Overparametrization
本文证明,即使在阈值电路和 log 精度 Transformer 中引入最小程度的过参数化,也会使精确和近似认证变得指数级困难,这一理论障碍已通过检测执行二进制加法任务的训练模型中错误时所遇到的困难得到了实证验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一位老师,试图验证一名学生是否真正掌握了一条特定的数学规则,例如“如何相加两个数字”。你拥有一份示例列表(输入 - 输出对),并希望百分之百确定该学生并非仅仅在猜测或遵循某种技巧。
本文提出了一个根本性问题:你需要向学生展示多少示例,才能证明他们掌握的是确切的规则,而不仅仅是一个非常相似的规则?
作者 Artur Back de Luca 和 Kimon Fountoulakis 发现了一个令人惊讶且略显可怕的真相:即使对学生“大脑”(即模型)进行微小到几乎不可见的改动,也可能导致无论展示多少示例,都无法证明其正确性。
以下是他们研究发现的分解,辅以简单的类比:
1. “冒牌货”问题
想象你拥有一位完美掌握加法规则的学生。你想要证明他是唯一掌握该规则的人。
- 简单场景:如果房间里只有这一名学生,你可能只需要向他展示 5 到 10 个示例,就能证明他掌握了规则。
- 困难场景:现在,想象你邀请了 1,000 名“冒牌货”进入房间。这些冒牌货几乎完美,他们在 99.9% 的情况下都能给出正确答案。他们出错的唯一情况,是在一组非常具体、隐蔽的数字上(例如以数字"7"开头的数字)。
论文表明,如果你向模型中仅添加一个额外的“神经元”(即微量的额外算力),就能创造出数百万个这样的冒牌货。每个冒牌货在几乎所有事情上都与完美学生一致,但他们各自在一组不同的、微小的、隐蔽的数字集合上存在分歧。
2. “大海捞针”类比
为了证明该学生是真正的,而非冒牌货,你必须找到他们产生分歧的具体数字。
- 如果你有 1,000 名冒牌货,且每个人都将自己的错误隐藏在数字宇宙中不同的微小角落,那么为了确信无疑,你必须检查每一个角落。
- 论文证明,如果你向电路中仅添加一个额外的“门”(或向 Transformer 人工智能模型中添加一个额外的“注意力头”),这些隐藏角落的数量就会呈爆炸式增长。
- 结果:为了揪出所有冒牌货,你可能需要检查数十亿个示例。如果你只检查几千个(即“多项式”数量)示例,你很可能会漏掉冒牌货,导致该学生通过了你的测试,尽管他们实际上并不正确。
3. 两位主要角色
作者在两种类型的“学生”身上测试了这一理论:
- 电路:将其想象为简单、僵化的逻辑机器(如计算器)。他们发现,向深度为 2 或更高的电路中添加仅一个额外开关,就会使验证答案的难度呈指数级增加。
- Transformer:这些是支撑聊天机器人等工具的强大人工智能模型。作者表明,仅向模型添加一个额外的注意力头(微小的架构调整)以及模型内存中的几个额外数值,就会使得用合理数量的示例进行验证变得不可能。
4. “近乎完美”的陷阱
你可能会想:“好吧,但如果我们只是接受学生犯少量错误呢?如果我们说‘如果他们正确率达到 99%,那就足够了’?”
论文回答:请小心。
- 绝对错误:如果你说“你总共只能犯 10 个错误”,冒牌货依然会隐藏。你仍然需要数十亿个示例来找出这 10 个错误,因为它们散布在数十亿种可能性中。
- 相对错误:如果你说“你可以犯 1% 的错误”,冒牌货就可以隐藏数百万个错误,只要这 1% 足够小即可。模型在绝对意义上可能错得离谱,但仍能通过你的"99% 准确率”测试。
5. 现实世界实验
为了证明这不仅仅是数学理论,他们实际构建了这些模型:
- 电路实验:他们构建了一个用于相加数字的电路,随后创建了数千个“损坏”版本,这些版本仅在特定输入上失效。他们表明,即使拥有大量测试示例,许多这些损坏的电路看起来依然完美无缺。
- Transformer 实验:他们训练人工智能模型进行数字相加。即使训练这些模型直到它们通过严格的验证测试(正确率达到 99.9%),他们发现某些模型仍存在隐藏错误。当他们尝试用随机示例对这些模型进行“审计”时,这些模型即便实际上并不完美,却仍不断通过测试。
核心结论
论文得出结论:认证极其脆弱。
如果你想要保证人工智能或电路确实按照你的设想运作,你就不能依赖平均性能。如果模型拥有哪怕一点点“额外容量”(过参数化),它就能隐藏指数级数量的出错方式。
若要真正确信,你可能需要在数量大到实际上无法执行的示例上测试模型。这就像试图通过观看魔术师表演几次来证明他没有作弊;如果他的袖子里藏着一张秘密的额外牌,除非你检查牌堆里的每一张牌,否则你可能永远无法发现它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。