← 最新论文
💬 NLP

Routing Ceilings Are Domain-Independent: Structural Prior Injection in Code Security Vulnerability Detection

本文证明了此前在数学推理中观察到的“路由假设”以及结构先验(速记表)在显著提升分布内性能的同时会导致严重的分布外崩溃这一特定权衡关系,也同样适用于跨多个模型和复杂度层级的代码安全漏洞检测。

原作者: Manuel Israel Cázares

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Manuel Israel Cázares

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个聪明但有点过于死板的机器人如何发现故事中的错误。你给了它一串“线索”(比如“如果你看到一扇红色的门,那就是个陷阱”),它很快就变得非常擅长在练习过的特定故事中寻找陷阱。但当你交给它一个拥有不同类型陷阱的新故事时,会发生什么?有时,同样的线索清单会让机器人的表现比你直接告诉它“去寻找陷阱”并让它自行摸索还要糟糕。这就是研究人员试图解决的谜题,它存在于人工智能(AI)领域,特别是大型语言模型(LLM)领域。这些是能够写代码、解数学题以及与我们聊天的超级智能计算机程序。核心问题在于:它们是真的理解自己在做什么,还是仅仅在记忆模式并遵循一张仅适用于特定街区的地图?

这篇题为《路由天花板是领域无关的》(Routing Ceilings Are Domain-Independent)的论文深入探讨了这个问题,并测试了一个被称为“路由假设”(router hypothesis)的理论。把大语言模型(LLM)想象成一个繁忙的火车站,而不仅仅是一个单一的大脑。当一个问题进来时,模型必须决定将它发送到哪条“轨道”(或模式)上以获得答案。“路由假设”表明,模型通常不是每次都从头开始思考问题,而是直接抓取一份缓存好的地图(预先学到的模式)并盲目跟随。研究人员想看看这种行为是否出现在计算机安全领域,因为在代码中发现漏洞至关重要。他们测试了给 AI 一份“小抄”是否有助于它在虚构的练习代码中发现安全漏洞,以及当他们尝试将同样的“小抄”用于真实的、杂乱的现实世界代码时会发生什么。

实验:小抄陷阱

研究人员设置了一个游戏,使用了三种不同的 AI 模型(GPT-OSS-120B、Llama-3.3-70B 和 Gemma-4-31B),并要求它们寻找计算机代码中的三种安全漏洞。这些漏洞从简单的(如直接在文本中写明密码)到复杂的(如导致数据库变慢的隐蔽循环)不等。

首先,他们在没有任何帮助的情况下测试了这些模型。这被称为“零样本”(zero-shot)测试。模型在处理简单漏洞时表现尚可,但在处理复杂漏洞时却显得力不从心。例如,一个模型在没有帮助的情况下只能发现 20% 的复杂“N+1”类漏洞。

接着,研究人员给了模型一份“小抄”。这并不是一根魔杖;它是一个结构化的规则和模式列表,准确地告诉 AI 要寻找什么。结果呢?简直像魔法一样。在练习(合成)代码上,这份小抄让模型的表现几近完美。一个模型从发现 20% 的复杂漏洞跃升到了 100%。小抄似乎彻底解决了问题。

转折:当小抄失效时

故事在这里发生了急转弯。研究人员随后将这些模型(依然拿着那份完美的小抄)交给它们,要求它们在“真实世界”的代码(来自实际报告的安全漏洞)中寻找漏洞。

结果是一场灾难。小抄不仅不再提供帮助,反而对模型产生了负面影响。

  • 对于 GPT-OSS-120B 模型,小抄导致其性能从练习代码上的 100% 完美表现,暴跌至真实代码上的 48.9%。
  • 事实上,在真实代码面前,持有小抄的模型表现甚至比完全没有小抄的模型还要差。那个“有帮助”的指南误导了它们走上了错误的道路,因为现实世界并不完全像练习世界那样。

研究人员尝试通过制作“第二版”小抄来修复这个问题。他们观察了模型在真实代码上犯下的错误,并更新了规则以避免这些特定的错误。你可能会认为这会有所帮助,但结果却让情况变得更糟了。这个更复杂的新版小抄让性能进一步下降到了 41.7%。这就像试图通过增加指令来修理一个坏掉的指南针;你越是试图强迫模型遵循特定的路径,当地形改变时,它就迷失得越深。

这意味着什么

论文指出,AI 并不是以一种深度、灵活的方式在“学习”如何寻找漏洞。相反,它的行为就像一个背下了特定练习题答案表的学生。当考试看起来与练习题一模一样时,这个学生能拿 A。但当考试稍有变化时,学生就会不及格,因为他们只是在遵循地图,而不是理解领地。

研究人员认为,试图通过编写更好的小抄或更好的提示词(prompts)来修复这个问题是一个死胡同。问题是结构性的:AI 依赖于在数据变化时失效的捷径。他们建议,真正的解决方案是在一开始就用虚构数据和真实数据的混合体来训练 AI,这样它才能学会如何驾驭现实世界,而不是仅仅记忆一张针对虚构世界的地图。

简而言之,这篇论文警告我们,在计算机安全这个高风险领域,练习测试上的“完美”得分可能是一个陷阱。如果我们过度依赖这些巧妙的提示词和小抄,我们可能正在构建出那些在实验室里看起来很棒,但在面对混乱的互联网现实时却会无声失效的安全工具。AI 不是在思考,它是在进行“路由”;如果路由错了,目的地也将是一场灾难。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →