← 最新论文
💻 computer science

Beyond F1: A Study of LLM Reliability in Smart Contract Vulnerability Detection

本研究评估了 14 个大型语言模型在智能合约漏洞检测方面的表现,结果表明,模型选择比提示策略或增加推理时计算更为关键,因为规模较大的前沿模型展现出更优越的可靠性,而较小的模型和扩展推理技术反而可能降低性能。

原作者: Durjoy Majumdar

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Durjoy Majumdar

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在去中心化金融的数字世界中,资金通过被称为“智能合约”的自动执行程序进行流动。这些程序就像数字自动售货机,当满足特定条件时会自动发放资产,其运行无需人类管理者或银行。由于这些程序运行在区块链上,一旦部署,它们实际上就是永久性的;如果机器建成后发现缺陷,往往无法修复。这种不可篡改性使得安全性至关重要,因为即使是一个微小的错误也可能导致数十亿美元的损失。多年来,研究人员一直依赖自动化工具来扫描这些合约中的错误,但这些工具往往难以理解代码的上下文,经常发出虚假警报或遗漏细微的危险。最近,一种被称为“大语言模型”的新型人工智能出现了,它能够像人类程序员一样阅读并理解代码。这引发了一个充满希望的问题:这些智能系统能否取代或改进传统的安全检查,在危害发生前发现漏洞?

最近的一项研究旨在通过测试 14 种不同的人工智能模型来回答这个问题。研究人员收集了 54 个真实的智能合约,其中包括已知存在安全缺陷的合约和完全无误的合约,以观察这些模型区分两者的能力如何。他们不仅仅是简单地要求模型查看代码,而是尝试了四种不同的提问方式,从简单的直接提问到复杂的、强制模型通过思考来进行分析的分步指令。他们还测试了在过程中给予模型更多“思考”时间是否能提高其结果,一些现代模型提供这一功能以便更深入地推理问题。目标是确定这些强大的工具是否能够可靠地发现漏洞,而不会误将安全代码判定为危险。

结果显示出性能上的剧烈分化,这挑战了一些关于这些模型如何运作的普遍假设。研究发现,仅仅给予模型更多思考时间或要求其遵循详细的推理过程并不总能使其变得更好。事实上,对于其中一个表现最好的模型而言,开启这种额外的思考模式反而使其表现变差,导致它漏掉了真实的漏洞并降低了整体准确性。这表明,更多的计算投入并不一定会转化为更好的安全分析。相反,最重要的因素仅仅是选择了哪种模型。表现最好的模型是那些规模庞大且由商业开发的模型,它们被证明是非常可靠的,能够正确识别漏洞,且极少在安全代码上出错。

与之形成鲜明对比的是,研究中测试的较小型开源模型表现得非常不同。虽然这些较小的模型擅长发现潜在问题,但它们存在一个致命缺陷:它们无法区分脆弱的合约和安全的合约。它们将每一个干净的合约都标记为危险,实际上是在每一次都大声尖叫“狼来了”。研究人员为这种在不存在威胁的地方产生幻觉的倾向创造了一个特定的术语,称之为“巴西利斯克率”(Basilisk Rate)。一个具有高比例的模型在安全领域是毫无用处的,因为它会用虚假警报淹没工程师。研究表明,表现最好的六个模型在从未标记过干净代码方面保持了完美记录,而最小的三个模型则将每一个干净的合约都标记为易受攻击。

调查还强调了似乎决定这些模型可靠性的模型规模特定阈值。表现良好的模型通常拥有更多的内部参数,这可以被视为其内部知识库的复杂程度。研究表明,在特定的规模附近存在一个过渡点,低于该阈值的模型往往会不断产生幻觉,而高于该阈值的模型则变得精准且值得信赖。有趣的是,一个大型开源模型成功弥补了这一差距,其表现几乎与顶尖的商业模型不相上下,但较小的模型仍然不可靠。

最终,研究结论指出,针对寻找智能合约安全缺陷这一特定任务,选择人工智能模型本身的重要性远超如何提示模型或给予它多少思考时间。虽然这些先进工具展现出了巨大的潜力,但它们并不是对所有系统都通用的万能解决方案。最有效的方法是选择已被证明是精准的模型,并避开那些容易看到不存在的问题的模型。对于数字金融的未来,这意味着安全团队必须仔细审查所使用的各类人工智能工具,确保他们依赖的是能够区分真实威胁与无害代码的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →