想象一下 Web3(区块链和加密货币)的世界是一个繁忙、喧闹的大都市,人们在这里建造数字银行、桥梁和保险库来存放他们的钱。这篇论文就像是一场长达四年的调查,旨在探究为什么尽管雇佣了最优秀的保安(审计员)来检查这些建筑的蓝图,这座城市仍然损失了数十亿美元。
以下是这项调查的故事,分为几个简单的部分:
1. 两个不同的世界
研究人员查看了两份截然不同的数据列表:
- “蓝图检查”列表: 这包含了来自安全公司审查代码的 23,818 条记录。他们发现了一些问题,例如“这个门把手很脆弱”或“这面墙是由不结实的材料制成的”。
- “劫案”列表: 这包含了 218 起真实的现实世界失窃案例,总金额约为 77.6 亿美元。
核心问题是:安全员警告我们的那些问题,是否与实际发生被盗的情况相匹配?
2. 巨大的错位(“审计差距”)
答案是响亮的不匹配。这两份列表看起来完全不同,就像是在比较“汽车引擎中可能损坏的部分”与“导致汽车发生事故的真实原因”。
- 审计员发现了什么: 安全员把大部分时间花在了寻找代码本身极其微小的技术性故障上。他们担心的是像“逻辑错误”(代码进行的计算错误)或“访问控制”(谁拥有钥匙)之类的问题。这些占据了他们报告中的绝大部分。
- 实际发生了什么: 窃贼并不关心代码的数学逻辑。他们主要通过以下方式窃取资金:
- 欺骗人们: 网络钓鱼邮件或社会工程学(伪装成其他人)。
- 窃取钥匙: 夺取控制保险库的私钥(密码)。
- 攻击供应链: 窃取用于建造保险库的工具,而不是直接破坏保险库本身。
类比: 想象一家银行雇佣了一支团队来检查其金库门的钢材。该团队花了数月时间寻找钢材上的微小裂缝(审计)。但窃贼并没有破坏门,而是等待一名保安走出来,诱骗他交出钥匙,或者从建筑师的办公桌上偷走了蓝图。审计对门是完美的,但它没有检查保安或办公桌。
3. “超级风暴”效应
论文还发现,这个世界的资金损失并不是均匀发生的。它不像每天下的细雨。它更像是一场飓风。
- 加强版的 80/20 法则: 仅仅 8 起大规模劫案 就占了四年间所有损失金额的一半以上。
- “平均值”是一个谎言: 如果你试图通过观察“平均”窃案来预测风险,你会出错。大多数窃案规模很小,但少数几次劫案规模巨大,足以抹去其他所有的损失。论文警告说,针对“平均值”进行规划,就像是在海啸来临前却在为晴天做计划。
4. “人”的因素
最令人惊讶的发现是,最大的损失来自于人为错误,而不是计算机漏洞。
- 在过去几年中,超过一半的资金损失是由于人们被欺骗、钥匙被盗或管理不善造成的。
- 安全审计主要检查的是代码,但它们很少检查持有钥匙的人,或者人们用来签署交易的计算机。
5. 结论:我们需要两种类型的安全
论文得出结论,我们不能只依赖一种类型的安全人员。
- 代码审计员擅长发现软件中的漏洞(“蓝图”)。
- 运营保安则是保护人、钥匙和流程所必需的(“保安的制服和保安的思想”)。
研究表明,目前该行业非常擅长检查蓝图,但在保护持有钥匙的人方面表现得很糟糕。为了停止损失数十亿美元,我们需要将这两项工作视为合作伙伴,而非替代品。我们需要既检查代码,也检查人类行为。
简而言之: 安全专家正在路灯下寻找丢失的钥匙,因为那里的光线充足(代码),但窃贼正从黑暗的小巷里(人和流程)拿走钥匙,而那里没有人关注。
技术摘要:区块链安全中的审计差距
问题陈述
Web3 安全领域存在证据基础碎片化的问题,审计报告和漏洞事件通过不同的渠道进行追踪,且分类标准不统一。一个关键且尚未量化的问题是:审计人员在源代码中识别出的漏洞模式,是否与部署系统中产生的实际经济损失模式相对应?以往的研究主要集中于特定漏洞类别的分类调查或静态分析工具的有效性,通常发现检测到的漏洞与实际利用之间存在弱耦合。本文通过实证比较公开审计发现与现实世界漏洞事件的联合分布,旨在解决这一“审计差距”问题,以确定审计覆盖的风险面是否与攻击者所利用的风险面一致。
研究方法
本研究对四个多月(2022 年 1 月 1 日至 2026 年 3 月 27 日)的观察期进行了聚合实证分析。研究采用了并行分析惯例,将审计输出和漏洞输出视为两个独立的总体,而非彼此的直接统计样本。
数据来源:
- 审计发现: 收集了来自 22 家独立安全公司的 23,818 项发现。数据通过公开 GitHub 仓库(使用
git log 提交日期以避免发表偏差)和结构化 Web 原生渠道(API、门户网站)进行聚合。
- 漏洞事件: 来自 rekt.news 的 218 起经过质量过滤的事件数据集,代表的总损失约为 77.6 亿美元。过滤过程排除了“拉地毯”(rug-pulls)和编辑性条目,确保损失金额反映的是实际被盗金额,而非总锁定价值(TVL)或市值。
分类与处理:
- 审计分类法: 使用三阶段程序将发现归入约 20 个类别的扁平化分类中:标题级模式匹配、扩展上下文重分类,以及针对严重/高危发现的定向大语言模型(LLM)重分类。“其他”类别占总发现量的 7.9%。
- 事件分类法: 将根因映射到一套自定义分类中,该分类与 rekt.news 的自由文本字段不同,以确保一致性。
- 人类向量定义: 将特定的根因子集(私钥泄露、网络钓鱼/社会工程学、供应链攻击以及治理攻击)归类为“人类向量”(human-vector),其定义为存在于受审协议静态源代码之外的近因。
核心贡献
- 数据集构建: 本文展示了迄今为止分析过的最大的跨公司公开审计发现语料库(23,818 项发现),以及经过严格过滤的事件数据集(218 起事件,77.6 亿美元)。
- 分布的稳定性与波动性: 研究记录了审计发现(按严重程度和类别划分)在时间上表现出显著的稳定性,而实现的损失分布则具有高度的波动性和集中性。
- 类别错位: 研究量化了一个根本性的分歧:驱动大多数实际损失的类别(运维安全、人类向量攻击)在已发表的审计发现中仅占极小的份额。
- 重尾损失特征: 本研究将实现的损失特征化为一种与高斯假设不符的重尾分布,即少数事件占据了绝大部分的累计损失。
研究结果
1. 审计发现分布
- 严重程度: 在完整的年度周期内(2022–2025 年),严重(Critical)和高危(High)发现的占比稳定在 15–17% 的区间内。
- 类别: 前五个类别(逻辑/业务逻辑、代码质量、输入验证、访问控制、初始化/升级性)占据了 54.7% 的发现量。历史上作为智能合约漏洞代表的重入(Reentrancy)仅占发现量的 2.1%。
- 技术栈: Solidity/EVM 链占据主导地位,每年占发现量的 79–84%。非 EVM 技术栈(Rust/Solana, TON, Move)虽有增长,但仍处于少数地位。
2. 实现的漏洞分布
- 根因: 私钥泄露(24.4%)、网络钓鱼/社会工程学(19.5%)和访问控制失效(12.8%)占据了 56.7% 的累计损失。
- 人类向量的主导地位: 人类向量攻击在 2023 年(65.6%)、2024 年(74.6%)和 2025 年(70.8%)分别占据了年度损失的大部分。
- 集中度: 分布极其集中。前八大事件占据了 50.6% 的累计损失;前二十大事件占据了 71.4%。单一大事件(Bybit,14.4 亿美元)就占总损失的 18.4%。
3. 审计差距(分歧)
- 错位: 审计发现的频率与损失金额的大小之间不存在对应关系。
- 审计前四名: 逻辑错误、代码质量、输入验证、访问控制。
- 损失前四名: 私钥泄露、网络钓鱼/社会工程学、访问控制、预言机/价格操纵。
- 交集: 访问控制是唯一出现在两个分布前四名中的类别。
- 范围局限性: 驱动实际损失的类别(密钥窃取、网络钓鱼、供应链攻击)在传统的智能合约审计中几乎是不可见的,因为审计主要审查特定提交的源代码,而不审查部署环境、签名工作流或前端基础设施。
- 受审协议: 48% 的事件影响了至少接受过一次公开审计的协议。然而,在 12 起最大的“已审计但仍被利用”的事件中,有 9 起是由审计范围之外的根源因素(如多签签名者的网络钓鱼、供应链攻击)引起的。
4. 集中度与协议类型
- 链集中度: 以太坊(Ethereum)和 BNB Chain 分别承载了 89% 的事件和 94% 的损失。
- 协议类型: 中心化交易所(CEX)和跨链桥虽然事件数量仅占约 21%,却占据了约 60% 的累计损失。借贷协议虽然在事件数量上最多,但造成的损失不足 10%。
- 统计学意义: 单个事件的平均损失对于风险拨备而言是一个不可靠的指标。例如,网络钓鱼事件的平均损失为 1.26 亿美元,而中位数仅为 650 万美元(比例约为 19:1)。
重要性与主张
本文声称,Web3 安全生态系统并不一定是在简单的意义上变得“不那么安全”,而是风险的性质发生了转变。“代码审查问题”(对源代码的静态分析)保持稳定,而“运维安全问题”(人类因素、密钥管理、基础设施)则大幅增长,并成为了实现损失的主要驱动力。
研究结论指出,传统的审计范围比 Web3 中隐含在“安全”一词下的风险面要窄。审计对于编写出的代码中的 Bug 是有效的,但对于更广泛的风险面(运维安全、部署基础设施、人类工作流)而言,其覆盖范围是广泛不完整的。
作者倡导一种 组合视角(Portfolio View) 的 Web3 安全实践:
- 代码审查: 用以应对源代码中的 Bug。
- 运维安全评估: 用以应对那些在实证中驱动更大份额实际损失的类别(密钥管理、签名者工作流、供应链)。
本文明确拒绝了“审计无效”的结论;相反,它指出审计在狭义上是有效的,但如果将其作为应对全谱系 Web3 威胁的唯一防线,则是不足够的。安全计划必须将代码审查和运维安全视为互补而非替代的学科。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。