← 最新论文
💻 computer science

Repeated-Game Security for Restaking-Based Verifiable Inference

本文表明,由于存在比例惩罚无法在长期内阻止理性违规行为的重复博弈差距,基于再质押的可验证推理中通常假设的一次性激励相容性是不充分的,并提出了一种结合了历史依赖型挑战与声誉加权惩罚的可部署机制,旨在无需进行单次查询密码学验证的情况下恢复长期安全性。

原作者: Zhenhang Shang, Yingzhe Yu, Kani Chen

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenhang Shang, Yingzhe Yu, Kani Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:巨大的、超级聪明的计算机大脑(被称为大语言模型)可以回答你的问题、撰写你的故事或解决你的数学难题。但问题在于:运行这些大脑既昂贵又缓慢。因此,公司希望雇佣独立的劳动者来为它们进行思考。问题是,你如何知道这个劳动者并没有只是在瞎猜答案,或者为了省钱而使用了更便宜、更笨的脑子?这就是**可验证推理(verifiable inference)**的世界。

为了解决这个问题,我们使用了一种叫做再质押(restaking)的系统。把它想象成一笔保证金。劳动者投入一堆数字货币(质押金)作为诚实工作的承诺。如果他们违规,裁判会检查他们的工作,如果被抓到,裁判会没收他们的一部分保证金。这被称为惩罚(slashing)。长期以来,专家们认为这是一个完美的安全网。他们认为,如果违规的代价大于违规所节省的资金,那么没有人会尝试违规。这是一个简单的“单次”交易:不要偷饼干,否则你会失去整个罐子。

但是,如果这个劳动者不只是做一份工作,而是被雇佣去做成千上万份重复的工作呢?这就是故事变得复杂的地方。你即将阅读的这篇论文提出了一个精彩的问题:当游戏被反复进行时,这种“单次”安全网是否真的有效? 作者 Zhenhang Shang、Yingzhe Yu 和 Kani Chen 来自香港科技大学,他们发现旧的安全网有一个隐藏的漏洞。他们发现,如果劳动者稍微违规一点,他们实际上可以逃脱惩罚,即使惩罚看起来最初很吓人。为什么?因为每次被抓到时,罚款只扣除他们保证金的一个比例。因此,他们的保证金变得越来越小,使得未来的罚款也越来越弱,而他们在每一次新的任务中通过违规所节省的钱却始终如一!这就像一个小偷不断偷走一点点黄金,而每次被守卫抓住时,守卫只拿走他剩余黄金的一小部分,使得小偷的“风险”不断下降,直到他几乎无法被制止。

重大发现:“惯犯”漏洞

作者意识到,旧规则——“不要违规,因为罚款比收益大”——只适用于一次性的决策。但在现实世界中,这些 AI 提供商是长期经营的,他们要回答成千上fold甚至数百万个问题。该论文将此建模为一个重复博弈(repeated game),即提供商和协议进行一轮又一轮的游戏。

他们发现了一个“重复博弈差距”。以下是违规者使用的魔术技巧:

  1. 设定: 提供商投入一大笔质押金。
  2. 违规: 他们使用更便宜、更快的模型来回答问题,从而在每一次查询中节省资金。
  3. 失误: 有时,裁判(协议)会抓住他们。
  4. 漏洞: 协议只扣除(slashes)质押金的一个百分比,例如 20%。提供商损失了一些钱,但他们仍保留了 80%。
  5. 循环: 因为他们的质押金现在变小了,所以下一次他们被抓到时,罚款也会变得更小(即更小数值的 20%)。但他们在下一个问题上通过违规所节省的钱与之前完全一样!

论文从数学上证明了这会造成危险的不平衡。节省的金额保持不变,但惩罚却随着每次被抓到而缩减。作者表明,对于许多现有系统(如 EigenAI、VeriLLM 和 Sertn AVS),这种差距是真实存在的。尽管这些系统通过了“单次”安全测试,但它们未能通过“长期”测试。在模拟中,一个理性的违规者可以通过利用这个重复博弈漏洞,在系统认为安全的情况下,依然能获得 1.5% 到 8% 的额外利润。

解决方案:更智能、具备历史感知能力的系统

那么,如何修复一个每次被抓到都会变得更弱的系统呢?作者提出了一种新的机制,它像是一个聪明的、具有记忆力的裁判。它不再仅仅观察劳动者还剩多少钱,而是查看他们的历史记录

他们引入了三个巧妙的工具来堵住这个漏洞:

  1. 怀疑分数(“警觉之眼”): 系统会为每个劳动者保留一个分数。如果他们的行为异常(比如回答速度过快或给出略有不同的答案),他们的怀疑分数就会上升。分数越高,裁判检查他们工作的可能性就越大。这意味着如果你违规,你不仅会被罚款,下次还会被更严密地监视
  2. 基于声誉的罚款(“烙印”): 罚款不再仅仅取决于剩余资金的百分比,还取决于劳动者的声誉。如果你有不良记录,即使你的存款很少,罚款也会变得非常严厉。这阻止了“缩减惩罚”的诡计。
  3. 归属期/锁定(“牵引绳”): 当一个劳动者试图离开游戏(提取资金)时,系统不会让他们立即离开。他们的钱会被“锁定”一段时间。如果他们试图违规并逃跑,系统仍可以在这段锁定期间抓住他们并没收他们的钱。这阻止了“违规后逃跑”的策略。

它真的有效吗?

作者不仅仅是凭空构想,他们还建立了一个模拟器来测试。他们将新系统与旧系统进行对比,测试了不同类型的“违规者”,包括那些持续违规的人、那些只在认为没人看守时才违规的人,以及那些试图违规后逃跑的人。

结果非常令人振奋。在模拟中,旧系统让违规者保留了他们的额外利润。但拥有历史感知规则的新系统,将违规者的利润削减了 31% 到 54%。在某些情况下,它甚至使违规成为一种亏损策略,使违规者的利润变为亏损。

他们还测试了违规行为的“可检测性”。他们使用了真实的 AI 模型(范围从 0.5 亿参数的小模型到 140 亿参数的大模型),以观察系统能否识别出真实答案与廉价假答案之间的差异。他们发现,系统的“怀疑度量表”效果非常好,尤其是当好模型与廉价模型之间的成本差异较大时。违规者越试图节省资金,就越容易被抓住。

这为什么重要

这篇论文为区块链和 AI 安全领域敲响了警钟。它表明,仅仅因为一项安全规则在某一时刻有效,并不意味着它在整个生命周期内都有效。作者不仅指出了问题,还为能够处理重复交互现实的系统提供了蓝图。

他们证明了,通过让惩罚取决于劳动者的过去行为,并对试图离开的人保持“牵引”,我们可以创建一个即使在游戏无限进行下去时也能保持安全的系统。这是一种思维方式的转变:从将安全视为单一的“保释金”,转变为将其视为一种信任随时间积累或流失的长期的关系。对于任何在区块链上构建 AI 未来的人来说,这是确保劳动者真正履行其承诺工作的关键一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →