← 最新论文
🤖 AI

Can Trustless Agents Be Trusted? An Empirical Study of the ERC-8004 Decentralized AI Agent Ecosystem

本文呈现了对跨越以太坊、BSC和Base链的ERC-8004去中心化AI智能体协议的首次实证研究,揭示了其当前设计由于智能体注册不活跃、声誉指标不具可比性以及反馈机制中广泛存在的女巫攻击操纵,无法提供可靠的信任基础。

原作者: Xihan Xiong, Zelin Li, Wei Wei, Qin Wang, William Knottenbelt, Zhipeng Wang

发布于 2026-06-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Xihan Xiong, Zelin Li, Wei Wei, Qin Wang, William Knottenbelt, Zhipeng Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个繁忙的数字市场,成千上万个机器人助手(AI 智能体)正在彼此之间进行商业活动。它们需要互相雇佣、支付费用并交易数据。但存在一个巨大的问题:机器人如何知道一个它从未谋面的新机器人是诚实的,还是仅仅是一个骗子?

为了解决这个问题,一套名为 ERC-8004 的新规则诞生了。你可以把它想象成一个建立在区块链上的巨大、公开的“信任账本”。它包含三个主要部分:

  1. 身份卡注册表: 机器人在此注册它们的名称和面孔。
  2. 声誉墙: 客户在此留下评论和评分。
  3. 验证库:(计划中,但尚未建成)由独立专家在此验证机器人是否真的完成了它们声称的工作。

论文的作者决定用放大镜来审视这个新系统,看看它是否真的有效。他们观察了三个不同数字世界(以太坊、BSC 和 Base)中长达数月的真实数据。以下是他们的发现,通过简单的语言进行了解释:

1. “鬼城”问题(身份)

论文发现,虽然身份注册表中充满了名字,但大多数都是幽灵

  • 类比: 想象一本电话簿里有 17 万个条目。你拿起电话拨号,却发现 97% 的号码都是空号,或者接电话的人只是一个只会说“我在”的自动录音,并不是真正的业务实体。
  • 现实情况: 大多数“已注册”的智能体只是占位符。只有极小的一部分(介于 3% 到 15% 之间)拥有可以执行的实际服务。在以太坊链上,超过一半的注册智能体甚至从未设置过自己的“电话号码”(URI)以便被联系。

2. “虚假评论”流行病(声誉)

声誉墙本应是该系统的核心,但作者发现它失效了

  • 类比: 想象一个餐厅评论网站,任何人都可以无需品尝食物就撰写评论。更糟糕的是,想象一群机器人可以创建数千个虚假账号,为同一家餐厅刷“五星好评”,而另一群人则为竞争对手刷“一星差评”。
  • 现实情况:
    • 缺乏购买证明: 该系统中 95% 到 100% 的评论是由从未支付或从未使用过该服务的人撰写的。这就像是在从未订购披萨的情况下给披萨店写 Yelp 评论。
    • “女巫攻击”(Sybil Attack): 研究人员发现了由同一来源资助的大规模虚假评论者群体(称为“女巫”)。在 Base 链上,90% 的评论者都是这些虚假群体的一部分。
    • 结果: 如果移除所有虚假评论,Base 链上 89% 的智能体将处于零有效反馈的状态。它们的“声誉”完全是空的。

3. “混乱评分”问题(语义)

即便评论是真的,评分系统也毫无意义。

  • 类比: 想象一份学校成绩单,一位老师按 1 到 10 分的标准给“数学”打分,另一位老师按 1 到 100 分的标准给“历史”打分,而第三位老师则使用金额(例如“表现良好,奖励 500 美元”)来给“体育”打分。如果你试图计算这些分数的平均值来得到一个“最终成绩”,这个数字将毫无意义。
  • 现实情况: 系统允许任何人使用任何标签给出分数。有些人将“信任度”定在 0–100 范围内,有些人将“营收”定在数千美元,还有些人使用是/否标志。由于缺乏标准,你无法将一个智能体的分数与其他智能体进行比较。这就像是在比较苹果、橘子和烤面包机。

4. “低成本操纵”问题(安全性)

该系统极其容易被破坏,而且成本几乎为零。

  • 类比: 想象一个夜店保安,只有在你看起来可疑时才会检查身份证。但检查 ID 的成本仅为 0.002 美元(不到一分钱)。一个坏人可以用买一杯咖啡的价格买到一千张假身份证,从而让大量假人涌入俱乐部,以此改变俱乐部的氛围。
  • 现实情况:
    • 成本: 在以太坊上提交单条评论的成本低于 0.06 美元,在 Base 上低于 0.003 美元
    • 影响: 由于用于计算平均分的数学逻辑非常简单,哪怕只有一条虚假评论,也能彻底改变一个智能体的声誉得分,无论它之前有多少条真实评论。
    • 代价: 这些智能体处理的资金往往远高于伪造评论的成本。这就像是用 0.003 美元去偷走一个 1000 美元的钱包。

总结

论文得出结论:虽然为 AI 智能体建立一个“去中心化/无需信任”(无中心管理者)系统的想法很棒,但目前的 ERC-8004 版本尚无法被信任

  • 大多数注册的智能体并不存在。
  • 大多数评论是虚假的或未经验证的。
  • 评分系统是一团由不兼容数字组成的乱麻。
  • 操纵该系统的成本太低。

作者建议,在这一系统投入实际业务之前,需要重写规则,以强制要求支付证明、标准化评分方式,并提高创建虚假账号的成本。在此之前,这个“信任层”更像是一个“信任幻觉”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →