← 最新论文
🤖 AI

Adaptive and Robust Cost-Aware Proof of Quality for Decentralized LLM Inference Networks

本文提出了一种用于去中心化大语言模型(LLM)推理网络的自适应、鲁棒且具备成本意识的质量证明(Proof of Quality)机制,该机制利用先进的聚合规则和信任加权共识,在有效缓解恶意评分操纵和评估者异质性的同时,优化了采样成本、奖励稳定性与共识一致性之间的权衡。

原作者: Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

发布于 2026-01-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个巨大的、全球性的厨房,任何人都可以带来一道菜(AI 的回答)接受评判。目标是公平地支付给最好的厨师报酬,但这里有一个难点:评委也是来自公众的志愿者,其中一些人可能会偷懒、感到困惑,甚至试图操纵游戏。

这篇论文提出了一种运行这个厨房的新方法,使得厨师能够因其优秀的工作而获得报酬,同时评委无法通过作弊来操纵系统。以下是使用简单类比进行的分解:

1. 问题所在:“被操纵的陪审团”

在常规系统中,如果你请 10 个人对一道菜进行评分,你只需取平均分。但如果其中 3 个人是厨师的朋友,给了他 10/10 分,而另外 3 个人是对手,给了他 1/10 分,怎么办?平均分就会被搞乱。

  • 论文观点: 在去中心化 AI 网络中,“评估者”(评委)可能是不可靠或具有恶意倾向的。他们可能会试图抬高朋友的分数,或者破坏竞争对手,或者只是向系统投掷随机数字。如果系统只是简单地对这些分数取平均值,奖励就会失真,导致糟糕的 AI 模型获得报酬,而优秀的模型却被忽视。

2. 解决方案:“智能陪审团”系统

作者升级了他们之前的系统(称为 质量证明/Proof of Quality)以应对这些作弊者。他们增加了两个主要的“保安”:

保安 #1:“中间地带”规则(鲁棒聚合)

系统不是采用简单的平均值(这很容易受到极端评分的影响),而是使用更聪明的数学方法:

  • 中位数: 想象一下将所有分数按从低到高的顺序排列,然后挑选出正中间的那一个。如果作弊者试图给出一个虚假的“100”或“0”,这个分数会被推到队伍的末端并被忽略。
  • 修剪平均值: 这就像是在计算平均值之前,先切掉前 10% 和后 10% 的分数(即离群值)。这就像花样滑冰比赛,最高分和最低分会被剔除,以防止偏见。

保安 #2:“声誉分数”(自适应信任)

系统会为每位评委保留一个持续更新的“声誉分数”。

  • 运作方式: 如果一位评委给出的分数通常接近群体的共识,他们的声誉就会上升,并且下次投票时其权重也会增加。
  • 惩罚机制: 如果一位评委一直给出与群体不符的奇怪分数(可能是因为他们在试图作弊或仅仅是判断能力差),他们的声誉就会下降。最终,他们的投票几乎将毫无影响力。
  • 类比: 想想这就像是社区治安观察。如果有人不断地“狼来了”或者提供虚假报告,邻居们就会不再听取他们的意见。如果他们通常是正确的,他们就会拥有更多的发言权。

3. “成本”因素:效率至关重要

论文还关注了这些评委消耗了多少能量和时间。

  • 类比: 想象一下雇佣一个评审团队。你不会想雇佣一群昂贵、缓慢的专家,如果一支快速、廉价的志愿者队伍能以同样的效果完成 90% 的工作。
  • 机制: 系统会奖励那些既高质量快速/廉价的 AI 模型。它也会奖励那些快速且准确的评委。如果一位评委反应迟钝或成本高昂,即使他们很准确,获得的报酬也会减少。

4. 他们测试了什么(模拟实验)

作者不仅仅是在空谈;

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →