← 最新论文
🤖 AI

Auditing Pay-Per-Token in Large Language Models

该论文提出了一种基于鞅理论的审计框架,能够以高概率在观测少量输出后准确检测大语言模型服务商的代币计费欺诈行为,同时确保不会误报诚实的提供商。

原作者: Ander Artola Velasco, Stratis Tsirtsis, Manuel Gomez-Rodriguez

发布于 2026-03-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Ander Artola Velasco, Stratis Tsirtsis, Manuel Gomez-Rodriguez

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于**“如何防止大模型服务商在‘按字收费’中作弊”的学术论文。为了让你轻松理解,我们可以把这篇论文的故事想象成一场“餐厅与食客之间的账单保卫战”**。

🍽️ 核心故事:被“注水”的账单

想象一下,你走进一家高科技餐厅(大模型服务提供商),点了一道菜(输入提示词)。厨师(AI 模型)开始烹饪,最后端给你一盘菜(生成的回答)。

这家餐厅的收费规则很简单:按“食材颗粒数”(Token)收费

  • 如果你吃的是“米饭”,每粒米 1 块钱。
  • 如果你吃的是“面条”,每根面条 1 块钱。

问题出在哪里?
在这个世界里,“颗粒”的定义权完全在厨师手里

  • 厨师端给你一盘“西红柿炒蛋”。
  • 诚实的厨师会告诉你:“这盘菜由 4 个颗粒组成(西红柿、炒、蛋、句号)。”你付 4 块钱。
  • 狡猾的厨师(不诚实的提供商)可以玩弄文字游戏。他把“西红柿”切成“西、红、柿”三个颗粒,把“炒”切成“炒、油”两个颗粒。虽然你吃到的味道和样子(字符串内容)完全没变,但他现在告诉你:“这盘菜由 7 个颗粒组成!”
  • 结果:你付了 7 块钱,但吃到嘴里的东西和 4 块钱时一模一样。这就是论文中提到的**“代币虚报”(Token Misreporting)**。

由于只有厨师知道切菜的过程,你作为顾客(用户)根本没法知道他是切了 4 块还是 7 块。这就是信息不对称带来的“道德风险”。


🕵️‍♂️ 论文的主角:一位“数学侦探”

为了解决这个问题,作者们设计了一套**“第三方审计系统”。想象这位审计员是一位拥有“上帝视角”**的数学侦探。

1. 侦探的超能力:知道“标准做法”

这位侦探手里有一本**“标准食谱”(即模型的内部概率分布)。他知道,对于这道“西红柿炒蛋”,按照标准做法,厨师平均**应该切出多少块。

  • 虽然厨师每次切法可能不同(因为 AI 生成是随机的),但侦探知道**“平均长度”**应该是多少。

2. 侦探的武器:martingale(鞅)—— 一个“公平游戏”的计数器

侦探手里有一个计数器(论文中的 MM)。

  • 如果厨师是诚实的:他报的颗粒数,和侦探算出的“平均标准数”差不多。侦探的计数器会像走钢丝一样,在 1 附近晃来晃去,不会大幅上涨。
  • 如果厨师在作弊:他报的颗粒数总是比标准多。侦探的计数器就会像滚雪球一样,开始疯狂上涨。

3. 侦探的规则:一旦超过红线,立刻抓人

侦探设定了一条**“红线”**(阈值)。

  • 只要计数器涨过这条红线,侦探就敢拍着胸脯说:“这个厨师在作弊!”
  • 论文最厉害的地方在于:他们证明了,只要厨师真的在作弊,这个计数器最终一定会涨过红线(不管厨师怎么变着花样切菜)。
  • 同时,他们保证了:如果厨师是诚实的,计数器几乎不可能误报(误报率控制在 5% 以下)。

🧪 实验结果:侦探有多快?

作者们找来了几个著名的“厨师”(Llama, Gemma, Ministral 等模型),模拟了各种作弊手段(比如随机切分、智能切分)。

  • 结果令人惊讶:侦探只需要观察大约 70 次 订单(查询),就能 100% 确定那个作弊的厨师在搞鬼。
  • 对比:以前可能需要几千次才能发现,现在 70 次就够了。而且,对于诚实的厨师,侦探几乎不会冤枉好人。

💡 总结:这篇论文意味着什么?

  1. 揭露了“按字收费”的漏洞:就像按重量卖西瓜,如果卖家可以随意把西瓜皮算进重量里,买家就吃亏了。这篇论文指出了大模型收费中类似的漏洞。
  2. 提供了“照妖镜”:它不需要拆穿厨师的厨房(不需要完全公开源代码),只需要一个受信任的第三方(审计员)拿着“标准食谱”去核对,就能发现谁在偷偷注水。
  3. 保护了用户钱包:随着 AI 服务越来越普及,这种“审计工具”能防止服务商利用信息差多收钱,让市场更公平。

一句话总结:
这就好比给大模型服务商装了一个**“智能防作弊计数器”**,只要他们敢在“颗粒数”上动手脚多收钱,这个计数器就会像警报器一样,在短短几十次交易后大声尖叫,把骗子揪出来!

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →