KBF: Knowledge Boundary as Fingerprint for Language Model and Black-Box API Auditing
本文介绍了 KBF,一种低成本的黑盒审计协议,它利用知识边界附近稳定的数值召回率来为语言模型 API 生成指纹,从而在无需直接访问模型的情况下,有效检测生产端点和影子 API 中涉及的经济相关模型替换及混合路由攻击。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正从一家高档的第三方转售商那里购买一瓶葡萄酒。酒标上写着,这是一款来自著名酒庄的稀有昂贵年份酒。但你无法看到瓶中的酒液,转售商也不允许你在购买前品尝。你怀疑他们可能为了保持高利润率,将昂贵的葡萄酒换成了廉价的大众品牌。
这正是当今**大型语言模型(LLM)**用户所面临的困境。许多人通过“中继”服务或转售商购买这些 AI 模型的访问权限。这些服务充当中间人:你向他们付款,他们再将你的请求转发给实际的 AI 提供商。问题在于?转售商可能会秘密地将你付费购买的高价、高质量 AI 替换为廉价、低质量的 AI,同时却告诉你那是真货。
本文介绍了一种名为KBF(知识边界指纹)的新工具,它无需开瓶或进入工厂内部,就能揪出这些“换酒者”。
核心理念:“知识边界”
大多数人认为,可以通过向 AI 提出难题或让其自我介绍来区分两个 AI 模型。但 AI 很狡猾;它们经常谎称自己的身份,或者被诱导表现得像其他人。
研究人员发现了一种不同的识别 AI 的方法:观察其知识的边缘。
将 AI 的知识想象成一座图书馆。
- 图书馆内部(常识): 如果你问"2+2 等于几?”,几乎每个 AI 都会回答"4"。这无助于你区分它们。
- 图书馆外部(过于生僻): 如果你询问一本不存在的书中某个具体的虚构事实,AI 只会随机猜测。这噪音太大,毫无用处。
- 边界(最佳点): 这是图书馆的边缘。这些事实刚好处于 AI 知识的边缘。
- 一个聪明、昂贵的 AI 可能会知道确切答案。
- 一个廉价的 AI 可能会猜出一个略微错误的答案。
- 关键在于,即使 AI 答错了,它往往每次都会给出相同的错误答案。
研究人员称这些为“稳定的错误答案”。它们就像独特的指纹。如果一个昂贵的 AI consistently 说“这种生僻化学物质的沸点是 106 度”,而一个廉价的 AI consistently 说“是 108 度”,这种差异就是指纹。即使昂贵的 AI 答错了,其错误的模式也是其独有的。
KBF 的工作原理(“审计”过程)
KBF 是一个三步流程,用于当场揪出转售商:
为真品“指纹化”(离线):
首先,审计员与官方 AI(即转售商声称正在销售的 AI)进行对话。他们向它提出数千个关于“知识边界”附近生僻事实的问题。他们记录下官方 AI 的确切回答,即使它是错的。他们构建了该特定 AI 如何处理其知识边缘的“指纹”。校准噪音:
审计员再次向官方 AI 提出相同的问题,以观察其“抖动”程度。有时,即使是真正的 AI,也可能因随机的计算机噪音而给出略有不同的答案。KBF 测量这种自然的“抖动”,以便了解正常错误是什么样子的。审计(在线):
现在,审计员向可疑的转售商提出相同的问题。- 如果转售商是诚实的,他们的回答将与官方指纹匹配(在自然“抖动”范围内)。
- 如果转售商作弊并使用了廉价 AI,回答将偏离官方指纹。廉价 AI 可能会给出不同的错误答案,或者根本不回答。
KBF 使用统计测试来判断:“这种差异仅仅是随机噪音,还是证明了正在使用不同的 AI?”
他们的发现
研究人员在16 种不同的真实世界 AI 模型和各种转售服务上测试了 KBF。结果如下:
- 它能揪出作弊者: KBF 成功识别了155 起转售商将模型替换为更廉价模型的案例。它从未错误指控诚实的转售商。
- 它很稳健: 转售商经常改变其 AI 的设置(添加“人格设定”、改变温度参数或使用额外工具)。即使设置发生变化,KBF 也能完美运作。而其他方法则失效,并错误地指控诚实的人作弊。
- 它能揪出部分替换: 有时,转售商不会替换每一个请求;他们可能会替换 10% 以节省成本。KBF 足够敏感,即使只有小部分流量被替换,也能捕捉到这种“混合路由”。
- 现实世界结果: 团队使用 KBF 审计了六个可疑的“影子”API 平台,这些平台宣传提供顶级模型的廉价访问权限。他们发现,27 个端点中有 7 个在撒谎,声称运行的模型与实际不符。有趣的是,谎言主要集中在最昂贵、最高端的模型(如 Claude)上,因为那里有最大的省钱空间。
这为何重要
在此之前,如果你想确认转售商是否诚实,你只能猜测,或者问 AI“你是谁?”(它可能会撒谎),或者依赖未经证实的社区测试。
KBF 提供了一种低成本、科学的方法来验证你购买的内容。它不需要转售商配合,不需要特殊访问 AI 内部代码的权限,也不需要要求 AI 执行任何危险或奇怪的操作。它只是向 AI 询问生僻事实,并检查答案是否与你所付费模型的“指纹”相匹配。
简而言之,KBF 是AI 转售商的测谎仪,确保当你支付“ premium wine(高端酒)”的费用时,你真正得到的是高端酒瓶,而不是廉价替代品。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。