Secure Tool Manifest and Digital Signing Solution for Verifiable MCP and LLM Pipelines
本文提出了一种安全工具清单与数字签名框架,该框架通过实现经过加密签名的清单和透明的验证日志,增强了模型上下文协议(MCP),以确保敏感领域内大语言模型流水线的完整性、可验证性和安全执行。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在经营着一家高风险的厨房,一位非常聪明但有时难以捉摸的主厨(大语言模型或 LLM)正根据顾客的订单准备复杂的菜肴。这位主厨可以使用各种工具——如刀具、烤箱、搅拌机(外部工具)——来完成工作。
问题在于,在目前的设置下,任何人都可以溜进厨房,把主厨的食谱卡换成假的,或者诱骗主厨使用一把脏刀。如果主厨遵循了一个错误的指令,食物可能会中毒,而且没人知道是谁下的订单,或者到底发生了什么。这就是该论文所针对的漏洞。
作者提出了一种名为安全工具清单与数字签名框架的新系统。以下是它的工作原理,使用了简单的类比:
1. “防篡改的食谱卡”(清单)
在主厨接触任何工具之前,每一项请求都必须写在一张特殊的数字“食谱卡”上,称为清单(Manifest)。
- 类比: 这就像是一个密封的官方信封。在信封里,明确列出了主厨被允许做的事情。
- 转折点: 论文将“顾客视角”(用户看到的内容)与“主厨视角”(内部技术细节)分离开来。这可以防止顾客在无意中(或恶意地)泄露关于厨房运作方式的秘密。
2. “公证印章”(数字签名)
在主厨查看食谱卡之前,该卡必须由一位受信任的公证员(硬件安全模块或 HSM)进行盖章。
- 类比: 想象一位公证员检查食谱卡,验证规则,然后使用一种特殊的墨水(数字签名)在上面盖上一个独特的、不可伪造的印章。
- 结果: 如果有人在盖章后试图修改卡片上的哪怕一个字母,墨水就会晕开,卡片会立即被识别为伪造。主厨将拒绝烹饪。
3. “公共账本”(透明度日志)
每当一张食谱卡被盖章并使用时,一份收据副本都会被添加到一本巨大的、公开且不可更改的书籍中,称为透明度日志(使用一种叫做 Merkle Tree 的技术)。
- 类比: 这就像是一个区块链或一本公开的日记,所有人都可以阅读,但没有人可以删除或编辑。如果你想知道主厨五分钟前做了什么,你可以查阅它。
- 益处: 如果主厨做了奇怪的事情,你可以证明这具体发生在何时以及由谁授权。你无法隐瞒证据。
4. “速度测试”(可扩展性)
作者使用多达 50,000 份订单(海量的烹饪量)对该系统进行了测试。
- 发现: 他们发现,增加订单量并不会以混乱的方式减慢厨房的速度。相反,该系统变得更加高效,每个订单的处理效率更高,就像一台运转良好的机器。它实现了“线性”扩展,这意味着如果订单量翻倍,所需时间也只是随之翻倍(这是符合预期的),而不会崩溃或陷入停滞。
- 类比: 这就像一条高速公路,每增加 1,000 辆车就增加一条新车道,即使在高峰时段也能保持交通顺畅。
5. “公平性检查”(平衡使用)
该系统使用了三种不同类型的厨师(GPT-4、LLaMA 和 DeepSeek)。
- 发现: 系统会自动平衡工作量,确保没有哪位厨师会被压垮,而其他厨师却在闲置。这就像一位聪明的服务员,在所有厨师之间均匀地分配桌位。
- 安全性: 这可以防止恶意行为者通过压垮某一位特定的厨师来导致系统崩溃(拒绝服务攻击)。
6. “自我纠错”(错误处理)
该系统被设计为“失效关闭”(fail-closed)。
- 类比: 如果一张食谱卡看起来哪怕只有一点点可疑,或者时间戳不对(比如来自明年的食谱),系统会立即锁上门并说“不行”。它不会冒险尝试。
- 结果: 在测试中,它成功拒绝了所有伪造或损坏的订单,同时让所有有效的订单顺利通过。
总结
简而言之,这篇论文为 AI 系统构建了一个保安、公证员和公开记录员。它确保了当 AI 使用工具时,是在遵循一套经过验证、已签名且被记录的规则。它证明了你可以让 AI 系统如此安全,且即便在成千上上万人同时使用时,也不会降低其运行速度。
该论文并不声称解决了 AI 的“思考”问题或使其变得更聪明;它仅仅是确保了 AI 所采取的行动是安全的、可追溯的,且无法伪造。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。