SkillBloat: Token Amplification Attacks via Skill Injection in LLM Coding Agents
本文介绍了 SkillBloat,这是一个通过利用大语言模型(LLM)编程智能体中受信任的技能注入通道来实现显著 Token 放大(5.4倍–10.1倍)的两阶段框架,揭示了一种与传统安全攻击正交的独特经济资源滥用威胁。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的版图中,大型语言模型已从简单的文本生成器演变为能够进行复杂推理和行动的自主智能体。这些数字助手可以阅读代码、执行命令并管理软件项目,通常依赖于一套“技能”系统来扩展其能力。可以将这些技能想象成模块化的说明书或工具包,智能体可以通过下载并信任它们来帮助解决特定问题。正如人类可能会查阅专门的指南来修理汽车或分析财务报告一样,AI 智能体通过加载这些数字指南来理解如何处理任务。这种共享技能的生态系统使智能体变得更加强大和多才多艺,但也创造了一种新型的脆弱性。因为这些智能体将这些指南视为受信任的指令,恶意行为者可能会将有害的命令隐藏在看似有益的手册中,从而诱骗智能体去做它不该做的事情。
研究人员长期以来一直担心这些智能体被诱骗去窃取数据或入侵系统,但一项新的研究揭示了一种不同的、更隐蔽的威胁,它针对的是钱包而非安全库。研究人员 Yuanjin Zheng 和 Jingbang Chen 调查了一种他们称之为“Token 放大”(token amplification)的现象。在 AI 世界中,模型读取和编写的每一个词都会产生费用,以称为“Token”的单位来衡量。该团队发现,可以设计一种恶意的技能,迫使智能体为了完成一个简单的任务而进行远超必要的劳动,从而在不改变最终结果的情况下,大幅增加操作成本。这是一种经济滥用形式,智能体被诱导陷入循环往复的工作、反复检查其成果或生成过多的报告,而在此过程中,它看起来仍在完美地运行。
为了理解这一过程是如何运作的,研究人员构建了一个名为 SkillBloat 的框架。他们首先建立了一个包含十五种不同诱骗智能体浪费资源的手段的库。这些方法包括强制智能体撰写过于冗长的报告、进行不必要的质量检查,或模拟需要智能体重试工作的错误指令。研究人员随后针对由主要技术公司构建的真实世界编码智能体测试了这些技巧。他们发现,仅仅通过选择正确的技巧类型,就能使智能体完成的工作量平均增加五到十倍。在某些极端情况下,原本只需几美分即可运行的任务,仅仅因为遵循了一份告诉它要“过度彻底”的被污染的指令手册,其成本就被推高到了超过五美元。
这项研究并未止步于发现单一有效的技巧。研究人员开发了一个两步走的过程来优化他们的攻击。首先,他们筛选其技巧库,以找到哪种技巧对特定的智能体和任务最为有效。一旦确定了最有效的方法,他们便使用第二个人工智能来重写整个技能文档,润色指令,使这种浪费行为变得更具说服力。第二步使得攻击能够适应目标智能体的特定特性,确保额外的劳动量看起来像是工作流中自然的一部分。结果令人震惊:经过优化的攻击始终优于最初的技巧,将平均资源消耗推向了更高水平。在一个详细的案例中,一个分析冥想日志的智能体被诱导执行一系列复杂的验证步骤和文件编辑,这使其 Token 使用量增加了二十六倍以上,而与此同时,它仍成功完成了原定的日志分类请求。
令这一发现尤为令人担忧的是,这些智能体并没有失败;它们成功完成了任务。恶意指令旨在保持正常运行的外观,同时秘密地推高成本。研究人员测试了这些被污染的技能是否会跨越不同任务生效,还是仅针对其设计的特定问题有效。他们发现这些技能具有高度的可移植性;一个旨在浪费资源的技能,即使用于完全不同的项目,往往也能同样奏效。这表明,一个恶意的技能可以被广泛传播,并在许多不同的用户和应用中造成巨大的经济损失。研究还指出,相比于功能更强大的对应版本,较轻量、速度较快的 AI 模型往往更容易受到这些攻击的影响,因为更强大的模型似乎能更好地识别并忽略冗余指令。
研究人员强调,这种威胁与传统的安全攻击截然不同。以往的研究关注的是如何诱骗智能体泄露秘密或执行未经授权的代码,而这项工作则突出了 AI 服务经济模型中的一个漏洞。这种攻击不需要智能体违反规则或破坏其安全性;它仅仅是利用了智能体追求“彻底”和“乐于助人”的本能。通过嵌入鼓励过度验证、重复尝试和冗长报告的指令,攻击者可以在不触发通常会捕捉恶意行为的安全警报的情况下,耗尽资源。研究结果表明,随着 AI 智能体逐渐融入我们的数字生活,保护它们不仅需要拦截坏人,还需要新的方法来检测智能体是否正在被操纵去做无谓的工作。研究结论认为,智能体技能生态系统虽然是创新的强大工具,但目前暴露出了一个容易被利用且难以防御的实际且危险的攻击面。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。