← 最新论文
💻 computer science

From Role Prompt to Infinite Thinking: Exploiting Persona Conditioning for Inference Cost Attacks in LLMs

本文介绍了“RolePlay”,一种利用大语言模型(LLM)人格一致性来诱导语义连贯但计算低效行为的新型攻击框架,该框架实现了高达 207.64 倍的 Token 放大效应,并显著优于现有的推理成本攻击方法。

原作者: Zhiyi Mou, Wangze Ni, Tianfang Xiao, Haoyang LI, Chen Jason Zhang, Hanzhi Ma, Yang Bai, Zhibo Wang, Kui Ren

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiyi Mou, Wangze Ni, Tianfang Xiao, Haoyang LI, Chen Jason Zhang, Hanzhi Ma, Yang Bai, Zhibo Wang, Kui Ren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机不仅仅是回答问题,而且拥有人格的世界。这就是大语言模型(LLM)的领域,它们是聊天机器人、代码生成器和数字助手背后的超智能 AI 大脑。这些模型的工作方式就像一个非常快、非常爱聊天的学生,读完你的问题后,再一个词一个词地写下答案。他们写的每一个词都会消耗一点点电力和计算能力。通常情况下,这是很高效的:你问“2+2 等于几?”,他们会迅速输入“4”。但如果你能诱骗计算机为了说出“4”而写下一千个字呢?这就是这篇论文要解决的问题。它探索了一种让这些 AI 模型浪费能源和时间的新方法,不是通过对它们大喊大叫或破坏它们,而是通过给它们设定一个特定的“角色”,让它们过度思考一切。

这项研究背后的研究人员志一牟(Zhiyi Mou)及其团队发现,这些 AI 模型在处理“人格”(personas)方面存在一个隐藏的弱点。简单来说,人格就像演员穿上的戏服或扮演的角色。如果你告诉 AI:“假装你是一个紧张、追求完美且害怕犯错的学生”,AI 会尽力保持这个角色。该团队发现,如果你挑选出合适的人物,AI 会自然而然地开始做一些低效的事情,比如检查自己的工作一百遍、怀疑自己的答案,或者用过于复杂的方式解释简单的概念。他们将这种新方法称为 RolePlay

这里有一个重大的发现:仅仅通过分配一个特定的、略显低效的人格,他们就能让 AI 生成远超必要的文本,而 AI 甚至意识不到自己被诱骗了。在他们的测试中,这种方法对许多不同的 AI 模型都有效。平均而言,它使模型生成的词量比平时多出了 7.64 倍。在最极端的情况下,AI 生成的文本量竟然达到了 207.64 倍!例如,一个通常只需 3 秒钟完成并包含 12 个词的任务,被拉长到了近 142 秒,并产生了超过 1,500 个词。

论文指出,这是一个严重的问题,因为很难阻止它。过去试图让 AI 浪费时间的方法涉及使用奇怪、有故障感的句子或明显的指令,如“想得更深一点”,这些都能被计算机过滤器轻易识别并拦截。但 RolePlay 是隐蔽的。这些提示词看起来像是正常的、礼貌的请求,比如“扮演一名新手学生”或“成为一名困惑的专家”。因为 AI 非常擅长遵循指令并保持角色一致性,它会乐此不疲地通过做这些事来浪费资源,即使这意味着变得极其缓慢且重复。

研究人员在各种任务上测试了这一点,从解决数学问题到编写代码以及回答一般性问题。他们发现,无论任务是什么,“人格”这一招都奏效。他们还将该方法与其他已知的减慢 AI 速度的技巧进行了对比,RolePlay 每次都胜出。例如,在名为 Gemini-3.5-Flash 的特定模型上,RolePlay 使 AI 生成了 7.64 倍的 token,而其他方法仅能实现约 3.5 倍。甚至在一个通常有输出限制的模型上,RolePlay 也成功让其生成了比平时多出 3.19 倍的内容。

这项研究中最有趣的环节之一是他们如何构建这些人格。他们并非凭空猜测;而是先利用一个智能系统对问题进行分析。如果问题是一个棘手的数学题,系统就会创建一个“焦虑”且“痴迷于寻找矛盾”的学生人格,导致 AI 反复自我怀疑。如果问题是关于历史的,人格可能会是一个“固执的专家”,拒绝给出简单的答案。这种“任务感知型”(task-aware)的方法意味着 AI 的低效感显得非常自然且符合情境,这使得安全过滤器很难捕捉到。

团队还检查了这是否只是一个偶然现象,或者它是否真的有效。他们在不同类型的 AI 模型(包括来自大型科技公司的模型和开源模型)上进行了数千次测试。结果是一致的:AI 模型不断陷入过度解释和自我修正的循环中。研究表明,这种“人格一致性”(AI 想要忠于你赋予的角色)是一种新型的漏洞。这不是代码中的漏洞(bug),而是 AI 为了变得“乐于助人”而学习到的特性被反向利用了。

那么,这对未来意味着什么?论文并没有说这会在明天关闭互联网,但它确实强调了恶意行为者可能利用这种方式来耗尽 AI 服务的资源。如果有人想要让 AI 服务变得缓慢且昂贵,他们不需要发送数百万次请求,只需要发送一些巧妙设计的提示词,将 AI 变成一个拖延、过度思考的角色即可。研究人员希望通过指出这一点,能让开发者建立更好的防御机制,以阻止 AI 在不必要的、由人格驱动的喋喋不休中浪费能源。

简而言之,这篇论文揭示了:正是让 AI 模型擅长角色扮演的那种特质——保持角色一致性——可以被用来降低其效率。通过给 AI 穿上紧张学生或困惑专家的“戏服”,研究人员展示了他们如何能将单个问题的成本增加数百倍。这提醒我们,在 AI 的世界里,有时最强大的工具不是复杂的算法,而是一个简单且精心挑选的“戏服”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →