← 最新论文
🤖 machine learning

Metis: Learning to Jailbreak LLMs via Self-Evolving Metacognitive Policy Optimization

Metis 是一个新颖的框架,它将大语言模型越狱重新表述为对抗性部分可观测马尔可夫决策过程中的自进化元认知策略优化过程,通过以定向的因果推理取代静态启发式方法,从而绕过高级安全防御,实现了最先进的攻击成功率并显著降低了令牌成本。

原作者: Huilin Zhou, Jian Zhao, Yilu Zhong, Zhen Liang, Xiuyuan Chen, Yuchen Yuan, Tianle Zhang, Chi Zhang, Lan Zhang, Xuelong Li

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Huilin Zhou, Jian Zhao, Yilu Zhong, Zhen Liang, Xiuyuan Chen, Yuchen Yuan, Tianle Zhang, Chi Zhang, Lan Zhang, Xuelong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图打开一个高科技、超安全的金库(即 AI 模型),而金库前站着一位非常聪明且谨慎的守卫(即安全对齐机制)。

长期以来,黑客(红队测试人员)尝试通过向大门扔石头、尝试不同的钥匙,或大声喊出随机短语来闯入,直到碰巧成功。这就像随机搜索:充满猜测、浪费大量精力,且在面对最新、最聪明的守卫时往往失败。

本文介绍了一种名为Metis的新工具。Metis 不再只是扔石头,它更像是一位大师级窃贼,不仅尝试破门,还能学习守卫如何“思考”,并实时调整自身策略。

以下是 Metis 的工作原理,拆解为简单概念:

1. 双脑系统(攻击者与评估者)

Metis 并非单一机器人,而是一个由两个部分组成的团队,在循环中协同工作:

  • 攻击者(窃贼):这是负责试图欺骗 AI 的一方。但与仅靠猜测的旧方法不同,这位攻击者具备“思考”步骤。在提出问题之前,它会暂停分析:“上次守卫为何拒绝?我是否太明显?我是否用错了措辞?”
  • 评估者(教练):这是另一位 AI,负责观察交互过程。它不只是简单判定“通过”或“失败”,而是提供详细的评分报告。它会说:“你失败了,但原因如下:你问得太直接。试着将其包装成关于电影剧本的故事。”

2. “元认知”循环(思考关于思考的过程)

核心秘诀在于元认知。用人类术语来说,就是“思考你自己的思考”。

  • 旧方式:黑客尝试一个技巧。守卫说“不行”。黑客尝试另一个随机的技巧。
  • Metis 方式:黑客尝试一个技巧。守卫说“不行”。黑客思考:“啊,守卫对‘黑客’这个词很警惕。我将停止使用这个词。我会假装自己是一名研究锁具工作原理的科学家。”
  • 随后,黑客会更新其内部对守卫逻辑的映射,并基于这一诊断,尝试一种全新、更聪明的方法。

3. “语义梯度”(指南针)

想象你在黑暗中行走,试图寻找隐藏的宝藏。

  • 旧方法就像在原地打转,希望偶然撞见宝藏。
  • Metis则像拥有一枚指南针,它不仅指向北方,还会告诉你:“你距离目标还有 10 步,如果你稍微向左转,地面会变得松软。”
  • 这位“评估者”提供了这枚指南针。它给出一种“语义梯度”——即在语言世界中指引攻击者走向答案的方向,而不仅仅是告知他们错了。

4. 结果:更聪明、更经济

该论文在 10 种不同的 AI 模型上测试了 Metis,包括最先进的模型(如 GPT-5 和 O1)。

  • 成功率:Metis 平均有**89.2%**的成功率突破了安全守卫。这远高于以往的方法,后者在面对最聪明的守卫时,成功率往往降至接近零。
  • 效率:由于 Metis 不浪费时间进行随机猜测,它成功所需的计算资源(token)减少了 8 到 11 倍。这就像通过查看地图来解迷宫,而不是盲目地撞向每一堵墙。

5. 重大警示

论文最后提出了一个令人警醒的观察:即使是我们今天拥有的最佳安全守卫,也易受这种“思考型”攻击的影响。守卫擅长识别不良词汇,但当攻击者利用漫长、逻辑严密的对话逐步诱骗它们泄露不应透露的内容时,它们就会显得力不从心。

总结:Metis 是一个系统,它通过不断分析自身错误、学习所面对守卫的具体“个性”,并像国际象棋特级大师而非赌徒那样调整策略,从而教会 AI 如何越狱其他 AI。作者指出,这证明我们需要更好的防御机制,这些机制应具备动态“思考”的能力,而不仅仅是依赖静态规则。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →