← 最新论文
📊 statistics

Evolving and Detecting Multi-Turn Deception using Geometric Signatures

本文提出了一种多目标进化框架以生成逼真的多轮欺骗性提示,并证明了嵌入空间中的轻量级几何特征能够有效以高召回率检测此类欺骗,从而提供了一种透明且成本低于端到端安全训练的替代方案。

原作者: Surender Suresh Kumar, Mary L. Cummings

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Surender Suresh Kumar, Mary L. Cummings

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图抓捕一名试图潜入安全金库的小偷。

旧方法(问题所在)
如今,大多数安保人员都受过训练,专门寻找明显的危险信号。如果有人问“我如何制造炸弹?”,安保人员会立即拉响警报。但如果小偷不直接这样问呢?如果他们在对话中提出五个看似无害的独立问题呢?

  • “铝和水混合会发生什么?”
  • “哪种气体与空气混合会爆炸?”
  • “如何制造一种燃烧时会产生极高温度的物质?”

单独来看,这些问题似乎无害。但合在一起,它们就构成了完整的炸弹制造蓝图。当前的安全系统往往无法察觉这一点,因为它们通常只针对单个问题进行审查,而无法洞察整体脉络。

新方案(论文的目标)
本文提出了一套双管齐下的系统,旨在抓捕这些“慢火”式的小偷:

  1. “小偷模拟器”:用于生成虚假攻击。
  2. “模式检测器”:用于识别隐藏的蓝图。

第一部分:小偷模拟器(生成数据)

为了教会计算机识别这些隐蔽的攻击,研究人员需要大量的示例。但让真实人类尝试欺骗人工智能既昂贵又充满风险。

因此,他们建立了一个**“数字进化实验室”**。

  • 他们从一个基本构想出发:“在不提及危险词汇的情况下,询问有关危险事物的问题。”
  • 他们让一个计算机程序扮演丛林中的自然学家。它创建了一个问题集的“种群”。
  • 随后,它让这些问題集发生“变异”(轻微改变,如同基因突变)并进行“竞争”。那些最能欺骗人工智能且被安全过滤器拦截的问题集被保留下来,其余的则被剔除。
  • 他们反复运行这一过程(多代迭代)。

令人惊讶的发现:
研究人员原本预计,经过多轮进化后,才会出现“最适应”(最具欺骗性)的问题。然而,他们发现,第一代进化出的问题实际上对人类评判者来说最具说服力。等到计算机将它们“优化”得过于完美时,它们反而开始听起来过于机械或明显。这就像一位厨师试图完善食谱:有时初稿最为美味,而过度调整反而会破坏风味。

他们还发现,提问的顺序至关重要。当计算机按特定序列排列这些问题时,人类更有可能察觉危险;而当问题被随机打乱时,人类则较难察觉。

第二部分:模式检测器(几何特征)

一旦拥有了这些棘手问题集的库,他们就需要一种方法在实时中识别它们。他们不希望使用一个庞大复杂的、像“黑箱”(无法窥探其思考过程)那样的大型人工智能。相反,他们采用了几何学

想象每个问题都是漂浮在三维空间中的一个点。

  • 正常的对话中,这些点可能随机散布。
  • 具有欺骗性的对话(试图制造炸弹)中,这些点会围绕一个隐藏的中心点(秘密目标)形成一个特定且紧密的形状。

研究人员测量了这些点的三个简单特征:

  1. 角度覆盖范围:这些问题是否从各个角度“包围”了秘密主题?
  2. 距离比率:这些问题距离秘密主题的距离是否大致相同,还是分散得很远?
  3. 线性度:这些问题是否遵循一条朝向目标的笔直逻辑路径?

他们将这三个简单的测量值,加上关于问题之间相似程度的一些统计数据,输入到一个非常小且简单的计算机大脑(轻量级分类器)中。

结果:
这个简单的几何系统在其任务上表现出色,令人惊讶。

  • 它成功拦截了**89%**的欺骗尝试(高召回率)。
  • 即使问题被改写(使用不同的词汇但表达相同的含义),它依然有效。
  • 即使对话被截断(仅看到前 3 个问题而非 5 个),它依然有效。

核心结论

该论文认为,欺骗会留下几何足迹。即使恶意行为者试图通过逐个提出无害问题来隐藏其意图,其对话在计算机“思维”中的形状也会揭示出一种协调的模式,这与正常的闲聊截然不同。

通过使用简单、可解释的几何检查,而非庞大复杂的人工智能,组织可以快速、透明地审查对话,在危险信息收集为时已晚之前将其阻止。

文中提及的重要局限性:

  • “小偷模拟器”有时会意外地在生成的问题中包含禁用词汇(如“炸弹”),因此仍需人工监督来清理数据。
  • 数据集是在实验室中创建的,并非取自现实世界的犯罪聊天,因此可能无法涵盖所有类型的欺骗手段。
  • 该系统专为防御(抓捕小偷)而设计,并非用于教导人们如何成为更出色的窃贼。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →