← 最新论文
💬 NLP

How Language Models Process Out-of-Distribution Inputs: A Two-Pathway Framework

本文揭示了现有针对语言模型的白盒分布外(OOD)检测方法在结构上受序列长度混淆,并提出了一种双路径框架,该框架区分用于词汇偏移的基于嵌入的信号与用于检测如越狱等隐蔽意图输入的隐藏状态轨迹特征。

原作者: Hamidreza Saghir

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Hamidreza Saghir

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名博物馆的保安。你的工作是在真品画作中识别出赝品(即分布外或"OOD"输入)。最近,其他保安开始使用一种新工具:他们测量画作“抖动”的程度或笔触的混乱程度(这类似于测量人工智能中的注意力熵)。他们声称这种工具在识别赝品方面非常出色。

然而,这篇论文指出,这些保安实际上是被愚弄了。他们并没有识别出赝品,而只是在数画布上有多少笔触。

以下是用简单类比对该论文发现的分解说明:

1. “长画布”陷阱(长度混淆)

论文发现,许多流行的人工智能安全工具实际上只是在秘密测量文本的长度

  • 类比:想象保安的工具是一把尺子。它声称测量“混乱程度”,但实际上只是测量“长度”。
  • 问题:在测试中,“赝品”画作(越狱攻击或垃圾信息)通常比“真品”长得多。工具看到长画作后惊慌失措,仅仅因为长度就喊道:“那是赝品!”
  • 证据:当研究人员强制让真品和赝品画作保持完全相同的长度时,该工具便失效了。它崩溃至接近随机猜测(就像抛硬币)。论文表明,像 CED、RAUQ 这样的工具,甚至某些部署系统中的置信度分数,在结构上都是破碎的,因为它们依赖于随文本长度自然增长的注意力机制。

2. 双路径框架:“什么”与“如何”

一旦研究人员去除了“长度把戏”,他们便问道:我们究竟该如何判断输入是否异常? 他们提出了一个两部分系统,就像侦探以两种不同的方式审视犯罪现场:

路径 A:“什么”(嵌入向量)

  • 类比:这就像查看汤的配料
  • 工作原理:它检查词汇表。如果汤里含有“有毒”词汇或“垃圾”关键词,该路径就会发出警报。
  • 何时有效:它在识别明显的赝品方面表现出色,例如标签上突然写着“毒药”的汤。
  • 何时失效:如果赝品汤使用了与真品完全相同的配料,只是混合方式怪异,它就会失效。例如,“越狱”提示词通常使用正常的词汇,但排列方式旨在欺骗人工智能。“配料检查器”看到正常词汇,便会说“一切正常”,从而错过了把戏。

路径 B:“如何”(处理轨迹)

  • 类比:这就像观察厨师烹饪汤的过程。
  • 工作原理:该路径不仅仅是查看最终的汤碗,而是观察厨师的手在烹饪过程的每一步(逐层)是如何移动的。它会问:“厨师切菜是否顺畅?他们是否突然惊慌失措地扔进食材?锅是否以奇怪的节奏晃动?”
  • 为何有效:即使配料(词汇)看起来正常,“越狱”提示词也会迫使人工智能厨师以奇怪、不自然的节奏进行烹饪。“如何”路径能捕捉到这种奇怪的烹饪风格。
  • 结果:该路径成功识别出了“配料”路径所遗漏的棘手“越狱”赝品,实现了更高的准确率分数(0.850,而旧方法接近随机水平)。

3. “交叉”发现

论文发现,没有任何一种方法能完美应对所有情况。这就像拥有两种不同类型的金属探测器:

  • 探测器 1(配料/嵌入向量):擅长在沙堆中发现隐藏的金币(明显的词汇变化)。
  • 探测器 2(烹饪风格/轨迹):擅长发现被涂成金色以假乱真的塑料硬币(微妙的结构把戏)。
  • 洞察:你需要两者兼备。当“赝品”仅仅是话题不同时,探测器 1 胜出。当“赝品”是利用正常词汇的巧妙把戏时,探测器 2 胜出。

4. “为什么”(机制证据)

研究人员并非凭空猜测;他们深入人工智能的“大脑”(电路)观察发生了什么。

  • 发现:当人工智能遇到“越狱”(一种结构性的把戏)时,它会产生一种特定的困惑:其“注意力”(聚焦)电路会失控,扰乱其焦点。
  • 对比:当人工智能遇到“仇恨言论”(一种词汇变化)时,点亮的是大脑中的“记忆”(MLP)部分,因为它识别出了那些坏词。
  • 结论:不同类型的“赝品”以不同的方式破坏人工智能。旧工具只查看了“聚焦”部分,并被长度所迷惑。新的“轨迹”工具观察整个烹饪过程,因此无论破坏发生在哪里,它都能察觉。

总结

该论文声称,许多当前的人工智能安全工具之所以失效,是因为它们被文本长度所欺骗。要解决这个问题,我们需要停止仅仅关注文本说了什么,转而开始观察人工智能如何处理它。通过逐步观察人工智能的“思维过程”(即轨迹),我们可以捕捉到那些表面上看起来正常、但对其内部机制而言感觉怪异的巧妙把戏。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →