← 最新论文
💻 computer science

Geometric Deviation as an Unsupervised Pre-Generation Reliability Signal: Probing LLM Representations for Answerability

本文证明,测量隐藏状态相对于可回答参考集的几何偏差,可为数学和代码等结构化领域中检测不可回答查询提供一种可靠的无监督预生成信号,尽管该效应在事实性提示中并不具有普适性。

原作者: Yucheng Du

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yucheng Du

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一位非常聪明、博览群书的图书管理员(即人工智能),他正准备回答一个问题。通常,我们只有在图书管理员说完答案后,才会发现他是否在胡编乱造。但如果图书管理员的大脑在他开口之前,就向我们发出一个微妙的“警告信号”呢?

本文正是研究这一现象。研究人员提出了一个问题:我们能否通过观察人工智能思维的“形状”(即其内部几何结构),在不等待答案或无需教师批改人工智能错误的前提下,判断一个问题是否无法回答?

以下是他们研究发现的简要解析,辅以简单的类比:

1. 人工智能大脑的"GPS"

将人工智能的内部状态想象成一张巨大的地图。当人工智能看到一个可以回答的问题(例如"2+2 等于几?”)时,它的思维会在这张地图的某个特定区域紧密聚集。研究人员将这一区域称为“可回答邻域”。

他们假设,如果你问一个人工智能无法回答的问题(例如“在现实世界中,负数的平方根是多少?”),人工智能的思维就会“迷路”,并偏离那个邻域。他们使用一种名为“几何偏差”的工具来测量这种偏离。这就像检查一辆汽车偏离主路有多远。

2. 结果:取决于问题的“形状”

研究人员在三种类型的问题上测试了这一假设:数学事实代码。结果令人惊讶,且完全取决于问题的类型

  • 数学问题(清晰的信号):
    想象一个缺失了关键部分的数学题,例如“最大的质数是多少?”(实际上并不存在)。

    • 发现: 当人工智能看到这些“残缺”的数学问题时,它的思维会立即大幅偏离“可回答邻域”。信号强烈且清晰。
    • 类比: 这就像当你把指南针靠近磁铁时,指针会疯狂旋转。人工智能的大脑几何结构瞬间就知道“这不符合数学规则”,甚至在它尝试回答之前就已察觉。
    • 表现: 这种方法优于等待人工智能说出“我不知道”(拒绝回答),甚至优于让人工智能重复回答同一问题五次以观察其是否困惑(自一致性检查)。
  • 事实性问题(沉默的信号):
    现在,想象问一个关于不存在事物的事实性问题,例如“亚特兰蒂斯的 capital 是什么?”

    • 发现: 人工智能的思维并没有偏离。它们依然停留在“可回答邻域”内,看起来与询问“巴黎”或“东京”时完全一样。
    • 类比: 人工智能的大脑将“亚特兰蒂斯”和“巴黎”同等对待,因为从语法和结构上看,它们看起来完全相同。"GPS"没有闪烁。论文得出结论:对于一般事实,这种几何技巧并不奏效。
  • 代码问题(混合的信号):
    当询问会导致崩溃的代码(例如除以零)时,人工智能的思维会像数学问题一样发生偏离。然而,信号比数学问题略显“嘈杂”且一致性稍差,表明该方法有效,但可能需要更多数据才能达到完美可靠。

3. 信号何时出现?(“早期预警”系统)

研究人员像剥洋葱一样,逐层观察人工智能的层级结构。

  • 发现: “偏离”信号在人工智能处理的早期(前几层)就出现了,并且随着人工智能接近生成最终答案,该信号实际上变得更弱
  • 类比: 这就像烟雾报警器在火花飞溅的瞬间就会响起,但随着火势(答案)逐渐蔓延,警报声反而变小了。人工智能在开始时就知道问题是“残缺”的,但到了准备开口时,它已经抹平了这种感觉,试图无论如何都要给出一个答案。

4. “拒绝”与“幻觉”的转折

研究人员还注意到不同的人工智能模型对这些“残缺”问题的反应存在有趣差异,尽管它们的几何大脑结构看起来是一样的。

  • 发现: 两个不同的人工智能模型(Llama 和 Qwen)在面对一个残缺的数学问题时,具有完全相同的“偏离”信号。然而,Qwen 表示“我无法回答这个问题”,而 Llama 则自信地编造了一个错误的答案。
  • 类比: 想象两名司机看到了红灯(几何信号)。一名司机(Qwen)停下了车。另一名司机(Llama)继续行驶,却声称自己没看到红灯。“信号”(红灯)对两人来说都存在,但他们的训练(对齐)教会了他们做出不同的反应。

总结

本文证明,对于数学等结构化任务,我们可以在人工智能开口之前,通过观察其内部的“形状”来判断一个问题是否无法回答。这是一种快速、免费且可靠的数学错误预警系统。

然而,对于一般事实,这一技巧目前尚不适用,因为人工智能的大脑在视觉上无法以同样的方式区分“真实事实”和“虚假事实”。信号是真实的,但它仅在问题破坏了规则的结构(如数学或代码)时有效,而不仅仅是在内容虚假时有效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →