Graded Entity-Familiarity Readouts in Language Models: Polish Adaptation, Cross-Language Robustness, and Refusal Steering
本文表明,语言模型(尤其是针对波兰语进行过适配的模型)拥有对实体熟悉度的分级内部读数,这种读数对提示词语言具有鲁棒性,并且可以被有效地引导以控制拒绝行为,尽管这些生成前的信号与管理最终弃权决策的策略仍然是截然不同的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机器人的内心独白:它何时知道自己不知道?
想象一下,你正在问一个非常聪明的机器人一个问题。有时,机器人知道答案并自信地开口;其他时候,它可能会编造一个故事,因为它实际上并不知道真相,这种错误我们称之为“幻觉”。科学家们长期以来一直在思考:机器人在开始打字之前,能否分辨出“我知道这个”和“我在瞎猜”之间的区别?
要理解这一点,我们需要观察机器人的大脑内部,它的内部是由被称为“激活值”(activations)的数学连接层构成的。把这些激活值想象成人类大脑在看到一张脸时的电信号。如果你看到的是一位朋友,信号会很强且明确;如果你看到的是一个陌生人,信号则会较弱或模糊。研究人员发现,这些电信号通常包含一个隐藏的“信心计”。如果机器人被问及它在训练数据中见过多次的事物,其信号看起来会与被问及完全虚构的事物时有所不同。核心问题是:我们能否通过读取这个计数器,在机器人说出第一个字之前就阻止它撒谎?
波兰侦探与“熟悉度”计
这篇论文就像是一个侦探故事,但作者格热戈日·布热津卡(Grzegorz Brzezinka)调查的不是犯罪,而是十二个不同的 AI 模型对波兰姓名和地名的“感觉”。其目标是观察这些模型是否内置了一个“熟悉度计”,用以告知它们对某个实体的了解程度,以及这个计是否在问题以不同语言提问时依然有效。
实验设置:波兰姓名的图书馆
为了测试这一点,作者构建了一个包含 1,440 个波兰实体的特殊测试集。想象一个拥有四个部分的图书馆:运动员、城市、作家和音乐家。在每个部分中,既有超级名人(如维基百科浏览量前 10% 的人物),也有默默无闻的当地人(最后 10%)。至关重要的是,作者还发明了 240 个听起来和看起来完全像真实波兰姓名的虚假姓名。这是对照组:如果机器人被虚假姓名搞混了,它就是一个骗子;如果它能分辨出来,它就是诚实的。
发现 1:计数器是调光器,而非开关
第一个重大发现是,熟悉度不仅仅是一个开关(开/关),它是一个调光器。研究发现,对于专门针对波兰语优化的模型(如 Bielik 和 PLLuM 系列),随着实体知名度的提高,“熟悉度得分”会平滑上升。
- 类比: 想象一个音量旋钮。对于一位超级著名的歌手,旋钮拧到了最大;对于一个地方乐队,旋钮在中间;对于一个虚构的名字,旋钮在零位。
- 惊喜: 这种“调光”效应在经过波兰语优化的模型中比在大型通用模型(如 Gemma-4 或 Qwen3)中要强得多。尽管通用模型规模更大(拥有更多参数),但它们的熟悉度计并不更好。事实证明,专门学习波兰语对于这项技能的重要性高于单纯扩大模型规模。经过波兰语优化的模型在流行度与内部置信度之间表现出清晰的相关性(在 0.28 到 0.57 之间),而其他模型的这一数值几乎为零。
发现 2:计数器跨越语言工作
作者随后提出了一个棘手的问题:这个计数器读到的是波兰语单词,还是实际的实体?为了测试这一点,他们用英语(“Who is...?”)而不是波默兰语(“Kim jest...?”)来询问关于一位著名波兰运动员的问题。
- 结果: 计数器几乎没有波动。模型在切换语言时保留了 96% 到 101% 的准确度。这表明机器人不仅仅是在识别波兰语语法,它实际上是在识别问题中的那个人,无论使用哪种语言来询问。
发现 3:我们可以“黑掉”拒绝按钮
这是故事中最具戏剧性的部分。其中一个模型 Gemma-4-12B 有一个习惯,即在不确定时会说“我不知道”(拒绝)。作者决定看看是否可以通过“操控”机器人的大脑来控制这种行为。
- 实验: 他们发现模型大脑中有一个代表“熟悉度”的特定数学方向。通过在这个方向上施加一个微小的推动,他们可以迫使机器人改变主意。
- 神奇之处:
- 如果他们推动机器人对一位名人感到不那么熟悉,拒绝率从 24% 飙升至 100%。机器人突然决定它不知道答案,尽管它其实知道。
- 如果他们推动机器人对一个虚假姓名感到更熟悉,拒绝率从 73% 降至 0%。机器人开始自信地为不存在的人编写传记。
- 启示: 这证明了熟悉度信号不仅仅是一个被动的观察结果,它是一个因果杠杆。如果你按下“熟悉度”按钮,机器人决定开口说话还是保持沉默,其决策会立即发生变化。
发现 4:“起飞前”检查
最后,论文提出了一个问题:我们能否利用这个计数器在机器人生成答案之前阻止它撒谎?
- 对比: 作者将他们的“单次通过”计数器(在生成答案前检查问题)与其他等待答案完成后再检查错误的方法进行了对比。
- 结论: “起飞前”计数器在识别虚假姓名方面表现出色,击败了几乎所有其他方法。然而,预测答案是否会在事实上有误则更为困难。该计数器在波兰语模型上效果良好,但对于那个会拒绝回答的模型(Gemma-4),结果却很复杂,因为模型自身“不知道”的习惯干扰了错误计数。
- 大局观: 研究得出结论,虽然机器人的大脑中确实包含一个渐进的熟悉度信号,但并非所有机器人都会利用它来决定是否发言。波兰语模型拥有该信号但从不拒绝回答;Gemma 模型会拒绝回答,但其信号不够精确。论文建议,我们可能需要构建一个外部的“守门员”,去读取这个信号,并决定机器人应该回答还是去查找信息,特别是针对那些冷门的、长尾的问题。
为什么这很重要
这项研究表明,AI 模型对于自己知道什么拥有一种隐藏的“直觉”,而且我们可以读取它。这不仅仅是关于让模型变得更大,更是关于如何训练它们。如果我们能教会模型信任这种内在的计数器,或者建立能够倾听它的工具,我们或许就能阻止它们对从未见过的事物自信地信口开河。这是朝着让 AI 不仅更聪明,而且在其局限性面前更加诚实迈出的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。