← 最新论文
💬 NLP

Does Bielik Know What It Doesn't Know? Activation Dispersion Separates Entity Familiarity from Factual Reliability Across Model Scale

本文表明,尽管大语言模型拥有能够跨多种规模准确区分已知实体与虚构实体的内部激活信号,但这种“意识”并未转化为行为上的可靠性,因为模型经常对已知实体产生幻觉,且几乎从不拒绝回答,从而揭示了实体熟悉度与事实正确性之间存在根本性的脱节。

原作者: Grzegorz Brzezinka

发布于 2026-07-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Grzegorz Brzezinka

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文《Bielik 是否知道自己不知道?》(Does Bielik Know What It Doesn't Know?)的简单语言及类比解释。

核心问题

想象你正在问一个非常聪明、博学多才的机器人(AI)一个问题。你想知道:当机器人在谈论它真正了解的内容与它在胡编乱造时,它的内心“感觉”是否会有所不同?

研究人员想要观察,是否可以在机器人还没说完句子之前,通过窥探它的“大脑”(其内部计算机信号),来判断它是在自信地回答,还是准备开始“幻觉”(撒谎)。

实验过程:“波兰机器人”

团队测试了一个名为 Bielik 的波兰 AI 模型家族。他们让这些机器人回答关于四类事物的问题:

  1. 运动员(包括像莱万多夫斯基这样著名的、默默无闻的,以及虚构的运动员)。
  2. 城市(如华沙、小村庄、虚构的名字)。
  3. 作家音乐家

他们为每种类型设计了三类问题:

  • 已知(Known): 机器人肯定知道的著名事物。
  • 模糊(Obscure): 机器人可能从未听说过的真实事物。
  • 虚构(Fake): 听起来很真实的编造名字(例如“Roman Lewandowicz”)。

发现:“大脑光芒”

研究人员观察了机器人在读完问题之后、开始打字回答之前的内部电信号活动(称为“激活值”)。他们使用了两种简单的数学工具来测量这种大脑活动的“分散程度”或“聚焦程度”。

类比:图书馆 vs. 混乱的人群

  • 当机器人知道答案时: 想象一位图书管理员径直走向特定的书架,拿起一本特定的书,然后把它拿到柜台前。这种活动是聚焦且集中的。
  • 当机器人不知道(或在胡编乱造)时: 想象一群混乱的人群在图书馆里乱跑,触摸随机的书架,并向四面八方大喊大叫。这种活动是分散且混乱的。

结果:
这些数学工具可以以 95% 到 100% 的准确率区分出“专注的图书管理员”和“混乱的人群”。

  • 这对各种规模的机器人(从 15 亿参数的小模型到 110 亿参数的大模型)都有效。
  • 这对所有类型的主题(运动员、城市等)都有效。
  • 它是即时的,只需看一眼大脑活动,无需额外的测试。

代价:
机器人的大脑知道它不知道答案,但它并没有说出来。它只是继续在那儿滔滔不绝。

两种不同的“增长曲线”

这是论文中最令人惊讶的部分。研究人员发现,随着机器人的规模变大,两件事发生的速率不同:

  1. 感知“我不知道”(大脑信号):

    • 即使是最小的机器人(1.5B)也拥有完美的“我不知道”的大脑信号。当被问及一个虚构人物时,它能立刻察觉。
    • 增大机器人的规模并没有改变这一点;它已经达到了顶尖水平。
  2. 给出正确答案(行为表现):

    • 最小的机器人在给出正确事实方面表现很差。它会瞎猜,并且猜错。
    • 随着机器人变得更大,它们给出正确事实的能力就越强。最大的机器人(11B)要准确得多。

类比:
想象一个学生正在参加考试。

  • 小个子学生: 知道自己在瞎猜(大脑很紧张),但还是写下了一个错误的答案。
  • 大个子学生: 知道自己在瞎猜(大脑很紧张),同时也已经学到了足够的知识,从而能写出正确的答案。
  • 差距: 小学生的脑子知道自己在瞎猜,但他的嘴巴仍在胡言乱语。大个子的脑子知道,而他的嘴巴终于说出了事实。

“拒绝回答”的问题

研究人员检查了机器人是否会说“我不知道”并停止回答。

  • 2,520 个回答中,机器人仅有 两次 拒绝回答。
  • 尽管它们的大脑在尖叫着“这是假的!”(确定度达 99%),但它们的嘴巴仍在编造故事。
  • 只有最大的机器人偶尔会拒绝回答,即便如此,这种情况也非常罕见。

这意味着什么(用简单的话说)

  1. 我们可以检测谎言: 我们可以为 AI 构建一个简单的“测谎仪”,通过检查它说话前的脑部活动。如果大脑活动看起来很“分散”,那么 AI 很可能在胡编乱造。
  2. 这与规模无关: 意识到自己在瞎猜的能力在小型模型中就已经存在了。而真正掌握事实的能力则需要更大的规模和更多的训练。
  3. AI 是固执的: AI 知道自己在瞎猜,但它不会停下来。这就像一个人在玩扑克时明明知道自己在虚张声势,但因为程序设定要求必须给出答案,所以依然继续玩下去。

总结

论文证明了 AI 模型拥有一种清晰的内部信号,提示:“我从未见过这个东西。” 这个信号是完美的,且能即时生效。然而,模型非常不擅长听从这个信号并停止胡编乱造。它们知道自己不知道,但它们依然会继续说话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →