← 最新论文
💬 NLP

Before the First Token: Scale-Dependent Emergence of Hallucination Signals in Autoregressive Language Models

该研究揭示了大语言模型中幻觉信号的规模依赖性涌现规律,指出仅当模型参数超过约 10 亿且经过指令微调后,才会在生成首个 token 之前出现显著的事实性检测信号,而单纯扩大模型规模或仅依赖基座模型则无法形成此类预生成承诺编码。

原作者: Dip Roy, Rajiv Misra, Sanjay Kumar Singh, Anisha Roy

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Dip Roy, Rajiv Misra, Sanjay Kumar Singh, Anisha Roy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇文章就像是在给大语言模型(AI)做了一次"心理 CT 扫描",试图回答一个核心问题:AI 在决定“撒谎”(产生幻觉)之前,它的脑子里到底发生了什么?这个“撒谎的念头”是在什么时候冒出来的

为了让你更容易理解,我们可以把 AI 想象成一个正在写作的学生,把它的内部运作机制想象成大脑里的神经元活动

1. 核心发现:撒谎的“预谋”信号

以前大家认为,AI 只有在开始输出文字(比如第一个字写出来)之后,我们才知道它是不是在胡编乱造。但这篇论文发现了一个惊人的秘密:

对于足够聪明的 AI(大模型)

  • 比喻:想象一个学生在考试。
    • 小模型(4 亿参数以下):就像是一个还没学会怎么思考的小学生。他拿起笔,边写边想,甚至写到一半才发现自己编错了。在他动笔之前,他的脑子里没有任何“我在撒谎”的信号。如果你在他动笔前检查他的脑电波,你什么也看不出来,就像他在发呆一样。
    • 大模型(10 亿参数以上,且经过指令微调):就像是一个受过严格训练的高材生。在动笔写下第一个字之前,他的大脑里已经形成了一个清晰的“计划”。如果这个计划是编造事实,他的脑电波在动笔前(第 0 个位置)就会显示出一种特殊的“紧张信号”。这个信号非常强,强到我们可以提前 0.1 秒就发现:“嘿,这家伙要开始编故事了!”

2. 规模效应:不是越大越好,而是要“会教”

论文做了一个非常有趣的对比,就像是在比较两个同样聪明的学生:

  • 学生 A(Pythia-6.9B):有 69 亿个参数(非常聪明),但他只读过书(预训练),没上过“如何回答问题”的课。
    • 表现:即使他很大,他的脑子里也没有那种“动笔前就决定撒谎”的信号。他的思维过程是混乱且平铺直叙的,直到写出来你才知道他是不是在撒谎。
  • 学生 B(Qwen2.5-7B):也有 70 亿个参数,但他不仅读过书,还经过了严格的“指令微调”(就像老师教他如何准确回答问题、如何区分事实和虚构)。
    • 表现:他展现出了完美的“预谋信号”。在动笔前,他的大脑就已经明确区分了“我要讲真话”还是“我要编故事”。

结论:光有“大脑容量”(参数多)是不够的,“教育方式”(指令微调)才是关键。只有经过特殊训练,AI 才会学会在输出前“自我审查”并留下痕迹。

3. 我们能做什么?(检测 vs. 阻止)

这篇论文还做了一个实验:既然我们能在 AI 动笔前发现它要撒谎,那能不能直接“按住”它,让它别撒谎?

  • 结果不行
  • 比喻:这就像是你通过监控摄像头发现一个小偷在进门前就已经有了“我要偷东西”的表情(检测成功)。但是,你试图通过某种手段直接改变他的表情(干预),却发现完全没用。他还是会走进门去偷东西。
  • 原因:这个“撒谎信号”只是大脑活动的一个副作用(就像发烧是生病的症状,但退烧药治不好病根),而不是导致撒谎的开关

这意味着什么

  • 好消息:对于大模型,我们可以在它输出任何错误信息之前就把它拦截标记出来(比如:“警告:该回答可能包含幻觉”)。
  • 坏消息:我们无法简单地通过“修改大脑信号”来强行让它说出真话。如果它决定撒谎,我们只能阻止它输出,而不能让它瞬间变成诚实的。

4. 给普通人的实用建议

根据这项研究,如果你要使用 AI,应该根据模型的大小采取不同的策略:

  1. 如果你用的是小模型(比如手机上的小助手):

    • 别指望它能自我反省。它连“我在撒谎”的信号都没有。
    • 对策:不要依赖它,必须人工检查,或者给它配上外部知识库(RAG),让它去查资料而不是靠脑子想。
  2. 如果你用的是经过微调的大模型(比如现在的 Chatbot):

    • 可以提前预警。在它们生成第一个字之前,系统就能通过内部信号判断它是否靠谱。
    • 对策:建立“防火墙”,一旦检测到那个“撒谎信号”,直接拦截,不让用户看到错误信息。
  3. 如果你用的是那种“只读过书没受过训”的大模型

    • 小心陷阱。它虽然大,但可能没有那种“预谋信号”。
    • 对策:不要只看它内部在想什么,要看它输出的内容本身是否自信(虽然这也不完美)。

总结

这篇论文告诉我们:AI 的“谎言”是有迹可循的,但这个痕迹只在“受过良好教育”的大模型中,在它们“动笔之前”才会出现

这就好比,只有受过严格训练的特工,在决定执行任务前才会露出特定的微表情;而新手特工则是边做边想,直到做完你才发现他搞错了。虽然我们能提前发现这个微表情(检测),但我们还无法直接控制他的行动(阻止),所以最好的办法是在错误发生前就把它挡在门外

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →