← 最新论文
💬 NLP

Production and Perception in LLMs: A Token Probability Approach

本研究表明,大型语言模型在其标记概率分布中表现出明显的生成-感知不对称性,即仅凭提示词框架的改变,就会导致生成的文本与经重新评估的文本在似然度上产生显著差异,这一现象在多种模型架构中均有复现,并随着序列上下文的累积而逐渐衰减。

原作者: Anna Marklová, Jiří Milička, Martina Vokáčová, Rudolf Rosa

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Anna Marklová, Jiří Milička, Martina Vokáčová, Rudolf Rosa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人诗人。你要求它写一首关于刺猬的诗,它照做了。但这里有一个转折:这个机器人并不像人类那样先“思考”然后再“说话”。它使用完全相同的脑回路来阅读你写下的内容,并写回它自己的文字。这就像是一条单行道,车子使用同一个引擎进行双向行驶。

因为这个原因,科学家们好奇:这个机器人真的在“写作”和“阅读”之间存在区别吗? 还是说,这只是同一个过程的逆向过程?

重大发现:“角色扮演”效应

研究人员发现,是的,机器人的行为确实发生了变化,但这并不是因为它有了情感或意图。它的行为会根据提示词(Prompt)——即你要求它做某事的具体方式——而改变。

把机器人想象成一个体验派演员。

  • 场景 A(生成): 你说:“请写一首关于刺猬的诗。” 机器人戴上了“作家”帽。它开始生成单词,并为它挑选的每个单词分配一定的置信度(概率)。
  • 场景 B(感知): 你把机器人刚刚写的完全相同的诗拿过来,然后对它说:“这是一首关于刺猬的诗。请评价它。” 机器人戴上了“读者/评论家”帽。它不再生成新词,而是重新评估它所看到的词汇。

研究人员测量了机器人在这两种场景下,其“置信度”的变化程度。

结果: 当机器人从“作家”模式切换到“读者”模式时,它对单词的置信度发生了显著偏移。这种变化非常巨大。事实上,机器人“写”诗与“读”诗之间的差距,大约是两种不同写作请求方式之间差距的 1.8 倍

用数字来说:

  • 当机器人被要求以两种略微不同的方式写作时(例如,“写一首诗”对比“我想请你写一首诗”),它在选词上的差异微乎其微(约为 0.010)。
  • 但当它从写作切换到阅读时,这种差异跃升到了 0.034

这表明,仅仅是改变请求的“框架”——告诉机器人要做创造者还是评论家——就足以让它的内部数学运算发生变化,尽管它在执行这两项任务时使用的是相同的脑部组件。

机器人并没有在做的事情

论文非常明确地说明了这不是什么。

  • 不是因为机器人突然获得了人类般的意图或灵魂。机器人并不会真的“想要”去写或“想要”去读。
  • 不是因为机器人在其中一项任务上表现得更好。
  • 不仅仅是由特定提示词引起的偏差。研究人员通过使用四种不同的要求写诗的方式以及三种不同的要求评分的方式进行了测试。无论如何措辞,这种效应每次都会发生。

“第一印象”法则

关于这何时发生,还有一个很酷的细节。在“写作”与“阅读”之间的差异在诗歌的开头部分最为强烈。

想象一下,提示词就像是在比赛开始时大声喊出的指令。

  • 在开头(第 1–10 个 Token): “读者”的声音非常响亮,机器人的置信度发生了剧烈偏移。
  • 随着诗歌的进行: 机器人开始阅读它自己写的词。它正在讲述的故事(上下文)开始淹没最初的指令。“作家”模式与“读者”模式之间的差异随着诗歌的拉长而变得越来越小。

研究人员对这种衰减进行了建模,发现初始的“冲击”会逐渐消退,但即便到了结尾,仍保留着微小的差异。

他们有多确定?

团队并非凭空猜测;他们使用了 5 种不同的机器人模型(包括 Llama-3.1-8B、EuroLLM-9B 等)处理了 1,089 首不同的诗(约 93,000 个单词)。

  • 他们在所有五个模型中都发现了这种效应,包括“原始”基座模型和经过指令微调的助手模型。
  • 这种差异如此一致,以至于“写作”和“阅读”结果的范围完全没有重叠。

然而,作者也谨慎地指出,这表明存在功能性差异,并不代表机器人拥有类人的思维。他们指出,虽然这种差异在统计学上是真实且可衡量的,但我们尚不知道它是否“足够大”,以至于能意味着机器人真的像人类区分说话与倾听那样进行思考。

核心结论

这项研究表明,尽管大型语言模型在阅读和写作时使用同一个对称的引擎,但你如何与它们交流会改变它们处理文字的方式。

如果你告诉机器人去做诗人,它会以一种方式思考。如果你告诉它去做评论家,它会以另一种方式思考。这有点像变色龙:机器人的内部“色彩”(其概率分布)会发生偏移,以匹配你赋予它的角色,这证明了对话的上下文与词汇本身同样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →