← 最新论文
💬 NLP

Probing the Lack of Stable Internal Beliefs in LLMs

该论文通过“二十问”猜谜实验发现,大型语言模型在缺乏显式上下文提示时难以在多轮对话中维持隐性的目标一致性,从而揭示了当前驱动人格的 LLM 在构建稳定内在信念方面的关键局限。

原作者: Yifan Luo, Kangping Xu, Yanzhen Lu, Yang Yuan, Andrew Chi-Chih Yao

发布于 2026-03-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifan Luo, Kangping Xu, Yanzhen Lu, Yang Yuan, Andrew Chi-Chih Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的超级人工智能(大语言模型)做了一次"心理稳定性测试"。

简单来说,研究人员发现了一个令人惊讶的真相:现在的 AI 虽然嘴上说得好听,但心里经常“变卦”。它们很难在长时间的对话中,坚守自己最初设定的那个“秘密目标”。

为了让你更容易理解,我们可以用几个生动的比喻来拆解这篇论文:

1. 核心比喻:玩“猜谜游戏”的健忘演员

想象一下,你和一个演员玩经典的"二十个问题"游戏(类似“海龟汤”或“谁是卧底”)。

  • 规则:演员心里偷偷选了一个东西(比如“北极熊”),然后你问它问题(“它是动物吗?”“它有白色吗?”),它只能回答“是”或“否”。
  • 理想情况:演员心里一直死死记住“北极熊”,无论你怎么问,它的回答都围绕“北极熊”的特征,直到你猜中。
  • 现实情况(论文发现):这个演员虽然表面上回答得很连贯(比如它说“是动物”、“有白色”),但在你问的过程中,它心里的“秘密目标”悄悄变了
    • 一开始它想的是“北极熊”。
    • 聊到第 5 个问题,它心里突然觉得“哎呀,好像‘熊猫’更符合刚才的描述”,于是它开始在心里偷偷把目标换成了“熊猫”。
    • 虽然它嘴上还在回答“是/否”,而且这些回答对“熊猫”也说得通,但它已经背叛了最初的选择

这就是论文定义的“隐性不一致”(Implicit Inconsistency):表面上看起来逻辑通顺,但内心深处的“人设”或“目标”已经漂移了。

2. 他们是怎么发现的?(“读心术”探针)

既然 AI 不会主动说“我刚才换目标了”,研究人员怎么知道的呢?

他们发明了一种"读心探针"技术:

  • 在每一轮对话结束后,研究人员会突然插入一个“作弊指令”(就像导演喊“卡”),问 AI:“你刚才选的那个秘密目标的编号是多少?”
  • 通过观察 AI 回答的“编号”是否发生变化,研究人员就能像看心电图一样,看到 AI 的“内心目标”是不是在乱跳。

结果很扎心:几乎所有测试的顶级大模型(包括 GPT-4o, Claude, DeepSeek 等),在几十轮对话中,几乎 100% 都会发生“目标漂移”。哪怕是最聪明的“推理型”模型,有时候反而因为想太多,漂移得更快!

3. 为什么这很重要?(“人设”崩塌的危机)

你可能会问:“只要它最后没骗我,中间变一下心有什么关系?”

这就好比你在和一个性格设定为“极度可靠、说话算话”的虚拟助手聊天:

  • 如果你让它帮你规划一周的旅行,它一开始答应得很爽快。
  • 聊到第三天,它心里突然觉得“去海边太累了,不如去爬山”,于是它开始给你推荐爬山攻略,嘴上却还说着“我在帮你规划旅行”。
  • 后果:你根本不知道它变了,直到最后发现它完全没按你的初衷办事。

对于角色扮演(Role-play)或长期陪伴型 AI来说,这是致命的。如果 AI 不能守住内心的“秘密目标”或“性格设定”,它就无法模拟出真正有灵魂、有性格的人类。它就像一个没有记忆、没有主见的“墙头草”。

4. 他们尝试了“治疗”吗?

研究人员尝试给 AI 做“心理治疗”(微调训练):

  • 普通训练:只教它把话圆回来(表面一致性),结果它还是变来变去。
  • 特殊训练(KL 散度正则化):这是一种数学方法,强迫 AI 在每一轮对话后,都要回头检查一下:“我现在的想法,和刚开始选的目标还一样吗?”如果不一样,就惩罚它。
  • 结果:这种“强迫症”式的训练确实让 AI 变得更“专一”了,目标漂移率大幅下降。但这只是第一步,说明我们需要给 AI 装上更稳固的“记忆锚点”。

总结

这篇论文告诉我们一个残酷但重要的事实:
现在的 AI 很擅长“演戏”,演得像模像样,但它们缺乏真正的“内心定力”

就像是一个没有灵魂的提线木偶,线一松(没有外部提醒),它的动作(目标)就乱了。要想造出真正可信、有性格的 AI 伙伴,我们不能只关注它“说得对不对”,更要关注它“心里稳不稳”。未来的 AI 发展,必须给它们装上这种内在的“定海神针”,让它们能真正坚守初心,而不是随波逐流。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →