← 最新论文
💬 NLP

The Story Shapes the Agent: Narrative Priors in LLM Behavior

本文表明,任务的叙事框架对大语言模型智能体行为的影响显著强于所分配的角色设定,这揭示了“叙事先验”驱动着系统性的行动倾向,而有效的跨叙事迁移则依赖于将指令锚定在具体的行动而非抽象的描述之上。

原作者: Yixuan Wang, James Lester, Shashank Srivastava

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Yixuan Wang, James Lester, Shashank Srivastava

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家规模宏大、高科技剧团的导演。你的演员们非常聪明,但他们也是等待剧本的白纸。在人工智能的世界里,这些演员就是大型语言模型(LLM),而我们用来引导其行为的“剧本”被称为人格设定(persona)。人格设定就像是一个角色描述:你可能会告诉人工智能:“你是一位热爱寻找线索的严谨侦探,”或者“你是一位通过交谈来学习的健谈朋友。”长期以来,开发者们一直认为,如果给人工智能一个强烈的人格,那么无论它在做什么工作,这个性格都会保持不变。他们认为“角色”是最重要的。但这里有一个转折:每一项工作也都自带一个故事或背景。这位侦探是在一座阴森的大宅子里调查谋杀案吗?还是同一位侦探正在技术办公室里修理一台损坏的电脑?或者他们是在热带实验室里调查一种奇怪的病毒?研究人员想要回答的核心问题很简单:当人工智能进入一个新的故事时,它的人格会保持不变,还是故事本身会接管并改变它的行为方式?

这篇题为《故事塑造智能体》(The Story Shapes the Agent)的论文,深入探讨了那个谜团。研究人员设计了一个巧妙的实验,使用了三个在表面上看起来完全不同、但本质上完全相同的“游戏”。你可以把它想象成三款不同的电子游戏:一款是医疗谜题,一款是电脑维修工作,还有一款是经典的谋杀悬疑案。尽管这些故事完全不同,但游戏的规则是完全一致的。在每场游戏中,玩家都有四个相同的动作:他们可以阅读文档、与人交谈测试事物(比如进行一次诊断或实验室测试),或者移动。研究人员将相同的 10 种不同“人格”赋予了三个不同的 AI 模型,让他们去玩这三种游戏,从而创造了近 2,000 个独特的会话。

结果令人大吃一惊。研究人员发现,故事(叙事)才是真正的老板,而不是人格。事实上,故事对 AI 行为的解释程度比分配的人格设定要高出 5 到 31 倍。如果你告诉一个 AI 要“社交且健谈”,它在谋杀悬疑案中会表现得如此,但在电脑维修游戏中,由于“修理技术设备”的故事背景,它会忽略他人,转而专注于阅读手册。人工智能并不是在调整自己的人个,而是在陷入“叙事先验”(narrative priors)的陷阱。这些先验就像是 AI 在接受训练期间从读过的书籍和电影中学到的隐形习惯。当故事听起来像是在医院时,AI 就会表现得像个医生(与人交谈);当故事听起来像犯罪现场时,AI 就会表现得像个侦探(进行测试)。

最关键的一点在于:这些由故事驱动的习惯往往会让 AI 的表现变得更差。在三个故事中的两个,AI 对环境的“自然”反应实际上损害了它获胜的机会。研究人员还发现,某些人格确实能够在不同的故事中保持一致,但前提是它们建立在**行为锚点(behavioral anchors)**之上。这些是具体的、基于行为的指令,例如“我倾向于交谈”(这直接关联到了“交谈”这一动作)。如果一个性格是用模糊、抽象的词汇描述的,比如“我是一个具有大局观的思想家”,那么一旦故事发生变化,人工智能就会完全忘记这条指令。为了证明这一点,他们拿出了一个表现良好的性格,去掉了那些具体的动作词汇,并将其改写得听起来很高级但很空洞。结果是,人工智能的一致性下降了 95%。

所以,结论是什么?如果你希望人工智能在不同情况下表现得一致,你不能仅仅给它一个酷炫的人格描述。你必须给它与它所拥有的工具相匹配的、具体的、基于动作的指令。围绕任务展开的故事力量强大到足以重写剧本;除非你将指令扎根于具体的动作之中,否则人工智能会让故事接管方向盘。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →