← 最新论文
💬 NLP

HorizonBench: Long-Horizon Personalization with Evolving Preferences

该论文提出了名为 HorizonBench 的新基准,通过模拟 360 名用户在 6 个月内的自然对话及带真实依据的偏好演变数据,揭示了当前大模型在长周期个性化任务中因无法有效追踪用户状态更新而普遍表现不佳(最佳模型仅 52.8%)的核心瓶颈。

原作者: Shuyue Stella Li, Bhargavi Paranjape, Kerem Oktar, Zhongyao Ma, Gelin Zhou, Lin Guan, Na Zhang, Sem Park, Lin Chen, Diyi Yang, Yulia Tsvetkov, Asli Celikyilmaz

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuyue Stella Li, Bhargavi Paranjape, Kerem Oktar, Zhongyao Ma, Gelin Zhou, Lin Guan, Na Zhang, Sem Park, Lin Chen, Diyi Yang, Yulia Tsvetkov, Asli Celikyilmaz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 HORIZONBENCH 的新工具,它像是一个专门用来测试 AI“记性”和“悟性”的超长马拉松考试

简单来说,现在的 AI 聊天机器人很聪明,但它们有一个大毛病:它们记不住你几个月前说过什么,更记不住你的想法会随着生活变化而改变。

为了搞清楚这个问题,作者们设计了一套全新的测试方法。我们可以用几个生动的比喻来理解:

1. 核心问题:AI 是个“健忘且固执”的老朋友

想象一下,你有一个老朋友(AI 助手)。

  • 以前:你是个刚毕业的学生,喜欢听苏格拉底式的对话(也就是助手喜欢问你问题,让你自己思考,而不是直接给答案)。
  • 后来:你升职成了 CEO,每天忙得焦头烂额,需要的是直接、高效的建议,没时间听你慢慢思考。
  • 问题:当你再次和这位老朋友聊天时,如果你没明说“我现在变了”,他还会用以前那种“你想想看”的方式回答你。

这就是论文指出的“长期个性化”难题: AI 能记住你说过什么(检索),但它无法理解你的想法已经随着生活事件(如升职、失恋、搬家)而更新了(信念更新)。它总是抓着旧习惯不放。

2. 解决方案:制造一个“完美剧本”的模拟器

在现实生活中,我们很难知道 AI 到底是因为“没记住”还是因为“没更新”而犯错,因为没人能读心。

为了解决这个难题,作者们没有去偷看真实用户的聊天记录,而是自己造了一个“虚拟世界”

  • 导演(生成器):他们写了一个程序,像导演一样,先写好一个**“心理状态剧本”**。这个剧本详细记录了 360 个虚拟人物在 6 个月里的生活:他们什么时候失恋了,什么时候升职了,性格因此发生了什么变化。
  • 演员(AI 对话):然后,让 AI 根据这个剧本,和这些虚拟人物进行长达 6 个月的对话。
  • 上帝视角:因为剧本是导演写的,所以作者们确切知道每一个虚拟人物在每一刻的真实想法是什么。

这就像是在玩一个**“剧本杀”**,只有作者知道所有角色的真实心理变化,用来测试 AI 能不能跟上剧情。

3. 考试题目:HORIZONBENCH 长什么样?

他们从这些模拟对话中,提炼出了 4,245 道考题

  • 场景:题目通常是一个长达 6 个月的对话记录(大约 16 万字,相当于读了一整本长篇小说)。
  • 挑战:在对话的最后,用户问了一个问题。AI 需要从 5 个选项中选出最符合用户当前心情和偏好的回答。
  • 陷阱:其中有一个选项是**“过去的你”(比如你以前喜欢听故事,现在喜欢听干货,选项里有一个还在讲故事的)。如果 AI 选了那个,就说明它没跟上你的变化**,还活在过去。

4. 考试成绩:AI 们考得怎么样?

作者们找了 25 个目前世界上最顶尖的 AI 模型来参加考试。结果令人震惊:

  • 平均分极低:最好的模型只考了 52.8 分(满分 100),而大部分模型甚至不及格(低于 20 分的随机猜测线)。
  • 主要错误:当 AI 答错时,超过三分之一的情况是,它明明看到了你最近升职了,却依然固执地选择你“刚毕业时”喜欢的那种回答方式。
  • 比喻:这就像是你已经换了一辆法拉利,但你的导航系统还把你当成骑自行车的人,一直给你规划自行车道。

5. 核心发现:不是记性不好,是“悟性”不够

论文通过控制变量(比如缩短对话长度、把话说得更直白等)发现:

  • 即使对话很短,AI 依然会犯错。
  • 即使你把话说得很清楚,AI 依然会犯错。

结论:AI 缺的不是“记忆力”(能读长文),缺的是**“状态追踪能力”**(理解人的想法是流动的)。它们无法像人类一样,把“生活事件”和“性格变化”联系起来,自动更新对用户的认知。

总结

这篇论文就像给 AI 界敲响了一记警钟:现在的 AI 太“死板”了,它们像是一个拿着旧地图找新路的向导。

作者们发布的 HORIZONBENCH 就像是一个**“体检中心”,专门用来诊断 AI 是否具备“随着时间理解人类变化”的能力。只有通过了这个测试,未来的 AI 才能真正成为懂你、能陪你走过人生起伏的智能伴侣**,而不仅仅是一个只会翻旧账的聊天机器人。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →