← 最新论文
💬 NLP

HORIZON: A Benchmark for In-the-wild User Behaviour Modeling

本文提出了名为 HORIZON 的新基准,该基准基于大规模跨域亚马逊评论数据,通过重构数据集、任务与评估体系,旨在推动能够应对真实世界长时序、跨域及泛化挑战的通用用户行为建模研究。

原作者: Arnav Goel, Pranjal A Chitale, Bhawna Paliwal, Bishal Santra, Amit Sharma

发布于 2026-04-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Arnav Goel, Pranjal A Chitale, Bhawna Paliwal, Bishal Santra, Amit Sharma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 HORIZON 的新“考试系统”,专门用来测试人工智能(AI)在理解人类行为方面到底有多聪明。

为了让你更容易理解,我们可以把现在的推荐系统(比如淘宝、抖音、Netflix 的推荐算法)比作一个**“读心术学徒”**。

1. 以前的“考试”为什么不够用?

在 HORIZON 出现之前,这些“读心术学徒”接受的训练和考试非常单一:

  • 场景太窄:就像只让学徒在“只卖鞋子的店里”练习。他学会了怎么猜你下一双鞋会买什么,但如果你突然想买书或者买厨具,他就完全懵了。
  • 时间太短:考试只问“你下一秒会买什么?”。这就像只考你明天的天气,完全不管下周、下个月甚至明年的趋势。
  • 题目太熟:考试用的都是学徒以前见过的“老顾客”。一旦来了个完全陌生的新顾客,或者顾客的兴趣突然变了,学徒就彻底失效了。

结果:这些模型在“模拟考”里分数很高,但一到了真实世界(跨领域、长周期、新顾客),就经常“翻车”。

2. HORIZON 是什么?(一场真正的“野外生存”大考)

HORIZON 就像是一个**“全能生存挑战营”**。它不再把学徒关在温室里,而是扔进了一个巨大的、真实的、混乱的“亚马逊丛林”(基于亚马逊的海量真实数据)。

这个挑战营有三个核心特点:

🌍 特点一:跨领域大冒险(Cross-Domain)

  • 比喻:以前学徒只会在“鞋店”工作。现在,HORIZON 要求他同时经营鞋店、书店、厨房用品店和乐器店
  • 挑战:学徒必须理解,一个喜欢买“瑜伽垫”的人,可能接下来会买“运动水壶”甚至“健康食谱”。他需要打通不同领域之间的隔阂,理解人是一个整体,而不是被分割成“买鞋的人”或“买书的人”。

⏳ 特点二:穿越时间的望远镜(Long-Horizon)

  • 比喻:以前的考试只问“明天穿什么”。HORIZON 问的是:“根据这个人过去 5 年的购物习惯,预测他未来 3 年的兴趣变化。”
  • 挑战:人的兴趣是会流动的。比如,一个人可能从“新手父母”变成“青少年家长”,兴趣从“婴儿奶粉”变成“乐高积木”。HORIZON 测试模型能否捕捉到这种长期的、缓慢的演变,而不仅仅是盯着眼前的下一秒。

🆕 特点三:面对陌生人(Unseen Users)

  • 比喻:以前的考试,考官会拿一个“老顾客”的档案给学徒,问“他下次买什么?”。HORIZON 则直接扔给学徒一个完全陌生的新顾客,甚至这个新顾客的数据是在“未来”产生的(训练数据是 2020 年之前的,测试数据是 2020 年之后的)。
  • 挑战:这测试的是学徒的举一反三能力。他能不能没见过这个人,就根据通用的行为规律猜出他的喜好?

3. 他们怎么考?(三种新题型)

为了全面测试,HORIZON 设计了三种不同的“考题”:

  1. 传统题(Next Item)

    • 题目:给你这个人的历史,猜他下一个会买什么。
    • 难点:不仅要看对,还要看他在面对“新时间”和“新顾客”时,是不是还能猜对。
  2. 翻译题(Query Reformulation)

    • 题目:让大语言模型(LLM)扮演“翻译官”。把用户杂乱无章的购物历史,翻译成 10 个精准的“搜索关键词”。
    • 比喻:就像用户心里想“我想买个能陪孩子玩又能学点东西的东西”,模型要把它翻译成“乐高积木”、“科学实验套装”等具体的搜索词。这测试模型是否真的用户的意图。
  3. 预言题(Long-Horizon Modeling)

    • 题目:让模型直接写故事。根据用户的历史,描述他未来 10 次可能感兴趣的东西是什么。
    • 比喻:这不再是猜一个具体的商品,而是画出一幅“用户未来生活轨迹”的草图。这非常难,因为要预测长期的变化。

4. 考试结果告诉我们什么?(令人震惊的真相)

论文作者把目前最流行的 AI 模型(包括那些很火的“大语言模型”)拉来参加了这场考试,结果发现:

  • 传统模型“偏科”严重:那些擅长猜“下一秒买什么”的模型,一旦面对“新顾客”或“新领域”,成绩就断崖式下跌。它们太依赖死记硬背(记住某个 ID 对应什么),而不理解背后的逻辑。
  • 大语言模型(LLM)也没那么神:大家以为大模型很聪明,能理解人类语言。但在 HORIZON 的考试里,它们的表现并不比传统模型好多少,甚至在某些长周期预测上表现平平。它们能写出漂亮的句子,但很难精准地猜中具体的商品。
  • 核心问题:目前的 AI 太擅长“在熟悉的圈子里打转”,一旦走出舒适区(遇到新时间、新领域、新面孔),就失去了方向感。

5. 总结:这篇论文的意义

HORIZON 就像是为 AI 行业立了一块**“试金石”**。

它告诉研究人员:别再只在“温室”里刷高分了。真正的智能,是能够理解复杂、多变、跨领域且随时间流动的人类行为。

这篇论文不仅提供了一个巨大的新数据集(5400 万用户,3500 万商品),更重要的是它重新定义了“好”的标准:一个优秀的推荐系统,不应该只是一个“猜谜高手”,而应该是一个能理解人类长期生活轨迹的“贴心伙伴”。

一句话总结
以前的 AI 像是在背“购物清单”,HORIZON 强迫它们去理解“人生剧本”,并发现目前的 AI 离真正读懂人类,还有很长的路要走。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →