← 最新论文
💬 NLP

Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces

该论文提出了首个基于真实世界数据的 OmniBehavior 基准,旨在评估大语言模型在长周期、跨场景及异构行为模拟中的能力,并揭示了现有模型因缺乏真实因果链条而导致的“乌托邦偏差”及个体差异缺失等结构性缺陷。

原作者: Jiawei Chen, Ruoxi Xu, Boxi Cao, Ruotong Pan, Yunfei Zhang, Yifei Hu, Yong Du, Tingting Gao, Yaojie Lu, Yingfei Sun, Xianpei Han, Le Sun, Xiangyu Wu, Hongyu Lin

发布于 2026-04-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiawei Chen, Ruoxi Xu, Boxi Cao, Ruotong Pan, Yunfei Zhang, Yifei Hu, Yong Du, Tingting Gao, Yaojie Lu, Yingfei Sun, Xianpei Han, Le Sun, Xiangyu Wu, Hongyu Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的“人工智能(AI)”做了一次全方位的“真人行为模拟”体检

简单来说,作者们发现现在的 AI 虽然很聪明,能写诗、能聊天,但如果让它假装成一个真实的人类用户,去模拟我们在快手(Kuaishou)上刷视频、看直播、买东西、和客服吵架的全过程,它其实演得很假

为了证明这一点,他们造了一个叫 OmniBehavior 的“考场”,并给 AI 们出了一道很难的题。

下面我用几个生动的比喻来拆解这篇论文的核心内容:

1. 以前的考试 vs. 现在的“大考”

  • 以前的考试(旧基准): 就像让 AI 做“填空题”。比如只问:“如果你看到一只猫的视频,你会点赞吗?”或者“如果你看到一双鞋,你会买吗?”
    • 问题: 这种考试太片面了。真实生活中,你买鞋可能不是因为看到了鞋,而是因为三天前看了个视频,昨天又搜了搜,今天又在直播间听主播聊了聊。以前的考试把人的行为切成了一个个孤立的碎片,AI 只要背答案就能拿高分,但这不代表它懂人。
  • 现在的“大考”(OmniBehavior): 作者们收集了快手平台上200 个真实用户整整3 个月的“生活日记”。
    • 内容: 这不仅仅是点赞,还包括了从看视频、搜东西、看直播、到买东西、甚至跟客服吵架的所有环节
    • 难度: 这就像让 AI 去演一部连续剧,而不是演一个小品。它需要记住你三个月前的喜好,理解你今天为什么突然想买那个东西,还要能模拟出你真实的性格(比如你是个大路货,还是个性格古怪的“长尾”用户)。

2. 考卷上的发现:AI 的“三个致命弱点”

作者把目前最顶尖的 AI(比如 GPT-5.2, Claude-4.5 等)拉来考试,结果发现它们普遍存在三个大问题:

弱点一:太“积极”了(Hyper-activity Bias)

  • 比喻: 真实的人类就像挑剔的食客,看到菜单可能只想“看看”,不想点菜,甚至想“退单”。但 AI 模拟出来的用户,就像饿极了的饕餮,看到什么都想“点赞”、“收藏”、“购买”。
  • 后果: AI 总是高估用户的活跃度。如果你用这种 AI 来预测谁会流失(不再用 APP),它会觉得“大家都挺开心的,没人会走”,结果导致误判。

弱点二:全是“好人卡”(Utopian Bias / 乌托邦偏差)

  • 比喻: 真实的人类在遇到商品质量问题或发货慢时,会生气、骂人、甚至威胁投诉。但 AI 模拟出来的用户,就像受过严格礼仪训练的机器人,无论多生气,说话都温文尔雅,满口“请”、“谢谢”、“不好意思”。
  • 后果: AI 模拟不出“冲突”和“负面情绪”。如果你用它来测试客服系统能不能处理愤怒的客户,它永远测不出来,因为它自己就是个“老好人”。

弱点三:大家都长得一样(Persona Homogenization / 人设同质化)

  • 比喻: 真实的人类世界是五彩斑斓的,有喜欢二次元的小张,有喜欢养花的李大妈,也有喜欢研究机械的老王。但 AI 模拟出来的人群,就像复制粘贴出来的,大家都变成了“平均人”——既喜欢这个又喜欢那个,性格温吞,没有棱角。
  • 后果: AI 抹杀了那些小众、独特的行为(长尾行为)。它无法模拟出那些真正有个性、行为怪异的真实用户。

3. 为什么 AI 会演砸?

论文指出,现在的 AI 就像是一个只看过“完美剧本”的演员

  • 训练数据偏差: AI 在训练时,被教导要“礼貌”、“有帮助”、“正能量”。所以它潜意识里觉得,模拟人类时,也要做一个“完美的、积极的、大家都喜欢的”人。
  • 缺乏因果链条: 真实的人类行为是有因果的(因为 A 所以 B,过了三天因为 C 又做了 D)。AI 虽然能读很长的文章(长上下文),但它很难理解这种跨越时间和场景的深层逻辑,它更像是在“猜”下一个动作,而不是在“推演”行为。

4. 这篇论文想告诉我们什么?

  • 别太迷信 AI 模拟: 如果你打算用 AI 来模拟真实用户,以此来做产品测试或市场分析,现在还不行。因为它模拟出来的世界太“假”、太“美”、太“平均”了,跟真实世界差距很大。
  • 未来的方向: 我们需要更真实的长周期、跨场景的数据(就像这篇论文提供的 OmniBehavior),并且要训练 AI 学会接受人类的“不完美”(学会生气、学会犹豫、学会做独特的自己)。

一句话总结:
这篇论文给 AI 泼了一盆冷水:现在的 AI 还学不会像真人一样“有血有肉”地生活,它们更像是一群穿着得体、永远微笑、但缺乏个性的“塑料模特”。 想要真正模拟人类,我们还需要更真实的“生活日记”和更聪明的训练方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →