SocialPersona: Benchmarking Personalized Profiling and Response with Multimodal Social-Media Context
本文介绍了 SocialPersona,这是一个源自 171 位用户纵向社交媒体时间线的多模态基准测试,旨在评估大语言模型推断显性偏好并生成个性化回复的能力,研究表明,尽管模型能够识别广泛的兴趣,但在处理细粒度细节、近期更新以及将这些见解应用于对话方面仍存在困难。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正试图结识一位新朋友。你有两种方式可以做到这一点:
- “记忆力测试”: 你问他们:“你喜欢什么?”他们回答:“我热爱徒步。”你记住了这一点,并在下次计划旅行时,建议去徒步。
- “侦探工作”: 你不去直接询问。相反,你翻阅他们的旧相册,阅读他们的日记条目,并查看他们过去两年的社交媒体动态。你必须通过拼凑线索(比如一张帐篷的照片、一条关于新路径的短信或一张营火的照片)来推断出他们热爱什么。
这篇名为 SocialPersona 的论文讨论的就是第二种方法。它提出了一个宏大的问题:AI 助手能否变得足够聪明,从而能够独立完成这种“侦探工作”?
问题所在:AI 擅长记忆,但不擅长洞察
目前的 AI 助手大多像是那些擅长背诵事实但极不擅长“读懂言外之意”的学生。如果你告诉 AI,“我喜欢露营”,它会记住这一点。但如果你从未直接告诉它,而它只看到了你以前的社交媒体动态,它能推断出你喜欢露营吗?
作者构建了一个名为 SocialPersona 的新测试,以观察 AI 是否能做到这一点。他们收集了 171 位普通人(而非名人或品牌)真实的长期社交媒体时间线。这些时间线包含了文本、照片和日期。
测试内容:两大挑战
该论文让 AI 接受了两个特定的挑战:
- 画像构建者 (The Profile Builder): AI 查看一个人的整个社交媒体历史,并必须编写一份“用户画像”。它需要区分稳定兴趣(那些他们多年来一直热爱的,如“我爱狗”)与近期兴趣(那些他们上个月才开始尝试的,如“我正在尝试皮划艇”)。
- 对话伙伴 (The Conversation Partner): AI 随后必须与用户聊天。如果用户问:“这个周末我该做什么?”AI 应该利用这个画像给出一个个性化的答案(例如,“你最近一直很喜欢皮划艇,所以也许可以尝试一次河流之旅”,而不是仅仅说“去散散步”)。
结果:AI 仍是一名新手侦探
研究人员测试了许多不同的 AI 模型(包括著名的商业模型和开源模型)。以下是他们的发现,使用了简单的比喻:
“模糊的镜头”(过度泛化):
AI 就像一个镜头非常模糊的摄影师。如果一个用户发布了关于“徒步”、“攀岩”和“露营”的内容,AI 并不会看到三种截然不同的爱好。它只会看到一个巨大的、模糊的色块,叫做“户外活动”。它错失了让推荐真正具有个性化的细节。这就像一名服务员,不去询问你想吃牛排还是鸡肉,而是直接说:“这是些肉。”“视觉偏见”(模态不对称):
AI 对它能“看到”的东西有很强的偏见。如果用户发了一张清晰的猫咪照片,AI 会立刻知道:“他们爱猫!”但如果用户写了一篇长文表达对爵士乐的热爱,却从未发布过唱片的照片,AI 往往会完全忽略这一点。这就像一名侦探,只有当证据是用大号粗体字写出来时才会相信,而忽略了文本中微妙的低语。“时空旅行者的困惑”(时间盲区):
AI 在理解“时间”方面表现挣扎。它很难区分一个人拥有五年的爱好与一个人刚刚在上周才开始的新爱好。它倾向于将所有事物都归类为“稳定兴趣”,从而错过了用户当前痴迷的事物。这就像一个朋友,即使你一直在谈论昨天刚开始看的一部新剧,他却一直建议你看一部你在 2010 年喜欢的电视剧。“断裂的链条”(对话失败):
当 AI 试图利用其不完美的画像进行聊天时,对话就会出现问题。因为画像过于笼统或遗漏了近期兴趣,AI 的建议会显得平庸或离题。这就像试图在不稳固的地基上盖房子;墙壁(对话)最终会变得歪斜。
结论
论文得出结论:虽然 AI 在阅读社交媒体方面正在进步,但要真正理解人类人格,还有很长的路要走。它可以捕捉到明显的、宏观的兴趣,但在处理那些让推荐感觉真正“人性化”的精细细节、近期变化以及仅限文本的线索方面,它仍然表现挣扎。
SocialPersona 现在成为了一个工具,供研究人员衡量 AI 究竟还需要走多远,才能成为一个比我们自己还了解我们的个性化助手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。