← 最新论文
🤖 AI

Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces

本文提出了一种逆向心理理论(IToM)流水线,该流水线利用大语言模型驱动的反事实推理和溯因推理,从浏览交互中重建用户信念并生成结构化人格,证明了其在预测用户特征方面的卓越准确性,并能在包括 VisionOS 在内的各类应用中实现动态、模态无关的内容推荐。

原作者: Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图猜你的朋友晚餐想吃什么。如果你只看到他们点击了一次披萨广告,你可能会想:“啊哈!他们热爱披萨!”但如果他们只是在比较价格呢?或者他们可能是在为别人挑选礼物?在计算机的世界里,这就是我们构建“推荐系统”时面临的大问题。这些系统是那些向你推荐电影、歌曲或产品的智能算法。传统上,它们就像一个只负责统计你点击了多少次按钮的统计学家。它们看到了行为(点击),却不理解行为背后的“为什么”。它们不知道你点击是因为你喜欢这个物品,是因为你感到无聊,还是因为你被搞糊涂了。

为了解决这个问题,科学家们开始研究心理学中的一个概念,叫做“心智理论”(Theory of Mind)。把这想象成一种能够想象他人脑中正在发生什么的能力——他们的信念、目标和秘密。通常,计算机试图利用这一点来预测你根据其认为你想要的东西,下一步会做什么。但这篇论文颠覆了这一逻辑。它提出了一个问题:如果我们能倒过来思考呢?如果我们不只是猜测未来,而是通过观察你过去的点击行为,进行一种“逆向侦探工作”,从而弄清楚你究竟是一个怎样的人呢?这就是核心思想:将杂乱无章的日常数字足迹,转化为一个关于个人性格的丰富且可理解的故事,而无需向他们询问任何调查问卷。

这项研究背后的研究人员来自摩根大通(JPMorgan Chase),他们提出了一种名为“逆向心智理论”(Inverse Theory of Mind,简称 IToM)的新方法。把它想象成一家数字侦探社。系统不仅仅记录你点击了一双跑步鞋,它还会问:“好吧,当你点击时,屏幕上出现了什么?还有哪些其他的鞋子?为什么你选择了这些而不是其他的?”通过重建决策的精确瞬间,该系统使用一种强大的人工智能(大语言模型)进行逆向推理。它会生成一系列解释你行为的“信念”,例如:“这个人看重耐用性而非款式,”或者“他们是一个在购买前会仔细阅读评论的谨慎研究者。”

奇迹发生在这里:系统并不仅仅选择一个猜测。它知道人类的行为是复杂的。也许你买这双鞋是因为你热爱跑步,或者也许是因为它们在打折,而你正好需要一份礼物。为了处理这种不确定性,AI 创建了多个不同版本的性格画像,就像一个侦探团队,每个人都提出了不同的理论。然后,它会将所有这些理论仔细地加权整合。如果证据充分,它会倾向于某个特定的理论;如果证据薄弱,它就会采取稳妥的做法,倾向于对大多数人普遍适用的规律。这防止了 AI 做出荒谬的刻板印象猜测(比如假设每个谨慎的购物者都是焦虑的内向者)。

团队使用了一个特殊的亚马逊购物环节数据集测试了这个想法,该数据集不仅包含了点击行为,还包含了人们实际看到的页面,以及至关重要的、购物者实际参加过的访谈和性格测试。他们发现,他们的“逆向侦探”人格画像表现得非常出色。事实上,在某些测试中,AI 对用户性格的猜测与用户实际参加的性格测试结果一样好,甚至更好。他们证明了这些 AI 生成的画像可以预测用户的下一步行为、他们会喜欢哪类产品,甚至预测他们会对有关购物习惯的问题如何回答。

或许最令人兴奋的部分在于,这些画像不仅仅是隐藏在计算机里的数字。它们是用通俗易懂的人类语言编写的。这意味着计算机可以利用从二维网页浏览中构建出的画像,去设计一个用于未来主义头显(如 Apple Vision Pro)的三维界面。例如,如果 AI 判定你是一个“预算有限的规划者”,它可以自动调整一个三维银行应用,将你的储蓄目标放在最显眼的位置,同时隐藏花哨的投资邀约。这篇论文表明,这种方法弥合了简单的点击追踪与深层人类理解之间的鸿沟,提供了一种构建更智能、更具同理心的交互界面的方式,使其能够适应“我们是谁”,而不仅仅是“我们点击了什么”。然而,作者也谨慎地指出,虽然结果令人鼓舞,但该系统仍有局限性;它在处理大量数据时表现最好,有时在完美预测极端性格特征方面仍有困难,这表明虽然这个“逆向侦探”已经做得相当出色,但仍有学习的空间。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →