← 最新论文
💻 computer science

OSCToM: RL-Guided Adversarial Generation for High-Order Theory of Mind

本文介绍了OSCToM,这是一种由强化学习引导的方法,通过生成观察者与自我冲突的场景,显著提升了大语言模型的心理理论推理能力,在信息不对称的FANToM基准测试中达到了76%的准确率,而此前方法仅为0.2%。

原作者: Sharmin Sultana Srishty, Kazi Mahathir Rahman, Malaika Parizat Sakkhi, Samia Shahid Prianna, Shaikhul Islam Sinat

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Sharmin Sultana Srishty, Kazi Mahathir Rahman, Malaika Parizat Sakkhi, Samia Shahid Prianna, Shaikhul Islam Sinat

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一出复杂的戏剧,演员们窃窃私语地交换秘密、藏匿物品,并假装知道他们其实并不知晓的事情。如今的大多数人工智能模型就像观众,能够完美地复述台词,却在剧情发生转折时感到困惑。它们可能会想:“哦,那个演员正拿着一个红球”,而实际上,那个演员只是在假装拿着红球以欺骗他人。

本文介绍了OSCToM,一种教导人工智能理解这些棘手“心理游戏”的新方法。以下将借助简单的类比,解析其工作原理。

问题所在:“读心”能力的差距

当前的人工智能模型擅长撰写故事,但在心理理论(Theory of Mind)方面却表现挣扎。这是人类理解他人拥有与我们不同的思想、信念和知识的能力。

这就像玩“传话”游戏。如果我告诉你一个秘密,而你又对第三个人撒了谎,一个聪明的人工智能应该知道:

  1. 事实真相是什么。
  2. 认为什么是真的。
  3. 第三个人认为什么是真的(即使他们是错的)。

过去对人工智能的测试就像简单的谜语。人工智能可以通过识别词语中的模式来猜出答案。但当故事变得复杂——例如,当一个观察者试图弄清楚另一个人第三个人的秘密在想什么时——人工智能就会迷失方向。

解决方案:OSCTO(“冲突”训练器)

作者们创建了一个名为OSCToM(观察者 - 自我冲突心理理论)的系统。其核心理念是,在观察者内心信念与其认为他人所持信念相冲突的故事中训练人工智能。

类比:想象一部间谍电影。间谍(观察者)知道保险箱是空的。但间谍也知道,反派认为保险箱里装满了黄金。间谍必须表现得好像保险箱是满的,以此欺骗反派。OSCToM 训练人工智能处理这种特定的心理周旋。

构建方法:“电子游戏”式 approach

团队没有手动编写成千上万个故事,而是构建了一个“游戏引擎”来自动生成这些故事。

  1. 规则书(扩展的 DSL):他们创建了一种特殊语言,充当游戏的规则书。它允许他们编程特定的“动作”,例如欺骗性定位(谎报物体位置)或单向镜(一个人看到了另一个人没看到的东西)。这使得他们能够构建包含多达四层“思考思考”的故事。
  2. 教练(代理模型):通常,训练人工智能编写这些故事需要超级计算机来评估每一句话,这既缓慢又昂贵。相反,团队训练了六个微小、快速的“迷你教练”(小型人工智能模型)。这些教练快速检查故事:有谎言吗?思维深度足够吗?时间线是否令人困惑? 这使得整个过程快了 6 倍
  3. 玩家(强化学习):他们使用了一个“玩家”人工智能(采用名为 DQN 的方法),反复进行游戏。它试图创造出最令人困惑、最棘手的故事,以愚弄测试模型。“迷你教练”因其使故事更具挑战性而给它加分。玩家由此学会创造完美的“烧脑”场景。
  4. 学生(两阶段训练):最后,他们利用这些棘手的故事训练了一个标准人工智能模型(Llama-3.1-8B)。他们并没有一开始就给它最困难的故事。
    • 第一阶段:他们教导它简单的谎言和基本的信念(就像孩子学习分享一样)。
    • 第二阶段:一旦它掌握了基础,他们就引入了复杂的、多层面的间谍故事。

结果:小而强大

结果是一个名为OSCToM-8B的模型。尽管它比许多其他著名的人工智能模型更小,但其表现却非常出色:

  • FANToM 测试:在一项涉及信息不对称(角色知晓的信息不同)的困难测试中,之前的最佳方法(ExploreToM)的正确率仅为0.2%。而 OSCToM-8B 的正确率达到了76%。这是一个巨大的飞跃。
  • 速度:旧方法就像试图逐一尝试每一块拼图来解谜(缓慢)。而 OSCToM-8B 就像看着盒子上的图片瞬间完成拼图。它在回答问题时的速度快了 5.7 倍
  • 效率:它仅用比那些大 3 到 4 倍的模型更少的计算资源(参数)就取得了这些成果。

核心结论

该论文声称,通过教导人工智能处理“观察者 - 自我冲突”(即你所知与你认为他人所知之间的冲突),并利用智能的自动化训练游戏,我们可以创造出更小、更快的人工智能模型,使它们在理解复杂的社会情境和欺骗行为方面表现得更好。

它未声称的内容:论文并未表示该人工智能现在可用于心理治疗、实时安全检测中的谎言识别,或理解人类情感(如爱或悲伤)。它严格专注于基于文本的场景中信念、知识和欺骗的逻辑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →