← 最新论文
🤖 AI

OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization

本文介绍了 OmniSapiens-7B 2.0,这是一种用于社会行为处理的基础模型,它利用一种新颖的异质性感知相对策略优化方法来有效地从多样且不平衡的行为数据中学习,从而在多个任务和基准测试中实现了最先进的性能和一致的推理能力。

原作者: Keane Ong, Sabri Boughorbel, Luwei Xiao, Chanakya Ekbote, Wei Dai, Ao Qu, Jingyao Wu, Rui Mao, Ehsan Hoque, Erik Cambria, Gianmarco Mengaldo, Paul Pu Liang

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Keane Ong, Sabri Boughorbel, Luwei Xiao, Chanakya Ekbote, Wei Dai, Ao Qu, Jingyao Wu, Rui Mao, Ehsan Hoque, Erik Cambria, Gianmarco Mengaldo, Paul Pu Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文 "OmniSapiens: A Foundation Model for Social Behavior Processing via Heterogeneity-Aware Relative Policy Optimization" 的解释,采用了通俗易懂的语言和富有创意的类比。

大局观:教 AI 理解人类

想象一下,你正在尝试教一个机器人理解人类行为。你希望它能擅长许多不同的事情:识别讽刺、检测抑郁、理解幽默、解读肢体语言,以及弄清楚某人的感受。

问题在于,人类的行为是混乱且多变的。有些任务就像是在“大喊大叫”(信号非常强烈),而另一些任务则像是“低声细语”(信号非常微弱)。如果你只是把这些任务全部丢给一个标准的 AI,那些“大喊大叫”的任务就会淹没掉那些“低声细语”的任务。AI 会在那些“大声”的任务上表现得非常好,但会完全忽略那些“安静”的任务。

这篇论文的作者构建了一个名为 OmniSapiens-7B 2.0 的新 AI 模型来解决这个问题。它被设计成一个“具有社交智能”的大脑,能够同时处理所有这些不同的任务,而不会因为感到困惑或产生偏见。

问题所在:“哭闹婴儿”效应

论文解释说,现有的 AI 模型之所以难以应对,是因为它们学习的数据是异质的(混合且不均匀的)。

  • 类比: 想象一个教室,一位老师正试图同时教授 10 门不同的学科。在教室的一个角落,一名学生正在大声喊出数学题的答案(一个非常容易、响亮的信号)。而在另一个角落,一名学生正在轻声吟诵一首关于悲伤的复杂诗歌(一个困难、微弱的信号)。
  • 结果: 一个标准的老师(或 AI)会完全专注于那个大喊大叫的学生,因为那里的反馈最容易被听到。他们会忽略那个低声细语的学生。用 AI 的术语来说,模型会在简单的任务上表现出色,但在微妙、复杂的任务上表现糟糕。

解决方案:“公平教练”(HARPO)

为了解决这个问题,研究人员发明了一种新的训练方法,称为 HARPO(异质感知相对策略优化)。

  • 类比: 把 HARPO 想象成站在教室里的一个非常聪明的“公平教练”。
    1. 倾听: 教练倾听每一位学生的回答。
    2. 衡量投入: 教练计算每个学生贡献了多少“噪音”(或学习信号)。
    3. 平衡音量: 如果那个学数学的学生叫得太响了,教练会稍微调低他的麦克风音量。如果那个写诗的学生声音太小了,教练会调高他的麦克风音量。
    4. 目标: 教练确保每一位学生都有公平的机会来影响课程,无论他们说话的声音是大是小。

从技术层面来说,HARPO 会观察每个特定任务或数据样本对 AI 学习的贡献程度。然后,它通过数学手段“调高”微弱的信号,并“调低”响亮的信号,从而使 AI 能够平等地学习所有内容。

结果:全明星选手

论文测试了这个新 AI(OmniSapiens-7B 2.0)在 10 种不同行为任务上的表现,涵盖了从检测焦虑到理解非言语手势等各种领域。

  • 计分板: OmniSapiens 不仅仅是赢了,它简直是统治了比赛。它在所有 10 项任务中同时取得了最佳成绩。
  • 对比: 与其他顶尖 AI 模型相比,OmniSapiens 的综合表现提升了高达 12%。更令人印象深刻的是,当该 AI 被测试于 5 个它从未见过的全新任务(如检测自闭症或重度抑郁)时,它仍然比其他所有人高出多达 9%
  • “为什么”: 论文指出,正是因为“公平教练”(HARPO)确保了 AI 能从那些微弱、困难的信号中学习,使得 AI 发展出了更深层、更灵活的理解力。它不仅仅是死记硬背那些响亮的答案,而是学习了底层的模式。

额外福利:更清晰的思考

论文还研究了 AI 是如何思考的。当被要求解决一个问题时,AI 会写下它的推理步骤(就像学生展示解题过程一样)。

  • 旧模型: 通常给出冗长、啰嗦或混乱的解释,或者有时在没有思考的情况下直接猜测。
  • OmniSapiens: 产生的推理过程更短、更清晰、更一致。这就像是一个不仅能得到正确答案,还能逻辑严密且简洁地解释过程的学生。这使得 AI 在现实世界中的应用更加值得信赖。

总结

论文声称,通过发明一种平衡不同学习信号“音量”的新方法(HARPO),他们创造了一个(OmniSapiens-7B 2.0)具备以下特性的 AI:

  1. 全能: 它在 10 项多样化的社交任务中胜出。
  2. 具备泛化能力: 它在面对未见过的任务时表现出色。
  3. 逻辑清晰: 它比之前的模型能更好地解释其推理过程。

核心结论是,要构建一个真正的具有社交智能的 AI,你不能只让“大声”的数据占据主导地位;你需要一种机制来确保那些“细语”也能被同样清晰地听到。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →