← 最新论文
🤖 machine learning

Implicit Neural Representations of Individual Behavior

本文介绍了 Behavioral INR,这是一种自监督生成模型,它通过将策略表示为受潜变量调制的“状态-动作”函数,使隐式神经表示能够适应并从无标签、异构的行为数据中学习策略身份,从而在复杂的连续设置中提高策略的可辨识性,并处理可变的序列长度和分布外偏移问题。

原作者: Andrew Kang, Priya Narasimhan

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrew Kang, Priya Narasimhan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你走进了一间巨大且混乱的舞蹈工作室。里面有数百人在同时跳舞。有人在跳芭蕾,有人在跳地板舞,还有人只是在随性地挪动。问题在于?这里没有姓名牌,没有音乐提示,也没有编舞表。你看到的只是动作的残影。

你的目标是弄清楚:谁在跳什么舞? 更重要的是,即使“芭蕾舞者 A”在房间的不同位置或以不同的速度跳舞,你还能认出那是同一个人吗?

这正是 Andrew Kang 和 Priya Narasimhan 在其论文 《行为的隐式神经表示》(Implicit Neural Representations of Individual Behavior) 中解决的问题。他们引入了一种名为 Behavioral INR(行为隐式神经表示) 的新工具来破解这个谜题。

以下是通俗易懂的解析:

1. 旧方法:“相册”法

以往的方法试图通过拍摄舞蹈的“相册”来解决这个问题。它们会观察一段动作序列(步骤 1,步骤 2,步骤 3),并试图将整个过程总结为一个单一的标签。

  • 缺陷: 如果舞者的速度改变了、房间大小变了或者灯光变了,“相册”看起来就会完全不同。计算机会感到困惑,认为这是一个新的舞者,尽管其实是同一个人。它依赖于捷径,比如“哦,这个舞者总是以旋转开始”,而不是理解舞蹈本身的“风格”。

2. 新方法:“食谱”法 (Behavioral INR)

作者意识到,一个舞者的风格不仅仅是一系列动作,它是一本规则手册或一份食谱

  • 类比: 想象一份巧克力蛋糕的食谱。
    • 原料(状态/State): 当前的情况(例如:“面糊很稀”或“烤箱很热”)。
    • 动作(Action): 你下一步要做什么(例如:“加入更多面粉”或“调低温度”)。
    • 厨师(策略/Policy): 正在制作蛋糕的具体那个人。

旧方法试图记忆制作出的每一份蛋糕的序列。而新方法 Behavioral INR 则试图学习那位厨师独特的食谱。它会问:“给定这个特定的情况,这位特定的厨师接下来最可能做什么?”

他们使用了一种被称为**隐式神经表示(Implicit Neural Representation, INR)**的数学技巧。

  • 在视觉领域: 通常,INR 被用于将一组坐标 (x, y) 转换为颜色 (RGB)。这就像一个神奇的函数,无论你如何放大,它都知道图像中每个像素应该是什颜色。
  • 在行为领域: 他们反转了这个逻辑。不再是从坐标到颜色,而是从状态(States)到动作(Actions)。该模型学习一个代表特定个体行为(即特定智能体的行为)的连续“函数”。

3. 核心秘诀:“潜码”(Latent Code)

为了让这套方法适用于许多不同的舞者(或策略),模型使用了一个潜码(Latent Code)

  • 可以把它看作是每个舞者的唯一身份证DNA 链
  • 当模型观察一段新的动作序列时,它会尝试寻找正确的“身份证”,并将该身份证代入“食谱”中,从而完美解释为什么舞者会那样移动。
  • 至关重要的一点是,模型不需要被告知“这是舞者 A”。它通过观察哪张身份证与数据最匹配,从而自行识别出来。

4. 为什么这意义重大(“缩放”测试)

论文在一些非常严苛的场景下测试了这一点:

  • 变长序列(Variable Length): 就像你可以放大或缩小一张高分辨率图像而不使其变得模糊一样,这个模型可以处理 10 步长的舞蹈,也可以处理 1000 步长的舞蹈。它不在乎长度,它在乎的是底层的规则。
  • “分布外”(Out-of-Distribution)测试: 想象你训练了一个在小房间里跳舞的舞者,然后去测试他在一个巨大的体育场里的表现。
    • 旧方法会失败,因为房间的“照片”看起来不同了。
    • Behavioral INR 则会成功,因为它学习的是“食谱”。它知道:“如果房间变大了,这位厨师还是会加入同样分量的盐。”它识别的是,而不是环境

5. 它在何处表现最佳

作者发现,当行为复杂且环境复杂时,这种“食谱”方法表现最为出色。

  • 它胜在复杂的连续世界(如一级方程式赛车或机械臂)中,在这些场景下,行为的“规则”非常微妙,仅靠观察几步动作很难猜透。
  • 它平手或落后于简单的世界(如国际象棋或简单的机器人任务)中,因为在这些场景下,行为非常直观或具有重复性,通过观察过去的动作(即“相册”法)就足以猜出是谁在操作。

总结

这篇论文引入了 Behavioral INR,它将一个人的行为视为一种连续的、无形的函数(即食谱),这种函数决定了他们如何对世界做出反应,而不是仅仅将其视为过去动作的列表。

通过学习这种“食谱”,AI 能够识别出是谁在行动,即使他们在新的环境中、以不同的速度或进行着不同数量的步骤。这就像是通过厨师调味时的独特方式来识别其烹饪风格,而不是仅仅通过背诵他们做过的菜谱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →