← 最新论文
🤖 machine learning

SERUM: State Extraction and Refinement for User Modeling

该论文介绍了 SERUM,这是一个利用层级化视觉语言模型(VLM)标注和迭代优化来实现多轮处理的框架,旨在从非结构化的第一视角屏幕视频中自动提取结构化、可解释的用户行为模型,与单轮方法相比,该框架显著提升了预测准确性和标签一致性。

原作者: Andy J. Phu, James Mooney, Karin de Langis, Khanh Chi Le, Dongyeop Kang

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Andy J. Phu, James Mooney, Karin de Langis, Khanh Chi Le, Dongyeop Kang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教会一个机器人如何成为一名得力的助手。为了做到这一点,机器人不仅需要理解你现在正在做什么,还需要理解你为什么要这样做,以及你接下来很可能会做什么。这就是“用户建模”(user modeling)的世界——这是人工智能的一个分支,旨在让计算机尝试构建人类行为的心智图谱。通常情况下,为了构建这些图谱,科学家们必须手动观看数小时的视频,并记录下每一个动作,就像玩一场非常缓慢、非常昂贵的“找不同”游戏。但如果我们能直接把一段关于某人一天的原始视频交给机器人,让它自己去发现其中的规律呢?这就是这篇论文试图解决的核心问题:我们能否在不需要人类编写任何标签的情况下,将杂乱无章、未经组织的视频片段转化为一个清晰、结构化的意图故事?

该论文介绍了一种名为 SERUM(用于用户建模的状态提取与精炼,State Extraction and Refinement for User Modeling)的新系统。可以将 SERUM 想象成一位非常有耐心、超级聪明的侦探,它不仅看一遍视频,而是反复观看,并随着每一次观看而变得更加精明。

起初,如果你要求一个标准的 AI 来描述一段视频,它可能会说:“人在拿着电钻”,“人在看一个盒子”,“人在按按钮”。它看到了动作,但错过了大局。它不知道所有这些微小的动作其实都是一个大目标的一部分:“修理空调”。更糟糕的是,如果 AI 逐帧观看视频而没有记住五秒钟前发生了什么,它可能会感到困惑,比如在前一秒还称之为“清洗蔬菜”,下一秒就变成了“冲洗农产品”。这就是“幻觉”(hallucination)和“时间混淆”(temporal conflation)——基本上,由于缺乏上下文,AI 正在凭空捏造或搞混了时间线。

SERUM 通过一种巧妙的“多轮迭代”(multi-pass)策略解决了这个问题。想象一下你正在尝试解一个复杂的拼图。在第一次尝试时,你可能只是放置边缘碎片并猜测图案是什么。在第二次尝试时,你看着已经开始构建的画面,意识到:“噢,那块碎片不是天空中的云,而是山脉的一部分!”于是你调整了你的猜测。SERUM 对视频也做了同样的处理。它多次运行视频:

  1. 第一轮(Pass 1): 它观察帧并给出动作的粗略描述(例如,“在键盘上打字”)。
  2. 第二轮(Pass 2): 它观察这些动作,并尝试猜测其背后的“意图”或目标(例如,“编写代码”)。
  3. 第三轮(Pass 3): 它回到动作层面,但这一次,它利用新的“意图”猜测来精炼动作描述。也许“在键盘上打字”不仅仅是打字,而是“调试代码”。
  4. 第四轮(Pass 4): 它根据更精准的动作标签再次精炼意图。

系统不断循环运行视频,在猜测动作和猜测目标之间交替进行,并利用前一轮的“记忆”来纠正错误。作者发现,经过大约 8 轮这种反复的过程后,系统就不再改变主意了。他们称之为“图式平衡”(schematic equilibrium)。这就像拼图终于严丝合缝地拼凑在一起,AI 对描述正在发生的事情达成了一套稳定、一致的词汇表。

但还有最后一步。因为 AI 具有创造性,它可能会对同一件事使用不同的词汇,比如“修理空调”和“维修 HVAC 系统”。SERUM 有一个最后的“清理”阶段,它使用一种数学工具来识别出这些其实是同一件事,并将它们合并为一个清晰的标签。这缩减了可能的各种状态列表,使最终的模型更加精准。

团队在涵盖四个领域(编程、烹饪、体育活动和日常生活)的 61 段视频上测试了该系统。他们发现,与简单的猜测策略相比,SERUM 的最终模型在预测一个人下一步要做什么方面表现得更好。例如,在编程视频中,经过归一化处理后,该系统在 76.4% 的情况下能正确预测下一个动作,而简单的“猜最常见的动作”策略仅能达到约 47%。

人类专家也对结果进行了评审。他们认为 SERUM 最后一轮的标签有 88.3% 是正确的,并且在 82.8% 的情况下更倾向于这些精炼后的标签,而非最初那些混乱的猜测。这表明这种“循环”过程确实有助于 AI 理解视频背后的故事,而不只是单个帧的内容。

简而言之,SERUM 表明我们不需要人工手动标记视频的每一秒来理解人类行为。通过让 AI 反复重看并重新思考素材,我们可以构建出一个结构化、可靠的图谱,用以描述人们正在做什么以及为什么这么做,从而为能够真正理解我们的工作流程并提供主动帮助的未来 AI 助手打开了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →