← 最新论文
📄 animal behavior and cognition

FERAL: A Supervised Video-Understanding System for Direct Video-to-Behavior Mapping

FERAL 是一个受监督的开源视频理解系统,它能够直接将原始视频映射为跨越不同物种和尺度的帧级行为标签,在绕过传统关键点追踪限制的同时,以显著更少的训练数据超越了最先进的基准模型。

原作者: Skovorodnikov, P., Razzauti, J., Costelloe, B. R., Buck, F., Chandra, V., Frank, D. D., Kay, T., Koger, B., Snir, O., Zhao, J., Couzin, I. D., Kronauer, D. J. C., Vosshall, L. B.

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Skovorodnikov, P., Razzauti, J., Costelloe, B. R., Buck, F., Chandra, V., Frank, D. D., Kay, T., Koger, B., Snir, O., Zhao, J., Couzin, I. D., Kronauer, D. J. C., Vosshall, L. B.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正在试图教一台计算机理解一部关于动物玩耍、打斗或仅仅是闲逛的电影。多年来,实现这一目标的标准方法就像是一个非常严苛、高要求的导演。首先,你必须在每一帧视频中,在每只动物身体的每个关节上贴上无形的“贴纸”(关键点)。然后,你将这些火柴人骨架喂给计算机,并寄希望于它能根据关节的移动来猜出动物正在做什么。

问题在于,如果一只动物躲在叶子后面,或者被另一只动物遮挡,或者光照很奇怪,这些“贴纸”就会脱落。计算机会变得困惑,整个系统就会崩溃。这就像是通过只观察木偶的绳索来理解一段舞蹈动作;如果绳索缠绕在一起,你就完全不知道舞者到底在做什么了。

于是,FERAL(用于动物运动识别的特征提取)登场了。请把 FERAL 想象成不是一个木偶操纵师,而是一位直接跳过木偶戏、直接观看整场表演的高明影评人。它不再盯着火柴人看,而是直接观察原始视频像素。它观察整个场景——颜色、形状、运动——并学会说:“啊,那是一只正在理毛的小鼠,”或者“那是蚁群正在搜寻食物。”

重大发现
主要的发现是,FERL 可以将原始视频直接映射到行为标签上,且具有极高的准确度,其表现往往优于那些顶尖的“火柴人”系统。在一项名为 CalMS21 的重大测试中(计算机需要识别小鼠的社交行为),FERAL 达到了 94.2% 的得分(以平均精度衡量)。这高于之前的顶级竞争对手,包括谷歌开发的 VideoPrism 系统。更酷的是什么?FERAL 仅使用了 VideoPrism 所需训练数据的 25%。这就像是一个只读了四分之一课本的学生,竟然比那个读完了一整本书的孩子考得还要好。

FERAL 对什么说“不”
论文对此明确界定了 FERAL 不是 什么。它明确反驳了“需要追踪身体部位(姿态估计)才能理解行为”这一观点。作者认为,试图先寻找关节往往是一个死胡同,尤其是在混乱、真实的现实环境中。他们还澄清说,FERAL 是一个监督式工具,这意味着它只能学习你明确教给它的东西。它无法凭空发现新的、未知的行为。如果你没有告诉它什么是“挖掘”,它不会发明这个类别;它只会将其归类为“背景”或类似的东西。它是一个翻译官,而不是侦探。

我们的把握有多大?
作者非常有信心,他们的结论是由来自真实实验的硬核数据支撑的,而非仅仅来自模拟实验。他们在各种物种上测试了 FERAL:

  • 小鼠: 在社交互动识别方面击败了现有的最佳模型。
  • 蚂蚁: 即使在蚂蚁拥挤且互相遮挡的情况下,也能正确识别蚁群何时进行“袭击”或成年蚁何时照顾幼蚁。
  • 蠕虫和果蝇: 能够准确追踪前行爬行、后退和转向。
  • 野生斑马: 这部分非常惊人。他们利用肯尼亚的无人机航拍画面来监测“警戒”(即抬头静止不动)。传统的基于姿态的系统在这里惨败(得分接近 0.50,基本上是抛硬币水平),因为无人机的俯视视角使得观察斑马的颈部角度变得几乎不可能。而 FERAL 通过观察整体视频,获得了 0.785 的宏 F1 分数,证明了即使在相机角度刁钻的情况下它依然有效。
  • 黑猩猩和大猩猩: 在野生 PanAf500 数据集中,FERAL 实现了 90.8% 的 Top-1 准确率,击败了测试的所有其他灵长类研究方法。

幕后的“魔法”
FERAL 的工作原理是使用一个“基础模型”(一个在超过 100 万小时互联网视频上进行过预训练的巨型 AI)。可以把这想象成一个已经看过所有电影、了解光影和运动规律的学生。研究人员随后使用特定的动物视频对该模型的 24 层中的顶层 12 层进行了“微调”。这就像是把一位通用的电影评论家送去参加了一个关于动物行为的速成班。

他们还发现 FERAL 的效率惊人。你不需要超级计算机来运行它。在标准的消费级高端显卡(如 RTX 5090)上,它处理一小时的视频仅需约 4.6 分钟。这比实时速度还要快!

底线总结
FERAL 不仅仅能在实验室里工作;它在混乱、不可预测的现实世界中同样表现出色。它能处理拥挤的场景、奇怪的光照以及躲藏起来的动物。它是一个让科学家们能够跳过绘制火柴人这种繁琐工作的工具,直接进入理解动物实际行为的阶段。它虽然不是解决所有问题的魔杖(它仍然需要人类先对行为进行标注),但它是让动物行为研究变得更快、更便宜、并在以前无法实现的地点成为可能的巨大飞跃。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →