← 最新论文
💻 computer science

Learning to Understand Body Language from Flight through Robust 3D Avatar Placing

本文介绍了 Drones2BodyLanguage,这是一个通过利用轻量级几何世界模型,将具有交流意图的 3D 化身鲁棒地置入真实无人机视频中而创建的新型数据集,该数据集显著提升了空中机器人从远程无人机视频中学习和理解人类肢体语言及意图的能力。

原作者: Dragos Costea, Alina Marcu, Cristina Lazar, Marius Leordeanu

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Dragos Costea, Alina Marcu, Cristina Lazar, Marius Leordeanu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一架在高空飞行的无人机,正俯瞰着繁忙的城市或宁静的乡村。你是一个具有“社交智能”的机器人,这意味着你想要理解下方的微小人类正试图向你传递什么信息。也许是一名登山者正在挥手求救,或者一群人正在示意特定的方向。在科学界,这被称为理解“肢体语言”或“交流意图”。通常情况下,当镜头近距离拍摄自拍时,计算机非常擅长读取这些信号。但当你将视角拉远到 50 到 100 米时,人就变成了屏幕上的几个像素。他们的动作变得模糊,计算机也会感到困惑。这就像是在足球场另一头读一本书;字母虽然还在,但太小了,根本无法辨认。

为了教会计算机阅读这些遥远的微小信号,科学家通常需要成千上万个示例。但问题在于:没有人拍摄过成千上万段从 100 米外向无人机挥手的视频。由于拍摄难度太大,且人太远了,很难看清。因此,科学家面临两个糟糕的选择:要么尝试拍摄真实的人(这几乎不可能做到足够多),要么创造由计算机生成的、处于完全虚构世界中的虚拟人物(这看起来过于完美,无法匹配现实视频中杂乱的真实感)。这篇论文试图寻找一个聪明的折中方案。它问道:“如果我们保留现实世界的视频,但神奇地将看起来真实的真人‘粘贴’进去,这样计算机就能学习如何从远处读取他们的信号呢?”

这项研究背后的研究人员 Dragoş Costea 及其团队构建了一个名为 Drones2BodyLanguage 的新工具。你可以把它想象成一台高科技的“剪切并粘贴”视频机器,但带有一个非常特别的转折。通常情况下,如果你把一张人的照片粘贴到视频里,他们看起来就像一个在奇怪地滑动平面的贴纸。如果摄像机移动,那个人就不会随着地面一起移动,而是像漂浮着一样。这对学习毫无帮助。该团队的重大突破在于,他们能够将这些数字人放置在地面上,使他们站得稳固,在无人机飞行时保持在正确的位置,甚至能转动身体面向正确的方向,就像真实的人一样。

以下是他们的“魔法”是如何运作的。首先,他们获取一段真实的 4K 无人机视频。然后,他们使用一个智能系统来寻找“锚点”——地面上稳定的点,比如建筑物的角落或树木。即使地面看起来只是普通的、没有任何纹理的沥青路面,他们的系统也会使用特殊的深度传感器来推测这些点在 3D 空间中的高度。接着,他们会计算出一个放置数字分身的“甜点位”(最佳位置)。其中的秘诀在于一个数学技巧:他们并不直接追踪人的脚部(因为在平滑的道路上,脚部可能会消失),而是追踪人周围稳定的锚点,并使用公式精确预测人的脚应该在什么位置,无论无人机如何移动。他们还会计算地面的“倾斜度”,以确保人看起来不会像是侧着身子歪着站。

一旦人被完美地放置好,团队就会通过三种不同的方式将他们添加到视频中,从而创建一个庞大的训练数据库:

  1. 真实型 (Real): 他们拍摄演员的实际视频,将他们剪切出来,然后粘贴进去。
  2. 重定向型 (Retargeted): 他们提取真实演员的动作,并将其套用到逼真的 3D 计算机角色身上。
  3. 生成型 (Generated): 他们利用人工智能发明从未被拍摄过的全新动作。

他们创建了一个包含超过 3,500 个此类“放置”视频片段的数据集,展示了人们在 33 到 98 米距离内进行的十种不同交流信号(如挥手、指点或示意“停止”)。

团队随后测试了这种“虚假”数据是否真的能教会计算机理解真实的人。他们选取了十二种不同的计算机大脑模型(架构),并在这个新数据集上进行了训练。结果非常理想。当他们在这些“放置”视频上进行训练时,模型在预测远处人物意图方面的准确性有了显著提升。事实上,与没有见过这类数据的模型相比,准确率大幅跃升。

有趣的是,他们发现动作的“类型”比人的“外观”更重要。在“生成型”(完全虚构)动作上训练的模型表现最差,而在“重定向型”(真实动作配上虚假身体)上训练的模型表现非常好。这表明计算机需要学习的是人类运动的节奏和形态,而不仅仅是 3D 角色的外观。

他们还利用两个全新的、从未见过的真实世界视频对系统进行了测试——一个在乡村,一个在度假村。尽管计算机从未见过这些特定的场景,但在使用混合数据集(结合了真实型和重定向型数据)训练的模型表现最好。这表明,他们将人“放置”进真实视频中的方法,是教导机器人如何理解空中人类信号的一种可靠途径。

然而,作者也谨慎地指出,这种方法目前还不是适用于所有情况的完美方案。他们的方法在平坦、坚实的地面上效果最好,并且依赖于地面具有一定的刚性。此外,他们从视频中剪切出的“真实”人物无法像重新制作整个过程那样轻松地进行改变或重新动画化。但总体而言,这篇论文展示了一种强大的新方法,通过结合真实视频和巧妙的数字放置技术,弥补了现实拍摄与计算机学习需求之间的鸿沟,从而让无人机能够更好地理解我们的肢体语言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →