On the Real-World Generalisability of Optical Flow Models
本文介绍了 FlowFactor,这是一个具有受控混杂因素的新型真实世界光流基准测试,旨在证明当前模型在合成基准测试上的表现无法很好地预测其在真实世界中的准确性,并且仅仅通过扩展数据规模无法弥补这一泛化差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在训练一个机器人玩一款视频游戏,它必须追踪屏幕上每一个像素在帧与帧之间的移动。这被称为“光流”(optical flow)。为了教导这个机器人,科学家们通常会构建一个巨大的、完美的、计算机生成的虚拟世界。这就像是一个视频游戏关卡,其中的规则非常严格,光照永远不会出现故障,每个物体的运动也完全按照程序设定。机器人在这种游戏中变得极其精通。
但随后,你将同一个机器人带到了混乱的现实世界中。突然间,阳光闪烁,一辆汽车驶过并挡住了你的视线,或者一只长着蓬松毛发的狗跑了过去。那个在视频游戏中表现卓越的机器人开始踉跄。它会被阴影搞糊涂,跟丢那只蓬松的狗,并在物体移动过快时陷入停滞。
这正是 Petter Reijtal 及其在代尔夫特理工大学(TU Delft)的团队所发现的情况。他们提出了一个简单但令人胆战心惊的问题:在视频游戏中获得高分,真的意味着你的机器人已经准备好应对现实世界了吗?
“视频游戏”陷阱
多年来,研究人员一直利用合成数据(即“视频游戏”)来训练光流模型,并将其测试在其他视频游戏或非常特定、狭窄的现实场景中(例如在高速公路上驾驶汽车)。他们认为:“如果机器人玩得更好,它一定是在变得更了解现实。”
作者们构建了一个全新的、极具挑战性的测试,名为 FlowFactor,以此来检验这一点。他们创建了 1,000 对真实的帧对(不是完整的视频剪辑),但他们并没有把所有东西都扔给机器人。相反,他们隔离出了四个通常会让这些机器人崩溃的特定“大 Boss 关卡”:
- 模糊 Boss(The Blur Boss): 物体移动速度极快(单帧移动超过 25 个像素)。
- 遮挡 Boss(The Hiding Boss): 物体被其他物体遮挡或从屏幕边缘消失(遮挡现象)。
- 复制品 Boss(The Copycat Boss): 具有重复模式的场景,例如砖墙或草地,机器人会因为分不清哪个像素是哪个而感到困惑。
- 手电筒 Boss(The Flashlight Boss): 场景中的光照剧烈变化,但实际上没有任何物体移动。物体保持静止,但阴影和眩光在移动,以此测试机器人能否区分光影变化与实际运动。
他们还加入了另外两个真实世界数据集 Slow Flow 和 TAP-Flow,从而构建了一个包含 8,204 对帧对 的庞大测试套件。
大揭秘:计分板在撒谎
当他们在这一新测试中测试最新、最先进的光流模型时,他们发现了一个令人震惊的趋势。
主要发现: 尽管模型在标准的“视频游戏”基准测试(如 Sintel、KITKI 和 Spring)上的表现越来越好,但它们在现实世界中的性能却处于停滞状态。事实上,对于最新的、功能最强大的模型来说,在视频游戏中获得更高的分数,有时反而意味着它们在处理现实世界的混乱时表现得更差。
这就像一个学生完美地背诵了练习册里的每一道题,但在真正的考试中却失败了,因为实际问题的表述方式完全不同。作者指出,通过过度关注“视频游戏”数据,模型正在发生过拟合——它们学习的是游戏的特定技巧,而不是运动的一般规律。
“权衡”之谜
研究人员还发现了一种奇怪的拉锯战。他们发现,擅长追踪快速、大幅度运动(如疾驰而过的汽车)的模型,往往在处理带有光影变化的静态场景(如夕阳西下时随风摇曳的树木)时表现得很糟糕。
这就像机器人必须做出选择:“我是要做一个速度达人,还是要做一个影子侦探?”你很难同时兼顾两者。这表明,仅仅扩大模型规模或延长训练时间并不是万能的解决办法。
向问题投喂更多数据?没那么简单。
你可能会想:“好吧,那我们就给机器人喂更多的数据吧!也许如果我们在一百万个更多的合成帧上进行训练,它最终就能掌握了。”
作者也对此进行了测试。他们研究了在庞大数据集(包括来自 TartanAir 的超过 100 万对帧对)上训练的模型。结果呢?并没有。 增加合成数据并不一定会缩小差距。事实上,一些在较小且更多样化数据集上训练的模型,在现实世界测试中的表现同样出色,甚至更好。
这表明,问题不在于机器人看到的例子不够多,而在于它们看到的例子并不是正确类型的例子。“视频游戏”无论如何玩多少次,都不会看起来像真实的现实世界。
核心结论
这篇论文并不是说光流技术永远失效了。相反,它认为我们不应该再假装视频游戏就是现实世界。目前标准基准测试中的“高分”在某种程度上只是一个幻象。为了构建能够应对我们这个混乱、多影、快速移动的世界的机器人,我们需要停止仅仅扩大数据规模,转而设计出能真正模拟现实混沌感的测试。
正如作者所言,仅仅向问题投入更多的计算能力和数据并不是解决方案。我们需要创新的方法来教导这些模型去应对那些意料之外的情况。在我们做到这一点之前,一个在视频游戏中看起来像天才的机器人,在现实世界中可能依然会由于自己的脚步而跌倒。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。