Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation
本文介绍了 Animation2Code,这是一个包含 1,069 个视频-动画对以及用于评估并揭示当前视觉语言模型在重建具有准确时间动态的可执行 Web 动画方面的局限性的新型人类对齐指标的基准测试。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你拥有一台神奇的电影投影机。你向它输入一段弹跳的小球、旋转的 Logo 或挥动的手部的视频。你的目标是什么?是要求一台超级聪明的计算机写出精确的计算机代码(即“配方”),从而从零开始重现这段视频。
这就是论文 《Animation2Code》 的核心内容。这是一个全新的测试,旨在观察当今最先进的 AI 模型是否能够通过观察一段动态视频,并写出让该动作再次发生的指令。
以下是他们研究结果的简单拆解,使用了日常生活中常见的类比:
1. 挑战:静态 vs. 动态
把目前的 AI 模型想象成摄影师。它们非常擅长观察网页或图表的单张照片,并编写出完美绘制该图像的代码。如果你给它们看一个蓝色的正方形,它们就能写出绘制蓝色正方形的代码。
但这篇文章在问:它们能成为编舞师吗?
如果给它们看一段正方形旋转、缩小然后变成红色的视频,它们能否编写出代码,让这个正方形精准地完成这一系列动作?这需要理解时间和运动,而不仅仅是捕捉一个瞬间。
2. 测试:“Animation2Code”
研究人员构建了一个名为 “Animation2Code” 的巨大“考试”。
- 学习指南: 他们收集了 1,069 段短小的网页动画视频(如弹跳的小球、加载中的旋转图标、挥动的旗帜)以及创建这些动画的实际代码。
- 考试: 他们将这些视频展示给顶尖的 AI 模型(如 Gemini、GPT-4、Claude 等),并问道:“请编写代码来生成这段视频。”
- 评分: 他们不仅检查代码是否能运行,还使用了两个特殊的“尺子”来衡量结果:
- 外观尺(外观): 生成的视频看起来是否像原版?(球是蓝色的吗?是圆形的吗?)
- 动作尺(时间性): 生成的视频运动起来是否像原版?(弹跳的速度对吗?旋转的方向对吗?)
3. 重大发现:“擅长绘画,拙于舞蹈”
结果令人惊讶且有些有趣。
- AI 是优秀的艺术家: 模型在“外观尺”方面表现出色。它们能编写出代码,生成的视频与原版几乎一模一样。颜色、形状和风格都非常精准。
- AI 是笨拙的舞者: 然而,一旦涉及到“动作尺”,模型就表现得很吃力。即使生成的视频看起来很完美,其运动轨迹往往是错误的。
- 类比: 想象 AI 试图重现一段人做后空翻的视频。AI 写出了代码,画出了一个穿着正确衣服的完美人体。但在视频中,那个人要么只是站在那里,要么摔倒了,要么旋转的方向错了。“服装”是完美的,但“舞蹈”是破碎的。
4. 为什么这很重要
论文发现,即使给予 AI 更多的视频帧(关于运动的更多“线索”),或者给予额外的训练来修正错误,它仍然无法搞清楚运动的时机和物理规律。
- 差距: 在“看到”一个动作与“理解”该动作的逻辑并将其转化为代码之间,存在着巨大的鸿沟。
- 局限性: 这些模型似乎是在猜测运动的“感觉(vibe)”,而不是在计算实际的轨迹。它们可以模仿波浪的“样子”,但无法编写出让水真正流动的代码。
5. 总结
研究人员创建这个基准测试是为了证明,虽然 AI 在处理静态任务(如根据照片绘制网页)方面做得很好,但在被要求生成代码时,它在时间推理(理解事物随时间变化的方式)方面仍然非常糟糕。
他们并不是说 AI 没用;他们是说它就像一个背诵了“跳跃”和“旋转”教科书定义的学生,但从未真正学习过如何做一个物理上的后空翻。他们写的代码在纸面上看起来是对的,但当你运行它时,动画的运动方式并不符合预期。
简而言之:目前的 AI 可以画出一个完美的跳舞机器人,但它写不出让机器人真正跳起舞来的代码。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。