← 最新论文
💬 NLP

Which Way Does Time Flow? A Psychophysics-Grounded Evaluation for Vision-Language Models

该论文提出了基于心理物理学验证的 AoT-PsyPhyBENCH 基准,通过评估视觉语言模型在判断视频时间流向(正向或反向)任务上的表现,揭示了当前模型在理解物理不可逆过程和因果动作等时间连续性方面存在显著缺陷,其能力远不及人类。

原作者: Shiho Matta, Lis Kanashiro Pereira, Peitao Han, Fei Cheng, Shigeru Kitazawa

发布于 2026-03-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Shiho Matta, Lis Kanashiro Pereira, Peitao Han, Fei Cheng, Shigeru Kitazawa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是一场给现代人工智能(AI)做的“物理常识体检”,而且题目非常有趣:“时间到底往哪边流?”

想象一下,如果你把一段视频倒着放,比如让打碎的杯子自动拼好、让跳下悬崖的人飞回山顶,或者让爆炸的烟花缩回炮筒。人类看一眼就知道:“这肯定是倒放的,因为物理定律不允许!”

但现在的 AI 能看出来吗?这篇论文告诉我们:大部分 AI 还是“时间盲”,它们甚至分不清视频是正着放还是倒着放。

下面我用几个生动的比喻来拆解这篇论文的核心内容:

1. 考试题目:给 AI 看“倒放”视频

研究者设计了一个特别的测试,叫 AoT-PsyPhyBENCH(你可以把它想象成"AI 的时间感考试”)。

  • 题目很简单:给 AI 看一段几秒钟的视频,问它:“这段视频是正着放的,还是倒着放的?”
  • 题目来源:这些视频都是人类觉得“一眼就能看出不对劲”的,比如苹果自由落体、雪崩、或者人把东西拆散。
  • 人类的表现:人类就像拥有“时间雷达”,看到苹果往天上飞,大脑立刻报警:“这是倒放的!”准确率高达 90%。
  • AI 的表现:大多数 AI 就像喝醉了的人,或者完全不懂物理的外星人。它们猜对的概率只有 50% 左右(跟抛硬币猜一样),甚至有的 AI 会固执地认为“所有视频都是正着放的”。

2. 为什么 AI 会“翻车”?

论文发现,现在的 AI 虽然很聪明,能写诗、能画画、能看懂复杂的场景,但它们缺乏一种人类与生俱来的“物理直觉”

  • 比喻:AI 是“死记硬背的学生”,人类是“有生活经验的孩子”
    • 人类:从小玩泥巴、扔石头,知道石头受重力会往下掉,水往低处流。这种知识刻在脑子里(论文叫“归纳偏置”)。
    • AI:它看了海量的视频,但它只是记住了“苹果”和“树”长在一起的样子。当它看到苹果往天上飞,它可能觉得:“哦,这棵树真奇怪,或者这是特效。”它没有真正理解“重力”和“因果律”。它只是在玩“找不同”的游戏,而不是在理解物理世界。

3. 让 AI“多思考”有用吗?

研究者尝试了各种方法想让 AI 变聪明:

  • 少样本学习(Few-shot):给 AI 看几个例子,告诉它“看,这个爆炸是正放的,那个是倒放的”。结果:AI 还是学不会,甚至更糊涂了。
  • 思维链(Chain-of-Thought):让 AI 像做数学题一样,一步步写推理过程:“我看到水花很大,然后变小,这不符合爆炸规律,所以是倒放。”
    • 结果很讽刺:很多 AI 在写推理时,明明看到了水花变小,却强行解释为“这是正放的”,最后得出一个错误的结论。这就好比一个学生明明算错了,却强行写出一套完美的错误逻辑来证明自己是对的。
  • 增加算力(Reasoning Effort):让 AI 花更多时间“深思熟虑”。结果:AI 想得越久,偏见越重,反而更确信视频是正放的。

4. 训练也没用?

研究者还尝试给 AI 做“特训”(微调),专门让它看几千个正放和倒放的视频。

  • 结果:AI 的准确率依然停留在 50% 左右,跟没训练前差不多。这说明,光靠“刷题”(增加数据量)解决不了问题,AI 缺的不是数据,而是理解物理世界运作方式的底层逻辑

5. 核心结论:AI 还没学会“生活”

这篇论文揭示了一个尴尬的事实:
目前的 AI 就像是一个读过万卷书但从未出过门的书呆子。它认识所有的物体,能描述所有的动作,但它不懂“时间”和“因果”

  • 人类:看到雪往天上飞,会想“这违反重力,肯定是倒放”。
  • AI:看到雪往天上飞,可能会想“这画面很酷,可能是个电影特效”,然后猜它是正放的。

总结

这就好比教一个从未见过水的人游泳。你给他看一万次游泳的视频,告诉他“手要划,脚要蹬”,但他如果不真正跳进水里感受浮力和阻力,他永远学不会游泳。

这篇论文的意义在于:它给现在的 AI 泼了一盆冷水,提醒开发者们,想要让 AI 真正像人一样理解世界,光靠堆数据、堆算力是不够的,我们需要教会 AI 理解物理定律时间的不可逆性。只有当 AI 真正“懂”了物理,它才能从“看图说话”进化到“理解世界”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →