On the Cultural Anachronism and Temporal Reasoning in Vision Language Models
本文通过引入 TAB-VLM 基准,识别并量化了“文化时代错置”——即视觉 - 语言模型使用与时代不符的概念来误读历史文物的倾向——该基准揭示了最先进模型在推理印度文化遗产时存在的显著性能差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一台时光机,可以观察一件古代物品并讲述它的故事。你或许会期待它是一位完美的历史学家,对吧?嗯,这篇论文介绍了一种名为“视觉 - 语言模型”(VLM)的新型“时光机”,并发现:虽然这些人工智能系统在描述事物“如今”的外观方面表现出色,但在理解事物“过去”发生的时间方面却极其糟糕。
以下是论文研究发现的分解说明,辅以简单的类比进行解释。
问题所在:“穿越时空的衣橱”
作者将主要问题称为“文化时代错置”。
这样想:想象你正在看一张原始人手持石斧的照片。人类历史学家知道:“那是来自一万年前石斧;那时他们还没有金属。”
但这项研究中的人工智能却像一个刚从现代百货商店走出来的困惑时光旅行者。它可能会看着那把石斧说:“哦,那是一种高科技聚合物复合材料工具!”或者“那是使用 19 世纪的工业车床制造的!”
人工智能混淆了时代。它将现代(甚至 19 世纪)的概念、材料和风格,粘贴到了古代物品上。这就像穿着霓虹 LED 夹克去参加中世纪宴会;人工智能根本没有意识到这套行头与那个时代格格不入。
测试:TAB-VLM(“历史测验”)
为了证明这一点,研究人员构建了一项名为TAB-VLM的特殊测试。
- 设置:他们收集了 1,600 件来自印度历史的真实文物,范围从史前石器到现代物品。
- 问题:他们创建了 600 道多项选择题。他们不再仅仅问“这是什么?”,而是提出了棘手的基于时间的问题,例如:
- “将这四个物体按从最古老到最新的顺序排列。”
- “这四个物体中,哪一个不属于这个时期?”
- “这枚古代硬币可能是用塑料制成的吗?”(答案显然是“不”,但人工智能有时会说“是”。)
结果:人工智能被困在了当下
研究人员测试了 10 个最先进的人工智能模型(包括 GPT 和开源模型的最新版本)。结果令人惊讶地糟糕。
- 得分:即使是“最聪明”的人工智能(GPT-5.2)也只答对了**58.7%**的答案。这勉强能通过高中历史测验。
- 差距:人工智能在简单的事情上表现出色,例如知道塑料在古代并不存在(准确率为 92%)。但它在复杂的“时间旅行”任务上完全失败。
- 排序问题:当被要求将四个物体按从最古老到最新的顺序排列时,表现最好的人工智能只有**37%**的时间是正确的。这就像让一个孩子按日期给一副扑克牌排序,而他们却不停地随机洗牌。
- “异类”问题:当被要求找出属于与其他物体不同时代的物体时,人工智能难以察觉风格和材料上的细微差别。
为什么会发生这种情况?
论文提出了两个主要原因,使用了“事实与关系”的类比:
- 记忆与推理:人工智能擅长记忆事实(例如,“塑料=现代”)。这就像一个背下了整本字典却不懂如何写故事的学生。
- 关系鸿沟:人工智能不擅长跨越时间建立联系。它无法观察四个不同的物体并理解它们在时间上的相互关系。这就像一个侦探可以识别单个线索,却无法理清犯罪的时间线。
研究人员发现,这不仅仅是因为人工智能“太小”或“不够聪明”。即使是最大、最昂贵的模型也失败了。似乎人工智能根本上是基于“今天”的图片和文字训练的,因此它难以想象历史的“昨天”。
“西方偏见”的意外发现
论文还进行了一项小型的侧面实验。他们测试了人工智能在西方文物(如希腊雕像)与印度文物上的表现。
- 结果:人工智能在西方文物上的表现明显更好。
- 类比:这就像一个学生为美国历史考试刻苦学习,却几乎没翻开印度历史的书。由于人工智能主要是在西方数据上训练的,它更理解西方历史,但在观察非西方文化时会感到困惑。
核心结论
这篇论文并不是说人工智能无法观看图片。它说的是人工智能目前是一位糟糕的历史学家。
如果你在博物馆或学校使用这些模型来解释古代文物,它们可能会无意中教导学生:古人使用了现代材料,或者历史的时间线是混乱的。作者总结道,在我们信任人工智能处理我们的文化遗产之前,我们需要教会它如何尊重时间的流逝,而不仅仅是像素的流动。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。