← 最新论文
🤖 AI

Benchmarks for Vision-Language Models in Urban Perception Should Be Reliability-Aware and Negotiated

本文认为,视觉语言模型在城市感知领域的基准测试必须发生演进,即必须将人类的分歧与弃权视为有效的测量结果,在报告模型对齐度的同时报告标注者间的一致性,并将标签空间界定为可协商的人造产物,从而更好地支持城市治理应用。

原作者: Rashid Mushkani

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Rashid Mushkani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教会一个机器人去描述一条城市街道,不仅仅是靠数数汽车或树木,而是要告诉你在那里是什么“感觉”。这条街安全吗?它是否亲切?它是否舒适?

这篇论文认为,当我们测试这些“视觉语言模型”(即能够看懂并说话的机器人)时,如果我们把它们的回答当作只有唯一正确答案的简单数学题来对待,那我们就犯了一个巨大的错误。相反,我们需要将这些测试视为一场市政厅会议,在那里人们会有不同的观点。

以下是使用简单类比对该论文核心思想的拆解:

1. 问题所在:“唯一正确答案”的陷阱

想象一下,你向 12 个人展示一张公园的照片,并问:“这个公园安全吗?”

  • 甲说:“是的,非常安全。”
  • 乙说:“不,晚上感觉很危险。”
  • 丙说:“我从这张照片里看不出来。”

在传统的机器人测试中,我们会强行将所有这些答案压缩成一个单一的“标准答案”(例如:“安全”)。如果机器人说“不安全”,我们就判定它错了;如果它说“安全”,我们就判定它对了。

论文的观点: 这是不公平的。这里的“真相”并不是一个单一的事实,而是一个由各种观点组成的复杂混合体。如果我们忽略了这种分歧,我们可能会误以为机器人失败了,而实际上它只是反映了一种有效的个人观点。

2. 解决方案:“感知可靠性”的评分卡

作者建议我们需要一种新型的机器人成绩单。与其只给出一个分数(比如 85%),这份成绩单还应该显示:

  • 人类的分歧程度: 如果人类对于一条街道是否“安全”无法达成共识,那么机器人不应该因为进行猜测而被惩罚。
  • 谁说了“我不知道”: 有时,最好的回答是“我无法判断”。如果机器人在应该保持沉默的时候却进行了猜测,那这就是一个问题。

类比: 这就像天气预报。如果 12 位气象学家观察一场风暴,其中 6 人说“下雨”,6 人说“下雪”,那么一个好的预报不应该只选一个并宣布“是下雨”,而应该说:“存在 50/50 的分歧,以下是其中的不确定性。”

3. 实验:蒙特利尔街道测试

为了证明这一点,研究人员创建了一个特定的测试:

  • 场景: 他们拍摄了 100 张蒙特利尔街道的照片(包括真实照片和计算机生成的图像)。
  • 评委: 他们邀请了来自当地社区组织的 12 名真实人士,让他们针对 30 个不同主题(如“是否干净?”或“是否具有包容感?”)来描述这些街道。
  • 机器人: 他们要求 7 种不同的 AI 模型使用完全相同的指令来描述这些街道。

他们的发现:

  • “简单”的内容: 当问题涉及显而易见的事物(如“是否有树木?”)时,人类的意见非常一致,机器人的表现也很好。
  • “困难”的内容: 当问题涉及感受(如“是否舒适?”)时,人类的分歧很大。机器人也遇到了困难,有趣的是,它们有时与人类的分歧模式并不一致。
  • “沉默”的问题: 人类经常说:“我无法判断这一点。”然而,机器人却经常尝试进行猜测。这是一种行为上的错位。

4. “协商式”的方法

论文认为,这些测试不应该是刻板不变的。它们应该是可以协商的

类比: 想象一份关于城市的“配方”。如果生活在城市里的人们说:“这个成分(对‘安全’的定义)对我们来说没有意义,”那么这个配方就不应该被直接忽略。人们和科学家应该坐下来,共同重新编写这个配方。

作者说,当我们使用这些机器人来辅助城市决策(例如在哪里建造公园或如何管理街道)时,我们必须:

  1. 展示分歧: 不要隐藏人们对“安全”含义存在争论这一事实。
  2. 保持规则的灵活性: 如果社区认为规则不对,我们应该能够修改测试并重新运行。
  3. 诚实面对不确定性: 如果机器人不确定,或者人类不确定,这种不确定性应该在最终报告中清晰可见。

总结

这篇论文告诉我们,当使用 AI 来理解人们对城市的感觉时,我们不能只寻找一个“正确”的答案。我们必须接受人们存在分歧这一事实。一个好的机器人测试必须向我们展示人类的分歧程度以及机器人拒绝猜测的频率,而不是仅仅给出一个假装世界简单明了的单一数字。

如果我们不这样做,我们可能会造出一些自以为“聪明”的机器人——它们虽然在迎合一个虚构的平均值,却实际上错过了社区中那些真实、复杂且重要的对话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →