← 最新论文
🤖 AI

What Users Leave Unsaid: Under-Specified Queries Limit Vision-Language Models

该论文提出了 HAERAE-Vision 基准,揭示了现实世界中用户常留下的未明确查询严重限制了视觉语言模型(VLM)的性能,表明当前评估基准与真实应用场景之间存在显著差距,且即便结合网络搜索也无法弥补这一缺陷。

原作者: Dasol Choi, Guijin Son, Hanwool Lee, Minhyuk Kim, Hyunwoo Ko, Teabin Lim, Ahn Eungyeol, Jungwhan Kim, Seunghyeok Hong, Youngsook Song

发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Dasol Choi, Guijin Son, Hanwool Lee, Minhyuk Kim, Hyunwoo Ko, Teabin Lim, Ahn Eungyeol, Jungwhan Kim, Seunghyeok Hong, Youngsook Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的"AI 视觉专家”们做了一次**“去伪存真”的体检**。

简单来说,研究人员发现:现在的 AI 在考试时表现很好,但一旦到了现实生活中,面对普通人那些**“没头没尾、话只说一半”**的问题时,它们就经常“掉链子”。

为了讲清楚这个发现,我们可以用几个生活中的比喻:

1. 现在的 AI 像是在“温室”里长大的学霸

目前的 AI 评测(考试),题目通常出得非常规范、完整。

  • 就像:老师问学生:“请计算图中这个红色三角形在底边长为 5 厘米、高为 3 厘米时的面积。”
  • AI 的表现:这种题目 AI 做得很好,因为它有所有需要的信息。
  • 现实情况:但在现实生活中,用户(就像普通家长)只会拍一张照片,然后问:“老师,这题怎么做?”或者“这是什么?”
  • 问题所在:用户默认 AI 能看懂照片里的背景、知道他们想问什么,所以把很多关键信息都“省略”了。这种“话只说一半”的情况,在论文里叫**“未明确指定的查询” (Under-Specified Queries)**。

2. 这次研究做了什么?(HAERAE-Vision 基准)

研究团队从韩国真实的网络社区里,收集了86,000 多个真实的“照片 + 问题”组合。

  • 筛选过程:他们像淘金一样,经过层层筛选(去掉了太简单的、太敏感的、不需要看图也能回答的),最后只留下了653 个最典型、最像真人会问的“烂问题”。
  • 双重测试:为了证明问题出在“话没说明白”而不是"AI 太笨”,他们给这 653 个问题做了**“翻译”**:
    • 原版:用户原话(比如:“这个怎么弄?”配一张图)。
    • 精修版:把图里的信息补全,变成完整的话(比如:“请问如何拆卸这个安装在天花板上的白色挂钩?”)。

3. 惊人的发现:AI 其实没那么笨,是“沟通”出了问题

研究人员让 45 个不同的 AI 模型(包括最强的 GPT-5、Gemini 等)来回答这些问题,结果令人咋舌:

  • 面对“烂问题”(原版):即使是世界顶级的 AI,正确率也不到 50%。它们经常猜错,或者答非所问。

  • 面对“精修问题”(把话说明白):一旦把问题补全,AI 的正确率瞬间提升了 8% 到 22%

    • 比喻:这就像是一个聪明的学生,如果老师只给个模糊的提示,他可能猜错;但如果老师把题目讲清楚,他马上就能做对。这说明很多 AI 的“失败”,其实是因为人类没把话说清楚,而不是 AI 真的不懂。
  • 小模型更吃亏:越小的 AI 模型,在“烂问题”上摔得越惨。因为它们缺乏“脑补”能力,无法从模糊的图片和只言片语中猜出用户的意图。

4. 一个反直觉的结论:联网搜索也没用

大家可能会想:“那让 AI 去上网搜一下不就行了吗?”

  • 实验结果:研究人员给 AI 开了“联网搜索”功能,结果发现,用模糊问题去搜索,效果还不如用清晰问题但不搜索。
  • 原因:如果用户问“这个怎么弄?”,AI 连“这个”是什么都不知道,它就没法去搜。就像你让一个侦探去查案,却只给他看一张模糊的背影照,却不告诉他查谁,侦探就算有全世界最大的图书馆,也查不出结果。AI 必须先“听懂”你在问什么,才能去搜索。

5. 还有一个隐藏的大 BOSS:文化差异

研究还发现,当把问题说清楚之后,AI 还是答不对。这时候剩下的困难主要不是“话没说明白”,而是**“缺乏本地文化知识”**。

  • 例子:照片里是韩国冬天路边的沙袋,AI 可能以为是“路障”或“捕虫器”,但韩国人一看就知道那是“防雪沙袋”。这种只有当地人懂的“潜规则”,是目前的 AI 很难学会的,因为它们主要是在英语数据上训练的。

总结:这篇论文告诉我们什么?

  1. 别被“高分”骗了:现在的 AI 评测太“理想化”了,像在做填空题,而现实生活是“看图说话”且经常“语焉不详”。
  2. 沟通成本很高:AI 现在的最大瓶颈之一,不是它不够聪明,而是它太依赖人类把话说清楚。如果人类像平时聊天那样随意,AI 就会变笨。
  3. 未来的方向
    • 我们需要开发能更擅长“猜”用户意图的 AI(像老练的管家一样)。
    • 我们需要让 AI 更懂本地文化(比如懂韩国的路标、懂中国的习俗),而不仅仅是懂英语。

一句话概括:这篇论文就像是在说,“别光怪 AI 笨,有时候是我们人类说话太‘省’了,而且 AI 还没学会我们那些只有本地人才懂的‘潜台词’。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →