Surfacing Variations to Calibrate Perceived Reliability of MLLM-generated Image Descriptions
本文介绍了一个设计空间和一个原型系统,该系统能够呈现多组由多模态大语言模型(MLLM)生成的图像描述之间的差异,并通过一项针对 15 名盲人及低视力参与者的研究表明,这种方法显著提高了对不可靠信息的检测能力,并且相比单一描述更受用户青睐。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名盲人或视力低下的人,你需要了解一张照片里的内容。你向一个人工智能助手(一种“多模态大语言模型”或 MLLM)提问,让它描述这张照片。AI 向你说话,听起来非常自信且细节丰富。但问题在于,有时 AI 会在撒谎、感到困惑或者仅仅是在瞎猜,而你由于无法亲眼看到照片,根本无法核实它所说的是真是假。
这篇论文介绍了一种新工具,旨在帮助盲人用户在不需要看到图像的情况下,识别出 AI 何时在“幻觉”(即凭空捏造内容)。
问题所在:“自信的骗子”
把目前的 AI 图像描述器想象成一个口才流利但偶尔会编造事实的单一导游。
- 风险: 如果导游说“这是一瓶水”,但实际上是一瓶毒药;或者说“图表显示金额为 100 美元”,但实际显示的是 1,000 美元,盲人用户可能会犯下危险的错误。
- 旧方法: 为了核实导游的话,用户必须去询问其他的导游(不同的应用)或者询问一位视力正常的的朋友。这既慢又累,而且并不总是可行。
解决方案:“评审团”
研究人员提出了这样一个问题:如果我们不是只问一个 AI,而是同时询问三个不同的 AI,并将它们所有的答案并排展示给用户看,会怎样呢?
如果三个 AI 都说“这是一把红色的椅子”,那么你可以信任它。但如果一个说“红色的椅子”,另一个说“蓝色的沙发”,而第三个说“木质桌子”,你立刻就会知道出问题了。这种分歧是一个巨大的警示信号。
然而,阅读三段长短不一、各不相同的描述,就像是在一个嘈ла的派对上试图听清三个人的说话声一样,很难跟上。因此,研究人员构建了一个系统,充当一名聪明的协调员。
系统是如何运作的
该系统获取三个不同 AI 模型的答案,并将其组织成三种易于理解的格式:
- “列表”: 仅仅展示所有三个原始答案(就像派对的转录文本)。
- “感知差异的描述”: 协调员会重写这个故事,将答案融合在一起。它不再只是说“这是一把红色的椅子”,而是说“这是一个被描述为红色、粉色或洋红色的椅子”。它强调了 AI 达成一致的部分以及产生分歧的部分。
- “差异摘要”(胜出者): 这是最受欢迎的格式。协调员会为你提供一份快速查阅的清单:
- 一致性: “大家都认为这是一个客厅。”
- 分歧点: “三个模型说是床,一个模型说是沙发。”
- 独特提及: “只有一个模型提到了墙上的一幅特定画作。”
实验:实战测试
研究人员使用 15 名盲人参与者对该系统进行了测试。他们向参与者展示照片,并要求他们找出描述中“不可靠”或“凭空捏造”的部分。
- 结果: 当用户看到差异摘要时,他们识别错误的能力比只看到单个 AI 描述时提高了 4.9 倍。
- 信任度的转变: 看到分歧让用户变得更加谨慎(这是好事)。他们不再盲目信任 AI,而是意识到:“噢,AI 并不完美,我需要小心。”
- 偏好: 14 位参与者更倾向于查看差异,而不是只得到一个答案。他们最喜欢“差异摘要”,因为它既快速又清晰。
提到的现实应用场景
参与者表示他们会在以下场景使用此工具:
- 高风险情况: 核查龙卷风路径、阅读药品标签或检查股票价格。
- 日常任务: 选择穿搭、阅读社交媒体帖子或理解连环画。
- 主观观点: 获取关于照片是否适合发 Instagram 的不同“视角”。
核心启示
这篇论文并不声称 AI 会变得完美。相反,它表明通过呈现多个 AI 答案之间的差异,我们可以帮助盲人用户校准他们的信任度。它将 AI 从一个你必须信奉的“全知神谕”,转变为一个你可以检查和验证的工具,从而让数字世界变得更安全、更具无障碍性,造福每一个人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。