← 最新论文
🤖 AI

When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

本文引入了可视化任务语义(Visualized Task Semantics, VTS)以揭示多模态模型在指令以像素而非文本形式嵌入时存在的显著性能差距,并提出了一种提示区域接地(prompt-region grounding)方法,该方法在推理阶段无需 OCR 或区域元数据即可有效弥合这一语义通道差距。

原作者: Yongxin Wang, Ruizhe Zhou, Yueling Tang, Yingying Zhu, Xuemin Zhao, Xiaojun Chang, Xiaodan Liang

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yongxin Wang, Ruizhe Zhou, Yueling Tang, Yingying Zhu, Xuemin Zhao, Xiaojun Chang, Xiaodan Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人解谜题。这个机器人被称为多模态大语言模型(MLLM),它有点像一个既能读懂文字又能同时看懂图片的天才学生。通常情况下,你会给机器人一张数学题的图片,并附上一条单独的文本信息说:“解开这个!”机器人读取文本指令,观察图片,然后给出答案。但如果你的指令不是以文本消息的形式给出的呢?如果你把指令写在图片内部,就像是在墙上画的一个标牌一样呢?

科学家们一直在好奇,这个机器人的表现是否依然同样出色。指令是一个“文本标记”(数字化的单词)还是一个“像素”(屏幕上的一个微小的彩色点)会对它有影响吗?在人工智能领域,有一种怀疑认为,机器人可能非常擅长阅读文字,但在“阅读”图像中的指令时却表现得很糟糕。它们可能可以完美地复制这些文字(就像一台复印机),却无法真正去“理解”这些文字是告诉它们该做什么的“老大”。这篇论文深入研究了这个谜团,旨在观察当规则被写在图片里而不是聊天框里时,机器人是否会感到困惑。

“像素化”问题的谜团

研究人员(来自大学和科技公司的团队)决定通过一个被称为**视觉化任务语义(VTS)**的巧妙实验来测试这个想法。想象一下你正在参加一场标准的数学测试。通常,问题会被输入在图像上方。在他们的实验中,他们拿出了完全相同的问题,擦掉了输入的文本,直接将问题“画”在了图像上,就在问题的正上方。他们甚至用了一句简短、枯燥的便条——“帮我解开这个问题”——来替换原本输入的指令。

他们使用四种不同类型的复杂基准测试(如数学图表和复杂的图表)对六种不同的 AI 模型进行了这项测试。结果出现了巨大的性能下降。平均而言,当问题被“画”在图像中时,模型的准确度比输入文本时降低了 17.8 个百分点。在某些情况下,这种下降幅度高达 28.0 个百分点

这不仅仅是因为机器人无法读取字母。研究人员进行了检查,发现模型实际上大多时候都能正确转录出这些画出来的文字。问题在于更深层次的地方:模型未能将这些文字作为“指令”来使用。这就像机器人看到了墙上的标牌,能拼出单词,却没意识到:“哦,这个标牌是在告诉我该做什么!”研究人员称之为“语义通道鸿沟”。信息的传递路径(文本 vs 图像)改变了机器人的思考方式,即使文字本身是完全相同的。

解决方案:教机器人“锚定”标牌

为了解决这个问题,团队开发了一种新的训练方法,称为提示词区域锚定(Prompt-Region Grounding)。把它想象成教一个孩子指向一个标牌并说:“这就是规则!”

他们在训练中使用了两个特别的技巧:

  1. PVRD-SG(“意义匹配”): 他们向机器人展示带有画出问题的图像,以及该问题的另一个干净的文本版本。他们强迫机器人意识到,包含问题的特定像素块所代表的“意义”,与输入的文本是完全相同的。这就像是将墙上的物理标牌与机器人大脑中的“规则概念”连接起来。
  2. PRMLP(“盲区”测试): 他们拿出了带有画出问题的图像,并用一个黑框遮住部分文本(掩码处理)。然后,他们要求机器人根据图像的其余部分来猜测隐藏的文本含义。这迫使机器人去学习指令的“本质”,而不仅仅是死记硬背精确的像素。

最棒的部分是,这种训练不需要机器人使用任何特殊工具(如 OCR 文字识别)或在实际测试时知道文本框的具体位置。在最终考试期间,机器人只需看到带有画出问题的图像,然后直接回答,就像之前一样。

结果:弥合差距

结果非常令人期待。经过这种新训练后,模型在“画出问题”测试上的准确率从 58.0% 跳升至 66.3%。这是一个显著的进步,缩小了文本指令与图像指令之间的差距。模型在原始的基于文本的测试上也略有提升(从 69.1% 提升到 70.3%),证明了它们并没有丢失原有的技能。

研究人员在超过 1,000 张真实的未知图像(如工作表、表格和屏幕截图的照片)上测试了该方法。新方法在这些真实页面上的准确率提高了 7.9 个百分点

这意味着什么

论文得出结论:阅读图像中的文本和将该文本作为指令使用是两种不同的技能。仅仅因为机器人能读懂文字,并不意味着它知道在文字作为图像的一部分时该如何“听从”指令。通过教机器人将视觉问题与其意义进行“锚定”,研究人员帮助它弥合了这一鸿沟。

作者们谨慎地指出,虽然他们改善了这种情况,但并未完全解决问题。仍然存在一个小小的差距,且该方法在文本清晰可见且格式标准时效果最好。然而,这项研究证明了我们与 AI 交谈的方式至关重要。如果我们希望机器人真正变得聪明,我们需要教它们:用像素书写的问题,与在聊天框中输入的提问一样重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →