← 最新论文
🤖 machine learning

Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs

该论文提出了一种无需训练且模型无关的“感知程序”(P2^2)方法,通过将视觉工具生成的密集像素级输出重写为紧凑的结构化语言摘要,有效解决了多模态大模型难以利用视觉线索的瓶颈,从而在无需微调的情况下显著提升了其在多种视觉推理任务中的性能并刷新了业界最佳记录。

原作者: Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad Kamran Janjua, Hugo Silva, Di Niu, Bahador Rashidi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文的核心思想可以用一个非常生活化的比喻来理解:“不要给大模型看满屏的像素点,而是给它看一张‘导游图’。”

1. 核心问题:大模型是个“近视眼”的翻译官

想象一下,你有一个非常聪明的翻译官(多模态大语言模型,MLLM),他精通人类语言,逻辑推理能力极强,但他看不懂图片

现在,你给他看一张复杂的图片,并让他回答:“摄像机是向左转还是向右转?”
为了帮他,你找了一位专业摄影师(视觉工具,如光流、深度估计工具)。摄影师拍完照后,没有把照片给翻译官,而是直接扔给他一堆原始数据:比如“第 1 行第 1 个像素动了 0.5 像素,第 1 行第 2 个像素动了 0.3 像素……"(这就是论文里说的“原始工具输出”)。

结果是什么?
翻译官看着这堆密密麻麻、像乱码一样的数字(像素级数据),完全晕了。他虽然很聪明,但这些数据不是他熟悉的“语言”。于是,他只能瞎猜,或者依赖自己的老经验(语言偏见),导致回答错误。这就好比给一个只会说中文的人看一堆二进制代码,让他猜代码的意思。

2. 解决方案:P2(感知程序)—— 把数据翻译成“导游图”

这篇论文提出了一种叫 P2 (Perception Programs,感知程序) 的新方法。

P2 做了什么?
它就像一位超级翻译,站在摄影师和翻译官中间。

  1. 摄影师把原始数据(像素运动、深度值)交给 P2。
  2. P2 把这些乱糟糟的数据,提炼成人类能看懂的“导游图”(语言化的摘要)。
    • 比如,它不会说“像素 (10,10) 动了 0.5",而是说:“图片左边的大部分区域都在向右移动”。
    • 它不会给出一张深度图,而是说:“图片中间的物体离得近边缘的物体离得远"。
  3. 最后,P2 把这张“导游图”(结构化、语言化的文本)交给翻译官。

结果是什么?
翻译官现在看到的不再是乱码,而是清晰的文字描述:“左边向右动”。他立刻就能运用自己的逻辑推理能力,得出正确答案:“摄像机肯定是向右转的!”

3. 为什么这招这么管用?

论文通过实验发现,这招效果惊人:

  • 不用重新训练:不需要给翻译官(大模型)上补习班,也不需要改他的脑子。P2 是一个即插即用的模块。
  • 小模型也能变强:即使是能力较弱的小模型(如 40 亿参数的模型),只要配上 P2 这张“导游图”,表现就能超过以前那些需要复杂训练的大模型。
  • 效率更高:以前给模型看原始数据,模型要读几万个字(Token)才能看懂;现在看 P2 的“导游图”,只需要读几十个字,既快又准。

4. 生活中的类比

  • 原始工具输出:就像医生给你看一张CT 扫描的原始胶片,上面全是黑白的灰度条,让你自己判断哪里骨折了。普通人(大模型)根本看不懂。
  • P2 (感知程序):就像医生先看了胶片,然后给你写了一张诊断报告:“左腿胫骨中段有骨折,右腿正常”。你(大模型)一看报告,立刻就能给出治疗方案。

总结

这篇论文告诉我们:在让 AI 理解视觉世界时,关键不在于给更多的数据或更大的模型,而在于如何“包装”这些数据。

把复杂的视觉信号(像素)翻译成 AI 最擅长的语言(文字摘要),就像给 AI 戴上了一副“语言眼镜”,让它能真正“看懂”图片,而不是被像素淹没。这就是 P2 的魔力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →