← 最新论文
💻 computer science

Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools

本文介绍了 Beyond the Eye (BEE),一种通过结构化监督微调和自我调节奖励驱动对齐的两阶段训练过程来集成隐式视觉工具的新型多模态模型,该模型实现了自适应工具调用,在显著降低推理延迟的同时,保持了在细粒度视觉感知方面的最先进性能。

原作者: Xiuwei Chen, Quanlin Chen, Wentao Hu, Zisheng Chen, Kun Xiang, Zehua Ma, Mingyang Zhang, Jianhua Han, Hanhui Li, Hang Xu, Xiaodan Liang

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiuwei Chen, Quanlin Chen, Wentao Hu, Zisheng Chen, Kun Xiang, Zehua Ma, Mingyang Zhang, Jianhua Han, Hanhui Li, Hang Xu, Xiaodan Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它非常喜欢解谜。但这个机器人有一个怪癖:无论谜题多么简单,它总是坚持要召集一支外部专家团队,打开工具箱,并一遍又一遍地重新扫描图片,只为了找到缺失的一个碎片。这就像是在客厅里找钥匙,但你不是直接去找,而是叫来了一支施工队,拆掉墙壁,用激光扫描地板,然后再把房间重建好,最后才去拿钥匙。虽然这行得通,但既慢又贵,而且让人精疲力竭。

这正是研究人员在当前的“图像思维”AI模型中发现的问题。这些模型过度依赖调用外部视觉工具,这造成了巨大的延迟并浪费了计算能力。

由此诞生了 BEE(超越双眼),一种新型的机器人大脑,它学会了停止过度调用专家。与其每次都跑向工具箱,BEE 学会了先审视自己的内心。如果谜题很简单,BEE 会说:“我能行,”然后立即利用自身的知识解决问题。如果谜题确实很难,它才会悄悄激活一个“隐式工具”——一种通过模拟放大或旋转图像而不实际停止调用外部程序的心理捷径。

重大发现
主要的发现是,BEE 可以完美地平衡自身脑力与这些心理捷径,使其在处理复杂的视觉谜题时,比那些规模大得多或使用真实外部工具的模型更快、更准确。事实上,在测试高分辨率图像(8192 像素)时,BEE 比之前的顶尖方法 DeepEyes 快了约 86.2%。这就像是从一只背着沉重背包的蜗牛,变成了一只知道何时冲刺的猎豹。

BEE 不是什么
论文明确说明了它并非此类模型。它不是一个随机调用工具或不断调用工具的模型。研究人员明确反对“模型应该始终依赖外部工具”或“模型应该在不知道何时停止的情况下仅仅通过‘思考更多’来解决问题”的观点。他们表明,旧模型即使在已经知道答案时也会调用工具,这是一种浪费时间。BEE 的设计初衷正是为了避免这种冗余。它不仅仅是一个更快的工具,更是一个知道何时不使用工具的更聪明的决策者。

他们是如何教导它的
研究人员并不仅仅是告诉 BEE 要变快,而是通过两个有趣的阶段来教导它:

  1. “练习”阶段: 他们向 BEE 展示了数千个例子,在这些例子中,它必须决定是否使用工具。他们提供了一个特殊的“形式化”训练指南(类似于带有工具插槽的速查表),以帮助它理解哪些问题可以靠自己解决,哪些需要帮助。
  2. “奖励”阶段: 这是神奇的秘诀。他们引入了一个名为 净工具增益 (NTG) 的指标,用来衡量工具到底提供了多少帮助。他们发现,第一版 BEE 调用工具过于频繁(就像一个明明知道答案却一直找人帮忙的孩子)。因此,他们创建了一个特殊的奖励系统(MC-Reward),如果 BEE 能用工具解决难题,它会得到一颗“小红星”;但如果它在简单的题目上使用工具,则会受到“暂停处罚”。这教会了 BEE 先信任自己的大脑。

结果
数据本身就具有说服力。在 HRBench 测试(该测试使用高分辨率图像)中,BEE-7B(一个拥有 70 亿参数的模型)击败了之前的开源冠军。更令人印象深刻的是,在 MME-RealWorld 测试中,BEE-8B 和 BEE-4B 的得分实际上高于拥有更多参数的海量商业模型 Kimi-K2.6。

但真正的胜利在于速度。由于其他模型不断调用外部工具,处理单张图像需要数秒时间,而 BEE 仅需一次通过即可完成。在测试中,BEE-7B 每秒处理 1.61 个样本,而 DeepEyes 模型每秒仅能处理 0.07 个样本。这是一个巨大的效率飞跃。

论文并未声称的内容
作者谨慎地表示,这并不是解决所有问题的灵丹妙药。他们承认,对于非常简单的任务(如阅读文本或识别基本形状),BEE 完全不需要使用工具,强行使用反而会损害性能。他们还指出,虽然 BEE 在处理“细粒度”细节(如在拥挤场景中发现微小物体)方面表现出色,但它并不一定会让模型在原本擅长的领域(如基础逻辑或 OCR)变得更好,除非任务本身涉及视觉操作。

简而言之,BEE 是一个学会了“知之为知之,不知为不知”的机器人。它不再在简单任务上浪费时间寻求帮助,而是只在谜题真正棘手时才动用其心理工具。结果如何?一种更聪明、更快、更高效的 AI 看世界的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →