科学家们曾尝试通过使用“Token 缩减”(token reduction)来解决这个问题,这是一种高级说法,指他们在 AI 观察图像之前,先剔除掉他们认为不重要的图像部分。他们使用了一些捷径,比如观察 AI 的注意力似乎集中在图像的哪些部分,然后删除其余部分。然而,你即将阅读的这篇论文表明,这些捷径其实相当不可靠。它们经常丢弃掉 AI 寻找物体所需的那些微小且重要的细节,却保留了无聊的背景。这就像是在草堆里找一根针,通过扔掉干草来寻找,却不小心把针也扔掉了,因为比起嘈én闹的稻草,它看起来显得过于“安静”。
于是,由研究员孙汇鑫(Huixin Sun)及其团队提出的新框架 SmartRes 登场了。SmartRes 不再是在 AI 已经观察过图像之后才盲目地剪裁部分图像,而是通过改变游戏规则来实现“主动性”。它就像一名聪明的摄影师,首先对整个房间进行一次快速的、模糊的快照,以获取整体布局。然后,利用一个轻量级的“路由器”(可以把它想象成一个非常快速、微小的决策者),它能精准地判断出有趣物体所在的位置。一旦确定了位置,它就只针对这些特定区域进行放大,并拍摄一张超清晰的高分辨率照片,而让房间的其他部分保持模糊。通过这种方式,AI 既能获得寻找小物体所需的高清细节,又不会在处理空旷的墙壁或地板上浪费能量。
简而言之,SmartRes 表明,让 AI 变得高效的最佳方式不是简单地删除数据,而是聪明地决定在哪里投入你的计算能力。这就像是一名侦探,他不会按街区逐一搜索整个城市,而是先通过快速扫视锁定犯罪现场,然后只在那个特定点位动用高倍显微镜。研究结果表明,这种策略让 AI 能够在复杂的、第一视角的视图中看到微小且重要的细节,而不会被处理高分辨率图像的巨大成本所拖累。
保序视觉标记组装: SmartRes 并非直接丢弃标记,而是构建一个变长的视觉序列。它保留背景区域的紧凑型 LR 特征,并将选定的 LR 补丁替换为与目标中心区域对应的连续 HR 标记组。至关重要的是,这种组装方式保持了规范的行扫描顺序(raster-scan order),确保了 LLM 处理时的空间结构完整性。
带边际正则化的路由目标: 为了处理第一视角数据中固有的严重的显/背景不平衡问题(即物体仅占据图像极小部分),作者引入了带边际正则化的路由目标。除了标准的二元交叉熵(BCE)损失外,他们还采用了边际合页损失(margin hinge loss),显式地强制要求前景和背景标记的逻辑分布(logit distributions)实现分离。这增加了前景召回率,并防止路由器被易于分类的背景标记所主导。