← 最新论文
💻 computer science

STA-VPT: SpatioTemporally Aligned Visual Prompt Tuning

STA-VPT 引入了一种新颖的视觉提示范式,通过学习空间或时空对齐的提示标记图(prompt token maps)来保留输入结构并实现细粒度的、特定区域的提示,从而克服了传统序列化和统一化提示方法的局限性。

原作者: Wenjie Pei, Tongqi Xia, Qizhong Tan, Jiandong Tian, Guangming Lu, Jun Yu

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Wenjie Pei, Tongqi Xia, Qizhong Tan, Jiandong Tian, Guangming Lu, Jun Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代人工智能的世界里,计算机在视觉方面已变得异常出色。它们可以识别照片中的猫,或者识别视频中特定的手势,其准确度往往能与人类的感知相媲美。这种能力通常源于在海量数据上对大规模模型进行训练,而这一过程需要巨大的计算能力和时间。然而,当研究人员想要教导这些庞大的、预训练好的模型去执行一项新的、特定的任务时——比如区分不同品种的狗,或者在医学扫描中发现罕见疾病——他们会面临一个困境。从头开始重新训练整个模型通常过于昂贵且缓慢。相反,科学家们使用了一种被称为“参数高效微调”的技术。可以将这想象成在为一个高度受过教育的专家提供一小套专门的指令,以帮助其适应新工作,而不是送他回大学再读一个学位。这套指令由一些额外的、可调节的指令组成,旨在引导模型现有的知识向新的目标靠拢。

数年来,创建这些指令最流行的方法是将它们视为句子中的单词列表。就像语言模型通过阅读单词序列来理解一个故事一样,视觉模型也被教导通过阅读一系列不可见的数学标记(tokens)来理解图像。这些标记被添加到图像数据的最前面,作为一个通用的提示(prompt),告诉模型应该寻找什么。虽然这种方法效果不错,但它有一个根本性的缺陷:它将图像视为一个扁平的、无序的列表。它忽略了图像是一个像素网格这一事实,而在网格中位置至关重要。一个代表左上角“狗耳朵”的标记,与一个代表右下角“狗尾巴”的标记被同等对待,而且每一个指令标记都被迫向图像的每一个部分提供相同的建议。这种空间意识的缺失意味着模型难以理解场景中不同部分之间的特定关系,并且无法针对图像内不同区域的独特需求来定制其引导。

一组研究人员现在提出了一种不同的方法,一种尊重视觉数据自然结构的方法。他们引入了一种名为“时空对齐视觉提示微调”(STA-VPT)的新方法。该系统不再创建一个长长的、扁平的指令列表,而是构建一个与图像形状完美匹配的二维提示地图。如果图像是一个小方块组成的网格,那么指令也是同样大小的网格。这种对齐确保了位于图像左上角的指令,恰好位于数据左上角指令的旁边。在处理视频的情况下,该系统更进一步,创建了一个三维指令块,既能与帧的空间布局对齐,也能与帧之间的流动时间对齐。

其核心思想是,地图中的每个指令标记都充当其特定位置的专业专家。与其让每个标记向整个图像大声喊出同样的建议,不如让特定坐标处的标记只专注于该坐标处对应的视觉数据。这使得系统能够学习细粒度的细节,例如叶子的纹理或手的动作,而不会将其与场景的其他部分混淆。研究人员设计该系统时,使这两个地图——图像地图和指令地图——能够直接进行对话。它们以尊重其空间位置的方式交换信息,使模型通过不断检查所见内容与接收到的引导之间的对齐情况,来优化其对图像的理解。

为了测试这种新的组织指令的方式是否真的更好,研究人员将其方法置于一系列严格的试验中。他们将其应用于各种任务,从简单的图像分类(目标是命名图片中的物体),到复杂的语义分割(要求计算机为场景中的每个物体绘制精确的轮廓)。他们还在视频数据上进行了测试,要求模型识别人类动作,如打高尔夫球或骑马。在每种情况下,他们都将这种新方法与使用扁平、顺序列表指令的标准技术进行了对比。结果很明确:这种新的、空间对齐的方法始终优于旧方法。在涉及复杂场景或物体间细微差异的困难数据集上,这种提升非常显著。模型学会了更精准地聚焦于图像或视频的相关部分,比以前更有效地忽略了背景噪声。

研究人员还深入研究了为什么这会奏效。他们发现,通过在指令中保留图像的空间结构,模型可以更好地理解视觉输入中不同部分之间的关系。它不再仅仅是基于一堆杂乱的特征进行猜测,而是构建了一幅连贯的图景,其中特征的位置至关重要。此外,将专门指令分配给特定区域的能力,使模型能够更高效地适应多样化的视觉模式。在视频任务中,系统跨越空间和时间对齐指令的能力,帮助它捕捉运动的动态特性,从而实现了更准确的动作识别。研究表明,通过简单地改变指令的形状以匹配数据的形状,计算机可以学习得更加有效,并以相似的计算成本实现更好的结果。

这项工作表明,我们引导人工智能的方式与智能本身一样重要。通过摒弃“一刀切”的指令列表并拥抱镜像现实世界的结构,研究人员找到了一种让这些强大的模型变得更精确、更具适应性的方法。研究结果表明,对于涉及图像和视频的任务,尊重数据的几何结构是至关重要的。这种新方法不需要重新训练整个庞大的模型,保持了过程的高效性,但通过确保提供的引导与试图理解的视觉世界一样具有结构性和细节性,它释放了更高水平的性能。随着人工智能的不断演进,这种向具备空间感知能力的提示方式的转变,可能会成为教机器看清世界的标准方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →