← 最新论文
💻 computer science

Retrieval-Augmented Visual Prompting: Guiding Foundation Models in Two-Photon Imaging

本文介绍了检索增强视觉提示(Retrieval-Augmented Visual Prompting, RAVP)框架,该框架通过将检索到的已标注样本作为视觉提示注入到 SAM 3 等基础模型中,增强了双光子钙成像中的零样本神经元检测和实例分割能力,为传统的微调提供了一种有效的推理时替代方案。

原作者: Salvatore Calcagno, Marco Finocchiaro, Giovanni Bellitto, Daniela Giordano, Concetto Spampinato, Federica Proietto Salanitri

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Salvatore Calcagno, Marco Finocchiaro, Giovanni Bellitto, Daniela Giordano, Concetto Spampinato, Federica Proietto Salanitri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在活体大脑内部那寂静、黑暗的世界里,科学家们使用一种强大的显微镜来观察神经元的放电。这种被称为双光子钙成像的技术,将单个脑细胞的电活动捕捉为黑暗背景中明亮、闪烁的光点。它是现代神经科学的基石,让研究人员能够观察细胞群体如何协同工作以产生思想和运动。然而,将这些发光的视频转化为有用的数据却极其困难。图像是杂乱的;有些细胞闪烁得异常明亮,而另一些则显得暗淡无光,且细胞的外观会根据实验动物、拍摄的大脑深度或所使用的特定设备而发生剧烈变化。为了研究这些细胞,科学家必须首先为每一个细胞绘制精确的轮廓,这项任务缓慢、昂贵且容易出现人为错误。多年来,人们一直希望人工智能可以自动完成这项工作,但由于这些细胞外观的多样性,计算机程序很难从一个实验泛化到另一个实验。

最近,新一代人工智能模型的出现使得它们能够通过极少的指令理解图像。这些被称为“基础模型”(foundation models),它们在海量的日常照片上进行训练,学习识别形状和物体,而无需被教导每一个细节。其中一个旨在分割图像中任何物体的模型,在医学成像领域展现出了潜力。然而,当研究人员尝试将这一强大的工具直接应用于复杂且多变的脑细胞视频世界时,它却遇到了困难。这个受过猫、汽车和树木训练的模型,并不自然地理解神经元那种微妙的、发光的团块。它需要帮助,但帮助人工智能的传统方法是重新训练它,即喂给它数千个新示例,直到它学会新的规则。这个过程缓慢,需要大量的标注数据,并且往往会将模型锁定在一种特定的观察方式上,使其难以灵活应对未来的实验。

意大利卡塔尼亚大学的一个研究小组提出了一个不同的问题。他们没有试图改变人工智能的“大脑”,而是思考是否可以改变它观察世界的“眼睛”。他们提出了一种名为“检索增强视觉提示”(Retrieval-Augmented Visual Prompting)的方法。想象一下,你正在向一位从未见过某种特定云朵的朋友描述它。你可以尝试用语言描述其形状和颜色,或者你只需展示一张该云朵的照片。研究人员意识到,引导人工智能的最佳方式是给它看一张图片。他们构建了一个系统,在模型观察新的脑部图像之前,会先向它展示一张从已标注图像库中精心挑选出的神经元示例。这个示例被放置在紧邻新图像的位置,充当视觉提示。随后,模型被要求寻找所有看起来与该示例相似的其他神经元。

研究人员在来自小鼠脑部记录的大规模公开数据集中测试了这个想法。他们发现,仅仅向模型展示一个经过精心挑选的示例,就能显著提高其寻找和勾勒神经元的能力,即使该模型从未见过那种特定类型的脑部记录。关键不在于展示任何示例,而在于展示“正确”的示例。他们开发了一种智能方法,通过将示例的亮度与纹理与正在分析的特定图像进行匹配,从而从库中挑选出最佳示例。当使用这种方法时,模型的性能大幅提升,缩小了品牌全新的、未经训练的模型与经过广泛针对性训练的模型之间的差距。事实上,使用一个完美的匹配示例比同时展示多个不同示例更有效。这项研究表明,对于像分析脑扫描这类专业任务,前进的最有效路径可能不是从头重建人工智能,而是仅仅在它需要做出决策的那一刻,给予它正确的视觉语境。

结果是清晰且一致的,涵盖了不同类型的脑部记录。当模型在没有任何引导的情况下进行猜测时,它经常会漏掉微弱的细胞或画出杂乱的轮廓。但当研究人员提供了一个来自其库中的相关示例时,模型突然理解了该寻找什么。它变得更擅长寻找那些通常会被忽视的微弱、暗淡的细胞,以及分离那些互相接触的细胞。研究人员还发现,选择示例的具体方式至关重要。一个随机的示例会有所帮助,但一个被选择用来匹配新图像特定条件的示例则效果更好。他们训练了一个轻量级的微型计算机程序来充当“选择器”,学习预测哪个示例对给定图像最为有用。这个选择器使系统能够即时适应新条件,而无需改变主人工智能模型的任何核心设置。

这种方法为人工智能的标准重训方法提供了一个引人注目的替代方案。重训需要大量的计算能力和时间,并且往往会导致一个在特定任务上表现卓越、却忘记了如何处理其他任务的模型。新方法保持原始模型冻结且不变,在保留其通用知识的同时,通过简单的视觉线索使其能够适应新的、困难的任务。研究人员发现,这种方法能以极小的成本实现以往通过全面重训才能获得的性能增益的大部分。这表明,在数据稀缺且条件多变的领域,人工智能的未来可能不在于教机器新的事实,而在于教它如何通过正确的镜头来看待世界。通过将视觉记忆直接注入输入端,研究人员证明了基础模型可以通过视觉提示,在无需承担参数调整沉重负担的情况下,被引导去执行专门生物医学成像中的专家级任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →