← 最新论文
💻 computer science

Conservative Proxy Prompting for Reliable Frozen Vision–Language Models with Missing Modalities

本文提出了保守代理提示(Conservative Proxy Prompting, CPP),这是一个参数高效的框架,通过构建特征空间代理表示并保守地调节其贡献以避免误导性信号,从而增强冻结的视觉语言模型在模态缺失情况下的可靠性。

原作者: Xiaoyong Mei, Wei Ji, Jiale Dong, Chao Duan, Mingyan Zhang, Fudan Zheng

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoyong Mei, Wei Ji, Jiale Dong, Chao Duan, Mingyan Zhang, Fudan Zheng

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,出现了一类被称为视觉语言模型(vision-language models)的新兴系统。这些数字大脑通过同时观察图像和阅读文本来理解世界,学习图像与文字如何相互关联。由于它们是在大规模的配对图像和文本集上进行训练的,因此在描述照片或回答有关场景的问题等任务中表现得异常出色。然而,这些系统建立在一个脆弱的假设之上:即它们将始终同时接收到图片和描述。但在混乱的现实世界中,这很难得到保证。传感器会失效,数据会在传输过程中丢失,隐私过滤器可能会剥离掉描述,导致系统只剩下它所期望的一半信息。当一个经过完整配对数据训练的模型突然被迫仅凭碎片信息进行猜测时,它的信心往往会崩溃,其答案也会变得不可靠。研究人员面临的挑战不仅是帮助模型进行猜测,而是要教会它区分什么是它真正看到的,什么是它仅仅在推断的。

来自浙江师范大学和中山大学的研究团队开发了一种名为“保守代理提示”(Conservative Proxy Prompting)的新方法来解决这个问题。他们的这种方法承认了人工智能的一个基本事实:当模型必须根据所见内容来猜测缺失的信息时,这种猜测本质上是不确定的。想象一个人在餐厅里尝试识别一道菜。如果他们既能看到食物又能看到菜单,他们是确定的;如果菜单缺失了,他们可以通过观察食物来猜测菜名,但他们应该对自己的答案保持些许不确定感。现有的方法通常试图将缺失的信息重建为真实存在,实际上是将一次猜测赋予了与直接观察同等的权重。研究人员认为这是危险的,因为重建的数据仅仅是一个估计值,将其视为事实会误导系统。相反,他们的新框架将这些猜测视为“代理”证据——有用,但需要谨慎对待。

其核心解决方案包含一个两步走的策略,可以在无需从头开始重新训练现有强大AI模型的情况下进行操作。首先,系统使用一种称为“提示学习”(prompt learning)的技术,通过仅使用极少量的可调参数,温和地引导模型的理解力向特定任务(如识别电影类型或食物种类)靠拢。这使得模型能够在不重构整个大脑的情况下,保持对特定工作的敏锐度和准备状态。第二,也是最重要的一点,系统引入了一个处理缺失数据的机制。当图片缺失时,系统利用文本来勾勒出图片可能呈现的样子;当文本缺失时,系统则利用图片来猜测文字。但关键的区别在于:在将这些猜测出的信息与真实数据混合之前,系统会刻意缩小其影响力。它应用了一个“保守”过滤器,降低猜测的权重,使其在支持决策的同时不会压倒直接证据。这确保了如果猜测错误,它不会把最终答案也带偏。

为了测试这一想法,研究人员在三个非常不同的现实世界数据集上对其进行了严格测试。他们使用了一个包含电影海报和剧情摘要的集合、一个包含大量食物图像及食谱的数据集,以及一个旨在测试系统能否识别仇恨言论的具有挑战性的网络迷因(memes)数据集。在每种情况下,他们都通过随机移除数据中的图像或文本来模拟现实世界的故障,有时甚至会移除高达百分之九十样本中的信息。结果非常明确:这种新方法始终优于那些试图简单重建缺失数据的其他方法。通过控制猜测的影响力,即使在丢失大部分信息的情况下,该系统仍能保持高准确度。它证明了模型并不需要完美地进行猜测才能保持可靠,它只需要知道该在多大程度上信任自己的猜测。

研究还表明,这种可靠性并非以沉重的代价换取。该方法仅需极少量的可调参数(大约在160万到270万之间)即可实现这些结果。相比之下,其他试图实现类似鲁棒性的方法通常需要近三倍的可调设置。这种效率意义重大,因为这意味着系统可以快速适配新任务并易于存储,而不需要庞大的计算能力。研究人员发现,特定的“引导”设置数量很重要,但并没有一个适用于所有情况的“魔术数字”,适度的调整通常是最理想的状态。此外,该系统展示了其处理从未见过的情况的能力。即使仅在完整数据上进行训练,然后在缺失数据上进行测试,它也能很好地适应,这表明“对猜测保持谨慎”这一原则具有超越特定训练案例的泛化能力。

最终,这项工作将焦点从“完美重建缺失信息”转向了“管理重建过程中的不确定性”。研究人员证明,在一个数据经常不完整的世界里,最可靠的人工智能系统并不一定是那些试图填补每一个空白的系统,而是那些理解自身知识极限的系统。通过将推断出的信息视为一种有益但次要的声音,而非直接观察的对等伙伴,系统变得更加稳定和值得信赖。这种方法为在现实世界中部署智能系统提供了一条切实可行的路径——在现实中,传感器会损坏,数据会丢失,而这一方法确保了即使在无法看到全貌时,这些工具依然能够发挥作用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →