← 最新论文
⚡ electrical engineering

Open-Set Source Tracing as Compositional Factors via Structured Prototypes

本文提出了一种新颖的开集源溯源框架,该框架将生成起源重新定义为组合因子,并利用具有子空间划分的结构化正交归一原型来实现鲁棒的组合泛化,在少样本识别任务中显著优于现有基准方法。

原作者: Santiago Rubio, Antonio Almudévar, Antonio Miguel, Eduardo Lleida, Alfonso Ortega

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Santiago Rubio, Antonio Almudévar, Antonio Miguel, Eduardo Lleida, Alfonso Ortega

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一名试图查明是谁创作了某段特定假新闻或伪造语音的侦探。在过去,这项工作很简单:“这是真的还是假的?”但现在,由于 AI 已经如此先进,真正的问题变成了:“具体是哪台 AI 机器制造了它?”

这篇论文提出了一种解决这个谜题的新方法。作者认为,不应该将每个 AI 模型都视为一个单一且神秘的“黑盒”,而是应该将其身份拆解为它的成分

以下是他们构思的拆解方式,使用了简单的类比:

1. 问题所在:“一刀切”的错误

目前,大多数系统将 AI 模型视为一个独特的指纹。如果你有 100 个不同的 AI 模型,系统就会尝试记住 100 个截然不同的指纹。

  • 缺陷: 如果出现了一个新的 AI,它使用了与旧模型相同的“引擎”(架构),但使用了不同的“数据”进行训练,旧系统就会感到困惑。这就像试图通过车牌来识别汽车,但即便车型相同,车牌却是全新的。系统无法识别其中的联系。

2. 解决方案:“乐高”法

作者提出,一个 AI 的“声音”并不是一个坚实的整体,而是由三个特定部分构建而成的乐高结构

  • 蓝图 (Architecture/架构): AI 实际的代码和设计(就像汽车的引擎)。
  • 原料 (Training Data/训练数据): AI 为了学习而摄取的特定书籍、歌曲或声音(就像汤里特定的香料)。
  • 秘方 (Residual Factors/残差因子): 训练过程中产生的随机设置、运气或微小的调整,即使蓝图和原料相同,也会留下独特的“指纹”。

目标: 系统不再是死记硬背整个乐高城堡,而是学习识别单个积木(蓝图)和特定的原料组合(数据)。这使得系统即使在从未见过某个特定的城堡时,也能通过观察它使用了哪种已知的积木和哪种已知的原料组合,来推测出是谁建造了它。

3. 他们是如何做到的:“分拣帽”策略

为了让计算机理解这些分离的成分,他们为数据创建了一个特殊的分类系统:

  • “正交原型” (Orthonormal Prototypes/刚性网格): 想象一张地图,每个可能的 AI 模型都被分配在网格上的一个固定、完美的点上。这能防止计算机产生混淆,并保持不同模型之间的距离。
  • “子空间划分” (Subspace Partitioning/三个抽屉): 这是核心创新。他们将计算机的记忆分成了三个独立的抽屉:
    1. 抽屉 A (蓝图): 仅存储关于 AI 设计的信息。
    2. 抽屉 D (原料): 仅存储关于训练数据的信息。
    3. 抽屉 R (剩余物): 一个特殊的“杂物抽屉”,用于存放那些无法整齐放入前两个抽屉的随机噪声和“秘方”。

通过这种分离,计算机可以判断:“啊,这个声音使用了与模型 X 相同的蓝图,但其原料来自数据集 Y。”

4. 结果:更出色的侦探工作

作者在名为 MLAAD(一个伪造语音集合)的数据集上进行了测试。

  • 旧方法 (ArcFace): 当计算机看到一个旧蓝图与新原料的组合时,它会陷入僵局。这就像一个只认识嫌疑人长相、却不了解其穿衣风格的侦探。
  • 新方法: 由于系统将“蓝图”与“原料”分离,它能够成功识别出那些它从未见过的特定组合的伪造语音。
    • 它在识别使用已知引擎新数据制作的伪造品时表现得更好。
    • 它在识别使用新引擎已知数据制作的伪造品时表现得更好。
    • 它处理了“随机噪声”(秘方),而没有让这些噪声干扰识别过程。

5. 为什么这很重要

把这想象成烹饪。如果你只把“肉酱意面”记忆为一道单一的菜肴,那么当你遇到“培根蛋奶面”时,即使它们都使用了意大利面,你也无法识别出来。但如果你理解了意大利面是一种原料,而肉酱是另一种原料,你就能立即识别出这些原料以新方式混合而成的各种新菜肴。

这篇论文表明,通过教导 AI 检测器去理解伪造语音的成分,而非仅仅是最终成品,我们可以更快、更准确地捕捉到新型伪造品,即使我们从未见过那种特定的伪造手段。

简而言之:他们不再试图死记硬背每一个伪造的声音,而是开始学习如何阅读配方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →