PromptSplit: Revealing Prompt-Level Disagreement in Generative Models
原作者: Mehdi Lotfian, Mohammad Jalali, Farzan Farnia
原作者: Mehdi Lotfian, Mohammad Jalali, Farzan Farnia
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:PromptSplit
问题陈述
提示词引导的生成式人工智能模型(涵盖视觉与语言领域)已大量涌现,然而,针对特定输入提示词来系统性比较其行为的方法仍然有限。现有的评估指标(如 FID、Inception Score 和 CLIP-Score)仅提供聚合质量指标,将模型行为压缩为单一标量值。这些指标往往掩盖了依赖于提示词的差异。例如,两个模型对于给定的提示词可能会生成高质量图像,但会根据特定的提示词类别(例如,一个模型始终生成男性形象,而另一个模型在提示词“一个人”下生成女性形象)在内容或风格上表现出显著分歧。目前的谱分析和分布比较方法通常在无提示词的设置下运行,通过对提示词进行边缘化处理,从而无法隔离导致行为分歧的具体输入类别。
方法论
作者提出了 PromptSplit,一种提示词感知的无监督谱框架,旨在检测并分析两个生成模型之间由提示词引起的差异。
1. 联合提示词-输出表示
PromptSplit 通过构建提示词特征 (ϕT) 与输出特征 (ϕX 或 ϕY) 的张量积嵌入来构建联合表示。对于提示词 t 和输出 x,联合特征定义为:
ϕ⊗(t,x)=ϕT(t)⊗ϕX(x)
这诱导了一个乘积核 k⊗([t,x],[t′,x′])=kT(t,t′)⋅kX(x,x′),捕捉了输入空间与输出空间之间的乘性交互。
2. 核协方差差异
对于两个数据集 DX(来自模型 X)和 DY(来自模型 Y),该方法计算经验联合核协方差算子 C^T⊗X 和 C^T⊗Y。核心分析是协方差差异算子:
Λ^X,Y∣T=C^T⊗X−ηC^T⊗Y
其中 η 是一个超参数。该算子的主特征向量揭示了两个模型在联合空间中表现出最显著行为差异的方向。
3. 核技巧与谱分析
直接对高维协方差算子进行特征分解在计算上是不可行的。作者应用核技巧构建了一个大小为 (n+m)×(n+m) 的块核矩阵 KX,ηY∣T,该矩阵与高维算子具有相同的非零特征值。该块矩阵的特征向量对应于联合空间中的分歧模式。
4. 可扩展随机投影
为了处理大规模数据集(其中 n,m 超过数万),PromptSplit 采用了随机投影近似。联合张量特征通过高斯随机矩阵被投影到低维 r。这使得谱分解的计算复杂度从 O((n+m)3) 降低到 O((n+m)r2+r3)。
- 理论保证: 论文证明了特征空间估计与全维度结果之间的期望偏差受 O(1/r2) 限制,确保了该近似能以高概率保留分歧方向。
核心贡献
- 提示词级比较表述: 本研究将模型比较表述为一个联合提示词-输出谱问题,超越了聚合指标,能够识别导致行为分歧的具体提示词类别。
- PromptSplit 框架: 引入了一种基于核的框架,通过张量积嵌入将提示词与输出耦合,以分析联合核协方差差异的特征谱。
- 可扩展近似: 开发了一种随机投影方法,能够实现具有 O(1/r2) 理论误差界的规模化数据集分析,使该方法在现实世界的生成模型评估中具有实用性。
- 可解释性: 该方法提供了可解释的“分歧模式”,将特定的提示词簇与输出的分歧性质明确联系起来。
实验结果
作者在文本生成图像(T2I)和文本生成文本(LLM)场景下对 PromptSplit 进行了评估:
- 合成验证: 在受控设置下(例如具有已知颜色/灰度提示词不匹配的 MNIST-M),PromptSplit 成功识别出了负责分歧的基准提示词类别。
- 文本生成图像模型: 对 Stable Diffusion XL、PixArt-Σ 和 Kandinsky 的比较揭示了在风格、构图和对齐方面的提示词依赖型分歧。例如,该方法识别出了特定的职业类提示词(如“护士”、“木匠”),在这些提示词下,不同模型产生了显著不同的视觉呈现。
- 大语言模型 (LLMs): 对 Qwen 3 和 Gemma 3 在 NQ-Open 数据集上的比较识别出了问题的不同聚类(例如关于美国总统或演员的问题),在这些问题上,模型生成了迥异的答案。
- 引导应用: 作者展示了如何使用 PromptSplit 来引导潜在扩散过程,通过将分歧梯度引入采样过程,成功地使生成的图像分布与参考数据集(如特定的绘画风格)保持一致。
意义与主张
论文声称 PromptSplit 提供了一个原则性的、可解释的工具,用于检测生成模型在“何时”以及“如何”产生分歧,填补了聚合质量指标留下的空白。通过显式建模联合提示词-输出空间,它隔离了驱动行为差异的具体输入类别。
作者将 PromptSplit 定位为一种基于嵌入的二阶谱方法。他们也谨慎地指出,虽然其设计实现了可扩展性和可解释性,但并不旨在刻画所有高阶的条件生成行为特征。这项工作被视为迈向更细粒度的、针对日益增长的生成式人工智能生态系统的提示词调节评估的重要一步。该实现已公开,以促进该领域的进一步研究。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 AI 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。