← 最新论文
💬 NLP

One prompt is not enough: Instruction Sensitivity Undermines Embedding Model Evaluation

本文表明,当前针对指令微调嵌入模型的单提示评估方法存在根本性缺陷,因其对指令措辞高度敏感,导致性能得分失真且排行榜排名不稳定,因此亟需纳入提示鲁棒性的基准测试。

原作者: Yevhen Kostiuk, Kenneth Enevoldsen

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Yevhen Kostiuk, Kenneth Enevoldsen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在评估一群运动员的跑步能力。你让他们排成一排,说:“全力奔跑!”然后为他们计时。这就是目前我们测试 AI“嵌入”模型(即帮助计算机理解文本含义的“大脑”)的标准方式。

但这篇论文指出,当前测试这些模型的方式,就像让一名运动员进行短跑,却只允许他在恰好是他最擅长的跑道上奔跑,而让其他所有人都在泥泞的场地上奔跑。结果呢?排行榜上显示的分数并不能反映全部真相。

以下是研究人员发现的要点,使用简单的类比进行说明:

1. “魔法词”问题(提示词敏感性)

这些 AI 模型经过“指令微调”,意味着它们需要特定的句子(即“提示词”)来告知其该做什么。

  • 类比:想象一位厨师,只有在你说“请做出你能做的最美味的意大利面”时,他才能做出惊人的意大利面。如果你说“煮点面条”,他可能只会做出平庸的成品;如果你说“创作一道意大利面烹饪杰作”,他可能会把厨房烧掉。
  • 发现:研究人员在 11 项不同任务中测试了 6 个不同的 AI 模型。对于每项任务,他们不仅使用了“官方”问题(默认提示词),还编写了 15 种不同的问题变体。
  • 结果:他们发现,AI 的表现会根据“如何提问”而剧烈波动。有时某个模型得分非常高;有时,完全相同的模型却得分非常低,仅仅因为措辞发生了细微变化。

2. “虚假高分”与“不公低分”

该论文发现,当前的测试系统主要通过两种方式误导我们:

  • 提示词膨胀(高分):有时,“官方”问题恰好是某个特定模型的“完美”问题。这就像给运动员提供顺风和下坡。模型因此获得一个看似惊人的巨大分数,但这实际上是一个异常值,并不代表该模型通常的表现。
  • 提示词压缩(低分):相反,有时官方问题对某个模型来说是最糟糕的问题。这就像让运动员穿着沉重的靴子进行短跑。模型因此获得极差的分数,使其看起来表现不佳,而实际上它可能相当优秀。

3. “排行榜洗牌”(排名混乱)

这项研究最令人震惊的部分在于排名的变化。

  • 类比:想象一场比赛,冠军的归属取决于谁获得了最佳的起跑位置。
  • 发现:研究人员表明,如果你能为每个模型挑选“完美”的问题,那么任何模型都可以被塑造成排名第一的冠军。即使是通常排名最后的模型,只要给它正确的“魔法词”,同时给其他模型错误的提示词,也能被推上榜首。
  • 现实:这意味着当前的“排行榜”(类似于体育排名)并不稳定。如果一家公司想展示其模型,他们可能只需找到那一个能让其模型看起来像天才的特定问题,而忽略那数百个它表现挣扎的其他问题。

4. “提示词黑客”(并非作弊的作弊)

作者将这种现象称为“提示词黑客”。

  • 类比:这就像一个学生参加模拟测试,尝试了 50 种不同的答题方式,找到了能得"A"的那一种,然后只提交那个答案。他们并没有改变自己的大脑(模型的代码),只是找到了测试说明中的漏洞。
  • 发现:这并不总是出于恶意。开发者可能在开发过程中尝试几个不同的问题,找到效果最好的那一个,然后报告该分数。但由于他们没有报告所有尝试的平均值,公众得到的就是一个被误导性地夸高的分数。

提出的解决方案

该论文建议,我们应停止使用单一的“点估计”(即来自一个问题的一个分数)来评判这些模型。

  • 修正方法:与其问“你在这个问题上表现如何?”,不如问“你在所有这 15 个不同版本的问题上表现如何?”
  • 目标:我们需要看到分布(分数的离散范围),而不仅仅是一个单一数字。这将揭示一个模型是始终如一地优秀,还是仅仅因为恰好被问到了特定的问题而运气好。

简而言之:我们目前评估这些 AI 模型的方式,就像仅凭一首他们完美演奏的歌曲来评判一位音乐家,却忽略了他可能在其他每一首歌上都表现糟糕。为了获得公正的全貌,我们需要聆听他们的整张歌单。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →