← 最新论文
🤖 AI

Optimization before Evaluation: Evaluation with Unoptimised Prompts Can be Misleading

本文认为,当前依赖静态提示的LLM评估框架具有误导性,因为提示词优化会显著改变模型排名,因此必须针对每个模型进行提示词优化,才能准确识别特定任务的最佳模型。

原作者: Nicholas Sadjoli, Tim Siefken, Atin Ghosh, Yifan Mai, Daniel Dahlmeier

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicholas Sadjoli, Tim Siefken, Atin Ghosh, Yifan Mai, Daniel Dahlmeier

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《评估之前先优化:使用未优化的提示进行评估可能会产生误导》的通俗解释,并辅以日常类比。

核心理念:“一刀切”的陷阱

想象你是一位招聘经理,正试图为你的餐厅寻找最佳厨师。你有五位不同的厨师(我们称他们为模型 A、B、C、D 和 E)。为了测试他们,你给每个人都发了一张完全相同的食谱卡:“做一锅炖菜。使用盐、胡椒和洋葱。”

你看着他们烹饪,品尝炖菜,然后进行排名。厨师 B 获胜。你雇用了厨师 B。

问题在于: 厨师 B 非常擅长遵循那特定的食谱,但也许厨师 D 实际上是个天才,只是需要食谱的写法稍有不同才能大放异彩。也许厨师 D 需要指令写成“先煸炒洋葱,然后加盐”,才能发挥最佳水平。

这篇论文认为,当前测试人工智能模型(大型语言模型)的方式就像那位招聘经理一样。他们给每一个 AI 完全相同的静态提示(食谱卡),并根据谁在那张特定卡片上表现最好来进行排名。

作者指出,这是具有误导性的。在现实世界中,如果你雇佣一个 AI,你不会只给它一个通用的提示;你会调整指令,以从那个特定的 AI 身上获得最佳表现。这篇论文将这一过程称为提示优化(Prompt Optimization, PO)

实验:调整食谱,改变胜者

研究人员选取了五个流行的 AI 模型,并在各种任务上(如解决数学问题、回答商业问题或提取数据)对它们进行了测试。

  1. 第一轮(旧方法): 他们给每个模型相同的“基础”提示。他们进行了排名。
  2. 第二轮(新方法): 他们使用自动化工具为每个模型单独“微调”提示。他们问 AI:“我们如何重写指令,才能让最好地理解?”然后重新运行测试。

结果: 排名完全改变了。

  • 在某些情况下,第一轮中排名垫底的模型在第二轮中跃升至第一名。
  • 在旧测试中“最好”的模型,在获得针对其特定“大脑”量身定制的指令后,未必是最好的。

类比: 这就像在跑道上测试跑步者。

  • 旧方法: 你让每个人都穿着厚重的靴子跑步。跑步者 A 获胜,因为他们习惯了重靴。
  • 新方法: 你给跑步者 A 轻便的运动鞋,给跑步者 B 定制的矫形鞋垫。突然间,跑步者 B 获胜了。
  • 结论: 如果你只让他们穿着重靴测试,你就会为马拉松招聘了错误的跑步者。

研究的关键要点

1. “最佳”模型取决于提示
该论文发现,竞赛的“获胜者”会根据指令的写法而改变。如果你想为特定工作挑选最好的 AI,你必须首先针对该特定 AI 优化指令。如果不这样做,你可能会选择一个实际上并不符合你需求的平庸模型。

2. 不同模型的反应不同
就像人一样,不同的 AI 有不同的“个性”或敏感度。

  • 有些模型(如研究中的模型 B)对提示变化非常敏感。微小的调整就能让它们的表现大幅提升。
  • 其他模型在特定任务(如简单的路由)上已经非常擅长,调整提示对它们帮助不大,有时甚至会让它们感到困惑。

3. “批评者”可能会感到困惑
研究人员使用了一个“批评者”AI(GPT-4o)来帮助重写其他模型的提示。通常,这效果很好。然而,有时批评者变得过于聪明,或者指令变得过于复杂,导致模型失败。

  • 例子: 在一种情况下,优化后的提示让 AI“一步步思考”得太多,以至于它开始回答提示中的示例问题,而不是实际的测试问题。这就像学生在考试时大声朗读练习题的答案,而不是参加考试。

这对您(从业者)意味着什么

如果您是一家试图选择 AI 来完成某项工作(如回复客户邮件或分析文档)的企业,不要仅仅运行标准基准测试。

该论文得出结论,要找到适合您特定任务的真正最佳模型,您必须:

  1. 确定您的任务。
  2. 尝试不同的模型。
  3. 针对每个模型单独优化提示,以了解它们的真实能力。
  4. 然后,选出获胜者。

如果您跳过第 3 步,仅使用通用提示,您很可能会基于具有误导性的测试做出错误的招聘决定。

总结

这篇论文是一个警告:不要通过鱼爬树的能力来判断鱼,也不要通过 AI 遵循通用提示的能力来判断 AI。 要知道谁才是真正最好的,你必须用他们的语言交流。如果您不为每个模型优化提示,您的评估结果很可能是错误的,您最终可能会得到错误的工具来完成任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →