← 最新论文
🤖 AI

Structured Prompts Improve Evaluation of Language Models

该研究通过构建可复现的 DSPy+HELM 框架,首次系统性地量化了提示词选择对基准评估结果的影响,发现结构化提示策略不仅能平均提升 6% 的性能,还会显著改变模型在排行榜上的排名。

原作者: Asad Aali, Muhammad Ahmed Mohsin, Vasiliki Bikia, Arnav Singhvi, Richard Gaus, Suhana Bedi, Hejie Cui, Miguel Fuentes, Alyssa Unell, Yifan Mai, Jordan Cahoon, Michael Pfeffer, Roxana Daneshjou, Sanmi
发布于 2026-04-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Asad Aali, Muhammad Ahmed Mohsin, Vasiliki Bikia, Arnav Singhvi, Richard Gaus, Suhana Bedi, Hejie Cui, Miguel Fuentes, Alyssa Unell, Yifan Mai, Jordan Cahoon, Michael Pfeffer, Roxana Daneshjou, Sanmi Koyejo, Emily Alsentzer, Christopher Potts, Nigam H. Shah, Akshay S. Chaudhari

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的"AI 排行榜”做了一次**“体检”**,发现了一个被大家忽略的大问题:我们之前给 AI 出的考题太“死板”了,导致排名可能并不真实。

为了让你更容易理解,我们可以用几个生活中的比喻来拆解这篇论文的核心内容:

1. 核心问题:只有一种“考法”的考试

想象一下,我们要给一群学生(也就是各种大语言模型,如 GPT-4, Claude, Llama 等)进行期末考试,看看谁最聪明。

  • 以前的做法(HELM 框架): 老师只给出一道固定的题目,而且题目怎么问、用什么语气问,都是写死的。比如:“请计算这个病人的风险值。”
  • 问题所在: 有些学生很擅长回答“直接问”的问题,但有些学生需要老师先给点提示、或者换个问法(比如:“请一步步思考,先列出症状,再计算”)才能发挥真正的实力。
  • 后果: 如果只按一种固定的问法考试,那些“死板”的学生可能得分很高,而那些“需要引导”的聪明学生反而得分很低。这就导致排行榜上的名次,反映的不是谁更聪明,而是谁更擅长回答这种特定的“死板问题”。

2. 解决方案:给 AI 换个“说话方式”(结构化提示)

作者们引入了一种叫 DSPy 的工具,这就像是一个**“超级出题教练”。它不再只给一道死题,而是尝试用五种不同的“说话方式”**(提示词策略)来考同一个学生:

  1. 直接问(Baseline): 就像以前那样,直接问。
  2. 让 AI 先思考(Zero-Shot CoT): 就像老师对学生说:“别急着给答案,先把你脑子里的思考过程写出来,再给结论。”
  3. 给几个例子(Few-Shot): 就像老师先给几个做过的例题,让学生照着做。
  4. 优化后的例子 + 思考(BFRS/MIPROv2): 教练自动挑选最好的例题和最好的问法组合。

3. 惊人的发现:换种问法,排名大变!

作者用这五种方法重新考了 6 个顶尖 AI 模型,结果发现:

  • 分数普遍涨了: 平均来说,只要换个更好的问法(特别是加上“先思考”这一步),AI 的得分平均提高了 6%。这就像学生突然开窍了。
  • 排行榜大洗牌: 在 7 个不同的考试项目中,有 5 个项目的排名完全变了
    • 比喻: 就像在百米赛跑中,以前大家穿一样的鞋子跑。现在有人穿了跑鞋,有人穿了钉鞋。结果发现,原本跑第二的选手,穿上钉鞋后直接冲到了第一,把原本的第一名挤下去了。
    • 具体例子: 在医学计算题上,原本领先的 o3 MiniClaude 3.7 反超了。
  • 小模型逆袭: 一些开源的小模型(比如 Qwen3 4B),在用了好的“问法”后,表现甚至超过了那些昂贵的大模型。这说明小模型不是不行,只是以前没被“正确地问”而已。

4. 最大的功臣:让 AI“先思考”(Chain-of-Thought)

作者发现,在所有改进方法中,90% 的提升都来自于让 AI“先思考,再回答”(Chain-of-Thought, CoT)

  • 比喻: 这就像让一个学生做题时,不能只写“答案是 A",而必须写出“因为 A 是...,B 是...,所以选 A"。
  • 有趣的现象: 一旦让 AI 开始“思考”,再花大力气去优化题目(比如找更完美的例题、改更复杂的指令),提升就非常小了
  • 结论: 只要让 AI 学会“一步步思考”,它就能发挥 95% 的潜力。剩下的那 5% 的优化,性价比极低,就像给已经吃饱的人再喂一口饭,意义不大。

5. 成本与效率:最划算的升级

作者还算了一笔账:

  • 高级优化(BFRS/MIPROv2): 需要给 AI 看很多例题,导致题目变得很长,消耗大量的“算力”(就像考试时发了一本厚厚的参考书,既费时间又费钱)。
  • 简单思考(Zero-Shot CoT): 只需要加一句“请一步步思考”,题目长度增加很少,但效果却和那些复杂的优化方法差不多。
  • 结论: “让 AI 先思考”是性价比最高的方法。 既省钱,效果又好。

6. 总结:这对我们意味着什么?

这篇论文告诉我们要重新审视 AI 的排行榜

  1. 别只看分数: 现在的排行榜可能因为“题目问法太死”而误导了我们。
  2. 排名会变: 如果换一种更科学的问法,今天的“第一名”明天可能就不是了。
  3. 未来的方向: 以后评估 AI,不能只用一种固定的题目,而应该像这次研究一样,用多种“结构化”的方法去考它,看看它在不同引导下的真实能力。
  4. 实用建议: 如果你要使用 AI 解决复杂问题(比如医疗、数学),不要直接问,先让它“一步步思考”,这比花大价钱去调教它更有效。

一句话总结:
这篇论文就像给 AI 界敲了一记警钟:别被单一的考试分数骗了,换个问法(特别是让 AI 先思考),你会发现很多“差生”其实是“潜力股”,而排行榜上的名次可能完全不是那么回事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →