🤖 AI
Structured Prompts Improve Evaluation of Language Models
该研究通过构建可复现的 DSPy+HELM 框架,首次系统性地量化了提示词选择对基准评估结果的影响,发现结构化提示策略不仅能平均提升 6% 的性能,还会显著改变模型在排行榜上的排名。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是在给现在的"AI 排行榜”做了一次**“体检”**,发现了一个被大家忽略的大问题:我们之前给 AI 出的考题太“死板”了,导致排名可能并不真实。
为了让你更容易理解,我们可以用几个生活中的比喻来拆解这篇论文的核心内容:
1. 核心问题:只有一种“考法”的考试
想象一下,我们要给一群学生(也就是各种大语言模型,如 GPT-4, Claude, Llama 等)进行期末考试,看看谁最聪明。
- 以前的做法(HELM 框架): 老师只给出一道固定的题目,而且题目怎么问、用什么语气问,都是写死的。比如:“请计算这个病人的风险值。”
- 问题所在: 有些学生很擅长回答“直接问”的问题,但有些学生需要老师先给点提示、或者换个问法(比如:“请一步步思考,先列出症状,再计算”)才能发挥真正的实力。
- 后果: 如果只按一种固定的问法考试,那些“死板”的学生可能得分很高,而那些“需要引导”的聪明学生反而得分很低。这就导致排行榜上的名次,反映的不是谁更聪明,而是谁更擅长回答这种特定的“死板问题”。
2. 解决方案:给 AI 换个“说话方式”(结构化提示)
作者们引入了一种叫 DSPy 的工具,这就像是一个**“超级出题教练”。它不再只给一道死题,而是尝试用五种不同的“说话方式”**(提示词策略)来考同一个学生:
- 直接问(Baseline): 就像以前那样,直接问。
- 让 AI 先思考(Zero-Shot CoT): 就像老师对学生说:“别急着给答案,先把你脑子里的思考过程写出来,再给结论。”
- 给几个例子(Few-Shot): 就像老师先给几个做过的例题,让学生照着做。
- 优化后的例子 + 思考(BFRS/MIPROv2): 教练自动挑选最好的例题和最好的问法组合。
3. 惊人的发现:换种问法,排名大变!
作者用这五种方法重新考了 6 个顶尖 AI 模型,结果发现:
- 分数普遍涨了: 平均来说,只要换个更好的问法(特别是加上“先思考”这一步),AI 的得分平均提高了 6%。这就像学生突然开窍了。
- 排行榜大洗牌: 在 7 个不同的考试项目中,有 5 个项目的排名完全变了!
- 比喻: 就像在百米赛跑中,以前大家穿一样的鞋子跑。现在有人穿了跑鞋,有人穿了钉鞋。结果发现,原本跑第二的选手,穿上钉鞋后直接冲到了第一,把原本的第一名挤下去了。
- 具体例子: 在医学计算题上,原本领先的
o3 Mini被Claude 3.7反超了。
- 小模型逆袭: 一些开源的小模型(比如 Qwen3 4B),在用了好的“问法”后,表现甚至超过了那些昂贵的大模型。这说明小模型不是不行,只是以前没被“正确地问”而已。
4. 最大的功臣:让 AI“先思考”(Chain-of-Thought)
作者发现,在所有改进方法中,90% 的提升都来自于让 AI“先思考,再回答”(Chain-of-Thought, CoT)。
- 比喻: 这就像让一个学生做题时,不能只写“答案是 A",而必须写出“因为 A 是...,B 是...,所以选 A"。
- 有趣的现象: 一旦让 AI 开始“思考”,再花大力气去优化题目(比如找更完美的例题、改更复杂的指令),提升就非常小了。
- 结论: 只要让 AI 学会“一步步思考”,它就能发挥 95% 的潜力。剩下的那 5% 的优化,性价比极低,就像给已经吃饱的人再喂一口饭,意义不大。
5. 成本与效率:最划算的升级
作者还算了一笔账:
- 高级优化(BFRS/MIPROv2): 需要给 AI 看很多例题,导致题目变得很长,消耗大量的“算力”(就像考试时发了一本厚厚的参考书,既费时间又费钱)。
- 简单思考(Zero-Shot CoT): 只需要加一句“请一步步思考”,题目长度增加很少,但效果却和那些复杂的优化方法差不多。
- 结论: “让 AI 先思考”是性价比最高的方法。 既省钱,效果又好。
6. 总结:这对我们意味着什么?
这篇论文告诉我们要重新审视 AI 的排行榜:
- 别只看分数: 现在的排行榜可能因为“题目问法太死”而误导了我们。
- 排名会变: 如果换一种更科学的问法,今天的“第一名”明天可能就不是了。
- 未来的方向: 以后评估 AI,不能只用一种固定的题目,而应该像这次研究一样,用多种“结构化”的方法去考它,看看它在不同引导下的真实能力。
- 实用建议: 如果你要使用 AI 解决复杂问题(比如医疗、数学),不要直接问,先让它“一步步思考”,这比花大价钱去调教它更有效。
一句话总结:
这篇论文就像给 AI 界敲了一记警钟:别被单一的考试分数骗了,换个问法(特别是让 AI 先思考),你会发现很多“差生”其实是“潜力股”,而排行榜上的名次可能完全不是那么回事。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。