Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation
本文通过一项全面的实证研究表明,基准提示词的效果始终优于复杂的方法,仅有极少量的专家或归纳式框架能带来微小的提升,从而挑战了通过复杂的提示技术来增强大语言模型性能的假设,并据此建议该领域应优先考虑真正的模型进步而非提示工程。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个超级聪明的机器人如何解开一个谜题。有一段时间,大家都认为让机器人得到好答案的唯一方法是给它一套非常冗长、复杂的指令。人们认为:“如果我告诉机器人要一步步思考、画一张地图,或者假装成某个特定的专家,它就会变得更聪明。”这就像告诉一个学生:“不要只是回答;在选出正确选项之前,先写一篇关于你感受的五段式文章。”这种想法变得如此流行,以至于研究人员开始构建越来越多的复杂“提示词”(prompting)技巧,认为指令越精巧,机器人的表现就越好。但如果机器人实际上会被这些多余的闲聊搞糊涂呢?如果最简单的指令才是最好的呢?这就是 IBM 的一个研究团队决定调查的问题,他们研究了大型语言模型(LLMs)——即现代人工智能背后的“大脑”——如何处理多选题。他们想看看那些花哨的新技巧究竟是在提供帮助,还是仅仅在把事情变得不必要的复杂。
这篇名为《简约悖论》(Simplicity Paradox)的论文是一项大规模实验,研究人员针对 10 套不同的刁钻谜题,测试了 8 种不同的提问方式,并使用了 27 个不同版本的 AI 模型。他们进行了超过 43 万次评估,以获得清晰的图景。而这里有一个令人惊讶的转折:研究发现,那些复杂的技巧通常会让 AI 的表现变差,或者顶多与直接提问的表现持平。
可以这样理解:想象你正在参加一场考试。“基准”(Baseline)方法就是阅读问题并选择答案。“复杂”(Complex)方法则像是被告知要“假装你是一名侦探,列出三个线索,画一张图表,然后再回答”。研究人员发现,对于大多数 AI 模型来说,侦探的人设和图表实际上拖慢了它们的进度。事实上,当研究人员进行公平比较(确保每个 AI 看到的题目完全相同)时,简单直接的提示词是表现第三好的方法。唯一略微优于它的两种方法是微小的调整:告诉 AI 扮演一名“可靠性工程师”或使用“归纳推理”。这些方法带来了约 3 个百分点的微小提升。但那些真正花哨的方法,比如让 AI 生成自己的示例或尝试通过类比来解决问题,却惨败了。其中一种被称为“自我类比”(Self-Analogical)的方法表现极差,得分仅为 21.38%,几乎和随机猜测差不多。这就像 AI 被困在了自己的指令中,以至于忘记了如何回答问题。
这项研究还揭示了一些其他迷人的特性。首先,他们发现一个较小的 AI 模型 Qwen3-30B-A3B-Thinking-2507 在面对面排名中,竟然击败了许多规模大得多的、更强大的模型(有些模型的规模是它的 13 倍)。这表明拥有更多的“脑力”(参数)并不总是能保证获得最高分;有时,一个经过精调的小型模型反而更加敏锐。其次,他们观察了模型使用了多少“思考时间”(或 Token)。他们发现,仅仅是打开“思考”开关就是一个巨大的改变,能让某些模型的得分提高多达 22 个百分点。然而,一旦开关打开,给模型分配更多的思考时间(将预算从低到中增加)也只能带来极小的准确度提升,大约只有 1 到 4 个点,却要消耗大量的计算资源。这就像意识到一名跑步者需要开始奔跑才能获胜,但告诉他们跑得比实际需要的长 8 倍并不会让他们变得更快。
最后,研究人员观察了谜题本身的难度。他们发现 AI 离完美还很远。在最难的谜题上,最好的模型也只能答对约 36% 的题目,而在最简单的题目上,它们的得分约为 83%。这种巨大的差距意味着 AI 仍有很大的提升空间,而不仅仅是去寻找更好的提问方式。论文得出结论,AI 社区可能把事情搞得太复杂了。与其把所有的精力都花在构建复杂的说明书上,不如专注于让模型本身变得更聪明,并去攻克更难的问题。“简约悖论”揭示了一个事实:有时,最强大的工具就是一个简单、直接的问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。