Revisiting Prompt Sensitivity in Large Language Models for Text Classification: The Role of Prompt Underspecification
本文认为,观测到的大型语言模型提示词敏感性中有很大一部分源于提示词的不明确性而非模型固有的不稳定性,并证明了特定的指令仅对内部表示产生边际影响,即可降低性能方差与逻辑值(logit)不确定性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图让一个非常聪明但有点“死脑筋”的机器人将一堆邮件分类为“垃圾邮件”和“重要邮件”。
如果你递给机器人一张只写着“这是一封信:[信件内容]”的纸条,并要求它进行分类,机器人可能会感到困惑。它可能会开始针对这封信写一首诗,或者只是盯着它发呆。如果你稍微修改一下纸条,写成“这是一封信:[信件内容]。请对其进行分类”,机器人可能会突然表现得非常完美。如果你再次修改为“分类这个:[信件内容]”,它可能又会失败。
这篇论文认为,机器人的困惑并不是因为它不擅长分类邮件,而是因为你没有给出足够清晰的指令。
以下是使用简单类比对该论文研究结果的解读:
1. 问题所在:“模糊的便条” vs. “清晰的指令”
研究人员发现,许多测试 AI 模型的研究都使用了**“欠指定”(underspecified)的提示词**。这些可以看作是模糊的便条,比如“这是什么?”或者仅仅粘贴一段文本而没有任何上下文。
- 结果: 当指令模糊时,AI 的表现会极其不稳定。今天它像个天才,明天它可能就在随机瞎猜。论文称之为“提示词敏感性”(prompt sensitivity)。
- 原因: AI 实际上在内心深处已经掌握了这项任务,但由于指令太模糊,它不知道如何向你展示答案。这就像一个学生明明掌握了数学知识,却因为老师没明确要求,导致最后忘了写下最终答案。
2. 解决方案:“指令提示词”
当研究人员转向使用**“指令提示词”**(即清晰、具体的方向,例如“阅读这段文本,并告诉我它是积极的还是消极的”)时,AI 的表现变得更加稳定且准确。
- 类比: 这就像是把原材料交给厨师时,说“做点东西吃”与说“给我做一个烤奶酪三明治”之间的区别。无论哪种指令,厨师(AI)都具备相应的技能,但第二种指令能确保产出正是你想要的东西。
3. “魔术技巧”:上下文学习(In-Context Learning)
研究人员测试了几种修复 AI 困惑的方法。其中最有效的方法是上下文学习(ICL)。
- 类比: 与其只是给机器人一个规则,不如先给它两个例子:“这是一个开心的电影评论。这是一个悲伤的电影评论。现在,这是另一条评论:它是开心的还是悲伤的?”
- 发现: 这个简单的技巧几乎可以媲美那些需要深入挖掘机器人大脑结构的复杂数学修正方法(称为“校准”)。它无需修改机器人的内部代码,就解决了困惑问题。
4. 窥探机器人的大脑(Logits 与探针)
研究人员通过“查看内部”来观察困惑发生在何处。
- Logits(“置信度得分”): 当指令模糊时,AI 对正确答案的内部“置信度得分”非常微小——几乎为零。这就像机器人在极小声地低语答案,以至于你几乎听不见。当指令清晰时,机器人会以高置信度大声喊出答案。
- 线性探针(“脑部扫描”): 他们扫描了 AI 的内部层级(即它的“思维过程”)。
- 令人惊讶的发现: 即使在指令模糊的情况下,AI 的大脑实际上也理解了这项任务。这种“知识”存在于大脑的中层。
- 故障点: 问题只发生在最后阶段,即 AI 试图将这些知识转化为最终答案的时候。模糊的指令干扰了输出,而不是干扰了思考。
5. 哪些方法不起作用
论文还测试了一些其他想法,比如在提示词中添加“空白”标记(无意义的词汇)来对 AI 进行“校准”。
- 结果: 这往往会让情况变得更糟,导致 AI 的表现甚至比随机猜测还要差。这就像试图通过对着一个困惑的厨师喊一些乱七八糟的词来修复他一样;这只会增加更多的噪音。
核心结论
论文得出结论:我们看到的 AI 模型中的很大一部分“不稳定现象”,并不是因为模型本身出了问题或不可预测。而是因为我们提问的方式很令人困惑。
如果我们想要可靠的 AI 结果,我们需要停止使用模糊、极简的提示词,转而使用清晰、具体的指令(并且最好先给 AI 展示几个例子)。AI 完全有能力胜任这项工作,它只是需要一份更好的“职位描述”。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。