Why is prompting hard? Understanding prompts on binary sequence predictors
本文通过将提示工程框架化为在序列预测器上寻找最优条件序列的问题,来探究其面临的挑战,并通过受控实验与前沿模型分析揭示:最优提示往往违背直觉,即便进行穷举搜索也难以识别,且在使用标准的基于示例的方法时经常并非最优。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一只超级聪明、受过高度训练的鹦鹉。这只鹦鹉读过数百万本书,看过无数部电影,听过所有制作过的广播节目。它预测句子中下一个词的能力胜过任何人。这就是你的AI 模型。
现在,你希望这只鹦鹉表演一个特定的把戏:讲个笑话、写一首悲伤的诗,或者解一道数学题。你通过给它一个**提示(prompt)**来实现这一点——即几句指令或一个示例,以此让它开始行动。
这篇论文提出了一个简单却深刻的问题:**为什么找到给鹦鹉的完美词语如此困难?**有时,效果最好的指令对人类来说看起来完全怪异、毫无意义,甚至“错误”。为什么一个看起来像胡言乱语的提示,比清晰、合乎逻辑的指令更有效?
作者决定停止猜测,开始测试。他们构建了一个微小、受控的世界,以理解鹦鹉大脑内部究竟发生了什么。
实验:抛硬币鹦鹉
他们没有使用真实、复杂的 AI,而是创造了一个简单的“鹦鹉”,它只理解正面和反面(就像抛硬币)。
- 训练: 他们通过向这只鹦鹉展示数千次抛硬币结果来训练它。但这里有个关键:他们展示的不只是公平硬币。他们展示了各种不同偏倚的硬币。有些硬币 20% 的时间落地为正面,有些是 90%,还有一些是两者的混合。鹦鹉学会了根据训练中所见的模式来猜测下一次抛掷的结果。
- 任务: 现在,他们希望这只鹦鹉表现得像一枚落地为正面 70% 概率的特定硬币。他们问道:“展示给鹦鹉什么样的正面和反面序列,能最好地让它开始猜测 70% 的概率是正面?”
大惊喜:“错误”的提示效果最佳
你可能会认为,教鹦鹉猜测 70% 正面概率的最佳方式是向它展示一个包含 70% 正面和 30% 反面的长列表。这看起来很合乎逻辑,对吧?
论文发现,这往往是错误的。
在许多情况下,最优提示(即实际效果最好的提示)是一个看起来与任务毫无关系的序列。
- 类比: 想象你想教一个习惯在安静图书馆学习的学生去嘈杂的食堂学习。你可能会认为,给他们播放一段嘈杂食堂的录音是让他们做好准备的最佳方式。但论文发现,有时让他们做好准备的最佳方式,是向他们展示一段寂静的序列,这种寂静微妙地“欺骗”他们的大脑,使其预期噪音。
- 现实: “最佳”提示完全取决于鹦鹉是如何被训练的(即其预训练分布)。如果鹦鹉是在特定混合的硬币偏倚下训练的,那么让它表现出某种行为的“魔法词语”可能是一连串全是正面的序列,或者是一个奇怪的混合序列(例如 10 个正面和 2 个反面)。对于仅观察任务的人类来说,这看起来像个错误。但对鹦鹉而言,这是一把完美的钥匙,能解锁正确的行为。
为什么这如此难以搞清?
论文强调了找到这些“魔法词语”之所以是一场噩梦的三个主要原因:
1. “隐藏配方”问题
鹦鹉的行为是由一个我们通常不知道的“秘密配方”(预训练分布)塑造的。
- 类比: 想象你试图将收音机调谐到某个特定电台。你不知道该电台听起来是什么样子,也不知道收音机是如何制造的。你只是转动旋钮。有时,转到“显而易见”的位置只会让你听到杂音。你必须转到一个奇怪、随机的位置才能获得清晰的声音。如果不了解收音机的内部线路,你就无法解释为什么那个奇怪的位置能奏效。
2. “平坦地形”问题
作者将寻找最佳提示的过程可视化为一行走在丘陵地形上。
- 类比: 你正在寻找最高的山峰(即最佳提示)。在完美的世界里,只有一座尖锐的山峰,很容易找到。但在这篇论文的实验里,“地形”往往是一个平坦的高原。有数百种不同的提示,它们的效果几乎同样好。
- 后果: 如果你尝试使用少量数据(例如一个小测试批次)来寻找最佳提示,你可能会偶然选中一个“足够好”的提示,而这个提示实际上与真正的最佳提示不同。如果你用略微不同的批次再次运行测试,你可能会选中一个不同的“足够好”的提示。这使得结果不可靠且难以解释。
3. “专家演示”陷阱
一种流行的 AI 教学方式是向它展示专家执行任务的示例(例如,“这是国际象棋特级大师的下法”)。
- 发现: 论文表明,展示专家示例通常不如使用奇怪但经过优化的提示有效。
- 类比: 想象你想让机器人完美地下棋。你可以给它展示 100 场由特级大师下的棋局。或者,你可以给它一段奇怪、简短的代码,强制将其大脑“锁定”在“特级大师模式”。论文发现,这段奇怪的代码往往比那 100 场棋局更有效。专家示例太过“典型”,未能考虑到机器人特定的训练偏倚。
那真实的 AI(如聊天机器人)呢?
作者使用电影评论在真实的语言大模型(如 GPT-2 和 Gemma)上测试了这些想法。
- 他们发现了相同的模式:生成“正面”评论的最佳提示并不总是听起来积极的词语。有时,它们是简短、奇怪,甚至听起来消极的词语,却以某种方式触发了正确的回应。
- 他们还发现,要可靠地找到最佳提示,你需要海量数据(数千个示例),而不是人们通常使用的小批次(约 200 个)。使用小批次,你实际上只是在猜测。
结论
论文总结道,提示之所以困难,是因为我们试图在不知道其完整历史的情况下引导一台机器。
- “最佳”提示是相对的: 不存在通用的“最佳”提示。最佳提示取决于 AI 训练数据中特定的、隐藏的偏倚。
- 直觉会失效: 对人类来说看似合乎逻辑的做法(向 AI 展示你想要的东西)往往会失败,因为它没有考虑到 AI 内部的“数学”。
- 可靠性很低: 除非你进行 exhaustive(详尽)搜索并使用海量数据集,否则你找到的提示可能只是幸运的猜测,无法一致地发挥作用。
简而言之,这篇论文表明,提示的“魔力”不仅仅在于编写好的指令;它在于以对我们来说往往完全违反直觉的方式,破解 AI 隐藏的统计偏倚。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。