Bandit-Based Prompt Design Strategy Selection Improves Prompt Optimizers
本文介绍了 OPTS,这是一个通过实现显式的、基于多臂老虎机机制(具体为汤普森采样)来有效选择并应用提示设计策略的提示优化框架,该框架增强了现有优化器(如 EvoPrompt)的性能,从而超越了依赖隐式策略选择的方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个非常聪明但有时有点固执的机器人(大语言模型)如何解开一个困难的谜题。你给机器人指令,这些指令被称为“提示词”(Prompt)。如果指令模糊,机器人会感到困惑;如果指令完美,机器人能瞬间解开谜题。
长期以来,人类一直尝试通过手工编写这些完美的指令,或者使用计算机程序自动调整指令直到它们效果更好。这被称为提示词优化(Prompt Optimization)。
然而,这里有一个问题:这些自动程序生成的指令虽然功能完备,却缺乏人类专家所使用的“秘密配方”。它们忽略了那些经过验证的技巧,比如“一步步思考”或“扮演专家”。
问题所在:机器人的糟糕猜谜游戏
最近,一个名为 APET 的工具试图修复这个问题。它给了机器人一份“设计策略”菜单(就像一份烹饪技巧菜单:加盐、切碎、慢火炖煮)。机器人应该查看这份菜单,并决定针对特定的谜题使用哪些技巧。
但论文指出,要求机器人做出这种选择,就像是要求一位疲惫的厨师去猜哪种香料能救活一锅烧焦的汤。机器人经常猜错,选用的策略实际上会让指令变得更糟。这是一种**隐式(implicit)**的选择(机器人只是凭“感觉”觉得应该使用某个技巧),而这种感觉并不靠谱。
解决方案:OPTS(聪明的侍酒师)
作者在这篇论文中介绍了一种新方法——OPTS(基于策略选择的提示词优化)。
与其让机器人去猜,OPTS 扮演的是聪明的侍酒师(葡萄酒专家)或赌场经理的角色,运行着一场概率游戏。以下是使用简单类比的工作原理:
想象你有一排老虎机(研究人员称之为“臂/arms”):
- 机器 1: 在指令中加入“一步步思考”。
- 机器 2: 告诉机器人“再读一遍问题”。
- 机器 3: 告诉机器人“扮演一名数学专家”。
- 机器 K+1: 什么都不做(保持指令原样)。
在旧方法(APET)中,机器人只是随机拉动拉杆或凭直觉行动。
在新的 OPTS 方法中,系统使用了一种被称为**汤普森采样(Thompson Sampling)**的数学策略。把它想象成一个聪明的赌徒,他手里拿着一张记分卡:
- 它尝试一台机器(一种策略)。
- 如果机器人更好地解决了谜题,系统就会给那台机器一个“赞”,并使其在下次被选中的概率更高。
- 如果机器人失败了,系统就会给那台机器一个“踩”,并停止选择它。
- 至关重要的是,它还保留了一台“什么都不做”的机器。如果所有的技巧都让情况变得更糟,系统就会学会直接保持指令不变。
研究发现
研究人员在两个不同的机器人(LLM)上测试了这一方法,使用的是一组非常困难的逻辑与推理谜题(称为 BIG-Bench Hard)。
- 结果: 通过使用这种“聪明赌徒”的方法来挑选正确的策略,该系统创建出的指令比机器人自行生成的指令要好得多。
- 冠军: 汤普森采样法(聪明的赌徒)是明显的赢家。它将提示词优化器的性能在某些任务上提升了高达 50%。
- 对比: 旧方法(APET,即机器人进行猜测的方法)的表现甚至比随机选择策略还要差。这证明了机器人并不擅长猜测该使用哪些技巧,但如果我们告诉它使用哪个技巧,它就非常擅长执行指令。
核心启示
这篇论文并不声称已经解决了所有的 AI 问题,也不声称已经准备好进行医疗诊断。它仅仅表明,当我们试图教 AI 如何更好地交流时,我们不应该让 AI 去猜该使用哪种教学方法。相反,我们应该使用一个智能的、数据驱动的系统(如汤普森采样)来明确地选择最佳的教学技巧,就像教练为特定的比赛情况选择正确的战术一样。
这个“聪明教练”的代码现在已开放供他人使用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。