Embedding by Elicitation: Dynamic Representations for Bayesian Optimization of System Prompts
本文介绍了 ReElicit,这是一个贝叶斯优化框架,它利用大语言模型从聚合反馈中动态提取自适应且可解释的特征嵌入,从而在无需每个示例标签的情况下高效优化可变长度的系统提示。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试教导一个非常聪明但略显固执的机器人如何回答问题。你无法直接与机器人对话,指出“这道具体的数学题你答错了,因为你忘记进位了”。相反,你只能在漫长的一天结束后得到一个单一的数字:“今天,机器人答对了 85% 的问题。”
这篇论文所解决的问题正是:当你只能获得一个模糊的整体分数,而非详细的报告单时,如何改进机器人的指令(称为“系统提示”)?
来自 Meta 的作者提出了一种名为 ReElicit 的新方法。其工作原理可拆解为以下简单概念:
1. 问题:“黑盒”困境
通常,在调整机器学习模型时,你拥有大量数据,确切知道哪些答案正确、哪些错误。但在现实世界(例如客户服务机器人)中,你可能只知道“本周用户满意度提升了 2%"。
试图仅通过随机更改词语并寄希望于最佳结果来猜测完美指令,就像试图通过向干草堆中随机投掷针来寻找特定的一根针。这种方法既缓慢又低效。
2. 解决方案:“翻译”机器人
作者们意识到,与其在数百万种可能的句子中搜索,不如请一个“聪明”的大语言模型(LLM)充当翻译。
以下是类比:
- 目标:你想找到制作蛋糕的完美食谱,但烘焙后你只能得到一个品尝评分(例如"8/10"),无法单独品尝每种原料。
- 旧方法:你只是随机猜测新食谱。
- ReElicit 方法:你请一位主厨(即 LLM)查看你过去的食谱及其评分。主厨说:“我认为秘诀不在于面粉或糖,而在于香草精和小苏打的平衡。”
随后,主厨会创建一张简易地图(即“特征空间”),仅包含两三个坐标轴:
- 香草精用量?(0 到 1)
- 小苏打用量?(0 到 1)
现在,你不再需要在无限食谱中搜索,而只需在这张微小而简单的地图上寻找最佳位置。
3. 过程:三步之舞
论文描述了一个循环,计算机在其中反复执行三个步骤:
- ** elicitation(询问主厨)**:系统查看已尝试的提示及其评分,并向 LLM 提问:“对于这项特定任务,哪两三个最重要的‘成分’(语义特征)决定了提示的好坏?”LLM 即时发明这些特征(例如“推理清晰度”或“示例的使用”)。
- Optimize(导航员):系统使用一种名为贝叶斯优化的数学工具。这就像一位智能导航员,查看地图后说道:“我们尚未尝试过‘清晰度’高而‘示例’中等的那个点。让我们去那里。”它会在地图上选定一个目标点。
- Realize(烘焙师):系统再次询问 LLM:“好的,请写出一条提示,精准命中我们地图上的那个目标点。”LLM 编写新指令。系统测试这些指令,获得新评分,循环再次开始。
4. 为何独特:“重新 elicitation"
巧妙之处在于,这张“地图”并非静态。随着系统尝试更多提示并获得更多评分,它会要求 LLM 重绘地图。
- 起初,LLM 可能认为“长度”很重要。
- 但在尝试 10 次后,LLM 意识到:“实际上,长度无关紧要;关键在于指令的结构方式。”
- 因此,LLM 会更新地图以反映这一新认知。这使得系统能够在学习过程中不断适应。
5. 结果
作者在 10 项不同的困难任务(如解决数学问题或识别讽刺)上测试了该方法。他们给予 ReElicit 非常严格的预算:总共只能测试 30 个不同的提示。
- 竞争者:他们将 ReElicit 与其他方法进行了比较,这些方法包括随机猜测提示、像细菌一样进化提示,或逐一批判提示。
- 获胜者:ReElicit 始终找到了最佳提示。它之所以能更好地找到“干草堆中的针”,是因为它停止了随机猜测,转而导航于一张智能且不断演化的地图。
总结
简而言之,ReElicit 是一种利用 AI 发明自身语言来描述何种提示更优的方法。它不再在混乱、无限的文字世界中搜索,而是将问题转化为一张简洁清晰的地图,找到该地图上的最佳位置,然后将该位置翻译回一套完美的指令。它通过不断从新结果中学习并更新自身地图来实现这一点。
论文声称,当你仅有一个整体分数作为指导,而非详细的错误列表时,这是调整 AI 指令最有效的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。