How to Train Your Advisor: Steering Black-Box LLMs with Advisor Models
本文介绍了顾问模型,这是一种通过参数优化训练小型开放权重模型以生成针对每个实例的动态自然语言建议的方法,该方法在不修改其权重的情况下,有效引导并提升了不可访问的黑盒前沿大语言模型的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位才华横溢、世界级的厨师(即黑盒模型,如 GPT-5 或 Gemini),他在一个密封的高安保厨房中工作。你无法触碰食材,无法更改食谱,甚至无法看到他们如何切菜。你只能递给他们一张写有你点单内容的便条(即提示词)。
通常,如果你想要一道特定的菜肴,你必须写一张非常长且完美的便条。但如果你在便条中犯了错,厨师可能仍然能做出美味的菜肴,也可能感到困惑。而且,如果你希望厨师每次都适应你的特定口味,为每一道订单重新写一张完美的便条既令人疲惫又常常失败。
顾问模型(ADVISOR MODELS) 就像雇佣一位聪明的小型副厨师(即顾问),他站在那扇密封厨房门外。
以下是其工作原理,分步说明:
1. 设置:副厨师的职责
与其由你尝试为主厨撰写完美的便条,不如让副厨师查看你的订单,并为主厨写一条定制提示。
- 主厨(黑盒): 工作方式完全不变。你无法改变他们的大脑或训练。他们只是遵循收到的便条。
- 副厨师(顾问): 这是一个更小、更便宜、开源的模型。它的唯一工作就是查看具体订单,并说:“嘿,针对这个特定请求,主厨应该尝试执行 X、Y 和 Z。”
2. 训练:在实践中学习
副厨师如何学会给出好的提示?
- 循环: 你给副厨师一个任务。副厨师写出一条提示。主厨阅读提示并烹饪菜肴。
- 评分: 如果菜肴变得美味(任务正确解决),系统会给副厨师一个“大拇指”(好评)。如果菜肴烧焦了,则给予“倒大拇指”(差评)。
- 教训: 副厨师从这些评分中学习。随着时间的推移,它不再给出“好好烹饪”这样模糊的建议,而是开始给出具体、可操作的建议,例如“检查炉灶温度”或“此评论恰好使用 10 个单词”。
3. 魔法技巧:廉价的副厨师帮助昂贵的厨师
这是该论文最大的主张。你无需使用昂贵、世界级的厨师来训练副厨师。
- 你可以使用廉价、小型的厨师(如 GPT-4o mini)来训练副厨师。
- 一旦副厨师学会了如何向廉价厨师提供出色的提示,你就可以将同一个训练好的副厨师带到昂贵、世界级的厨师(如 GPT-5)面前。
- 结果: 昂贵的厨师突然在特定任务上表现更好,尽管它从未接受过训练!这些提示如此清晰且有帮助,以至于大厨师能完美理解它们。
论文中的现实世界示例
作者在三个不同的厨房中测试了这个“副厨师”系统:
税务厨房(RuleArena Taxes):
- 问题: 主厨擅长一般烹饪,但在复杂的税务规则面前会感到困惑。
- 解决方案: 训练有素的副厨师学会了给出如何计算税款的具体指示。
- 结果: 主厨的准确率从67% 提升至 85%。
软件修复厨房(SWE Agent):
- 问题: 厨师修复损坏代码时花费了太多步骤(就像检查厨房里的每一个抽屉)。
- 解决方案: 副厨师学会了说:“不要检查抽屉;只需使用搜索命令找到损坏的部分。”
- 结果: 厨师修复代码的速度提高了 24%,且没有增加错误。
个人口味厨房(个性化):
- 问题: 你有 5 个不同的朋友。一个喜欢简短的评论,一个喜欢长的,还有一个讨厌数学问题。主厨并不知道这些。
- 解决方案: 副厨师学会了读取每位朋友的“隐藏”偏好,并确切地告诉厨师该做什么。
- 结果: 该系统几乎完美地学会了这些隐藏偏好(准确率 94-99%),而标准方法则完全失败。
为什么这很重要(根据论文)
- 无需手术: 你无需切开主厨的大脑(修改其权重)来改进他们。你只需给予他们更好的指示。
- 不会遗忘: 因为主厨的大脑未被改变,他们不会忘记如何做其他事情。他们依然擅长原本擅长的一切。
- 成本效益高: 在廉价模型上训练小型副厨师,然后将这些技能“转移”到昂贵模型上,比直接尝试训练昂贵模型要便宜得多。
简而言之: 顾问模型是一种训练小型智能助手的方法,使其能为一个巨大的、被锁住的 AI 编写更好的指令,从而使该巨型 AI 变得更聪明、更快速、更具个性化,而无需触碰其内部代码。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。