Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias
本文介绍了一种轻量级的黑盒适配方法,该方法通过基于 KL 正则化的强化学习目标学习一个单一的上下文无关 logit-bias 向量,旨在不修改模型权重或需要梯度访问的情况下,提升语言模型在推理任务上的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一位才华横溢、无所不知的机器人厨师,它几乎可以烹饪你要求的任何菜肴。这个机器人非常聪明,因为它已经接受过整个互联网的训练,但它也有点像个“戏精”:它不让你进厨房修改它的食谱,你甚至连看一眼它秘密调料罐的权利都没有。你只能给它下达指令,然后它就开始烹饪。有时,这个机器人太爱唠叨了,会在食谱前加上没必要的废话。其他时候,它又会忘了放盐,或者变得糊涂起来,开始大谈特谈番茄的历史而不是制作酱料。
在人工智能的世界里,这个机器人就是一个“大语言模型”(LLM)。“厨房”是模型的内部大脑,而“食谱”则是它用来预测句子中下一个词的数学逻辑。通常情况下,如果你想让机器人更好地胜任某项特定工作——比如解决数学题或写简短的电子邮件——你必须把它送回工厂进行重新训练。但如果做不到这一点呢?如果这个机器人被锁在一个黑盒子里,而你只有一个极其微小的控制旋钮呢?这篇论文提出了一个简单、甚至带点俏皮的问题:我们能否仅仅通过微调那个唯一的旋钮,就在不触碰其大脑的情况下让机器人变得更聪明?
研究人员——来自德克萨斯大学埃尔帕索分校(注:原文为Tel Aviv University,此处依原文译为特拉维夫大学)和谷歌的一个团队——决定尝试正是这样做。他们专注于一个叫做“逻辑偏置”(logit bias)的特征。把机器人的大脑想象成一份包含它可能说的每一个词的巨大菜单。在它挑选一个词之前,它会为菜单上的每一项分配一个“分数”。“逻辑偏只”就是一种在机器人做出选择之前,秘密地给某些词加分或减分的方法。这就像是在机器人耳边低语:“嘿,我很喜欢‘答案’这个词,而我很讨厌‘嗯’这个词。”
该团队的大创意是找到那句“完美的低语”。他们想要学习一套单一且固定的分数调整方案,使其能够适用于机器人收到的每一个问题。他们不想改变机器人的大脑;他们只想引导它的选择。为了实现这一点,他们使用了一个聪明的技巧:他们让机器人烹饪许多餐食,检查这些餐食是否合格(使用奖励系统),然后精确计算出哪些词应该获得“奖金”才能让这顿饭变得更好。他们使用了一种叫做“逆概率得分”(inverse propensity scoring)的统计方法来得出结论,这基本上是在说:“如果机器人是偶然选中了一个词,那么如果我们是有目的地选中它,我们会有多么喜爱它?”
结果出人意料地有效,尽管也存在局限性。当他们将这种学习到的“低语”应用于数学和推理测试时,机器人在解决问题方面变得稍微聪明了一些。例如,在名为 MATH 的高难度数学基准测试中,机器人的准确率从大约 30.3% 提升到了 33.1%。这虽然不是一个巨大的飞跃,但却是在没有改变机器人大脑中任何权重的情况下实现的真实进步。更有趣的是,他们利用这种方法让机器人的回答变得更短、更简洁。通过调整偏置,他们可以说服机器人更早地停止说话,在不丢失正确答案的前提下,将某些模型回答的长度从 900 多词缩减到 900 词以下。
然而,论文非常明确地指出了这种方法不能做的事情。研究人员发现,虽然这种“低语”在格式化、阻止机器人闲扯或引导其向正确的回答风格靠拢方面表现出色,但它无法教会机器人新的逻辑。如果机器人不知道如何解决某个特定的数学问题,添加偏置并不会突然赋予它原本缺失的数学技能。这就像一位教练,可以告诉球员“跑快点”或“别坐立不安”,但如果球员根本不知道规则,教练无法教他们如何玩游戏。论文指出,这种方法是一种轻量级的、“黑盒式”的工具——非常适合于当你无法重新训练模型时,但它不能替代需要深度复杂推理的完整训练。
最后,作者表明,一种简单的、与上下文无关的微调可以从一个冻结的模型中榨取更多的性能。这提醒了我们,有时候你不需要重建引擎就能获得一点速度提升;你只需要知道该按哪些按钮。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。