← 最新论文
💬 NLP

SyRuP: Enhancing System-Prompt Following via Reward-Guided Prediction in LLM Decoding

该论文介绍了 SyRuP,这是一个解码时框架,通过训练一个交叉注意力奖励头来为候选序列生成标记级遵循度分数,从而在无需对基座模型进行微调的情况下,增强大语言模型对系统提示词的遵循能力。

原作者: Seoyeon Kim, Minjae Kang, Jaehyung Kim

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Seoyeon Kim, Minjae Kang, Jaehyung Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在和一个非常聪明、博学多才的机器人交谈,它读遍了图书馆里的几乎每一本书。这个机器人是一个大型语言模型(LLM)。通常情况下,当你向它提问时,它是基于其训练内容来回答的。但有时,你希望在它开始说话之前,先给它设定一组特定的规则。你可能会说,“扮演一个脾气暴躁的海盗,”或者“只能用押韵的方式回答,”或者“永远不要提到暴力。”这些规则被称为系统提示词(system prompts)。它们就像是机器人的职位描述,或者是机器人在特定对话中所穿上的戏服。

问题在于,这些机器人习惯于遵循出现在对话内部的指令,而不是在对话开始前就设定好的铁律。当规则变得复杂时——比如“要像个海盗,但也要使用19世纪的语法,避免使用字母‘e’,并且保持幽默感”——机器人往往会在对话中途忘记规则。它可能会开始像个海盗一样说话,然后突然变成一个现代青少年,或者忘记避免使用字母“e”。科学家们曾尝试通过重新训练机器人来解决这个问题(这既昂贵又缓慢),或者尝试在答案已经写完后去猜测最佳答案(这就像是在作者完成小说后才去编辑它)。大的疑问在于:我们能否在机器人写作的过程中引导它遵循这些复杂的规则,而无需改变它的“大脑”,也不必等到结束时才处理?

这就是一种名为 SYRUP 的新方法。把机器人的大脑想象成一座巨大的、冰冻的图书馆,我们是不被允许去重新排列它的。SYRUP 就像是一个超级聪明、微小的图书管理员,在机器人写作时就站在它旁边。每当机器人决定下一个要说的词时,这位图书管理员都会检查两件事:“这个词符合故事吗?”以及“这个词符合海盗的戏服吗?”

以下是它的实际运作方式。机器人有一个关于接下来想说的词的前 1 0个最爱词汇的列表。通常,它只会选择排名第一的那个。但 SYRUP 会介入。它将“系统提示词”(海盗戏服)视为一个独立的、特殊的记忆卡。它使用一种特殊的工具,叫做交叉注意力奖励头(cross-attention reward head),来询问机器人的当前想法:“嘿,如果你说这个词,它符合海盗的气场吗?”图书管理员会对这 10 个词中的每一个进行评分。如果机器人想说“Hello”,但海盗戏服要求说“Ahoy”,图书管理员就会提高“Ahoy”的分数,并降低“Hello”的分数。机器人随后会选择综合得分最高的那个词。

论文指出,这种方法比旧方法更好。研究人员在三个不同的机器人大脑上测试了 SYRUP,发现它能比仅仅提供更好的提示词或在生成答案后进行重排序的方法,更一致地帮助机器人遵循复杂规则。事实上,在一次测试中,与次优方法相比,SYRUP 将机器人的表现提升了约 5.6%。这听起来可能很小,但在人工智能领域,这是一个巨大的飞跃。

论文还排除了其他一些想法。它表明,仅仅将规则合并到主对话文本中(比如把海盗指令隐藏在用户的提问里)是不够的;机器人需要将规则视为一个独立的、截然不同的记忆,才能真正遵循它们。它还发现,虽然你可以通过从头开始重新训练来让机器人更好地遵循规则,但这需要耗费过多的时间和金钱。SYRUP 是一种“解码时(decoding-time)”方法,这意味着它在机器人思考时起作用,保持原始大脑冻结,仅训练一个微小的、轻量级的插件。

有趣的是,研究人员发现 SYRUP 甚至对它从未见过的规则也有效。他们在一种复杂的指令集上进行了训练,然后在另一套完全不同的规则(如严格的格式或字数限制)上进行了测试,结果表现依然良好。这表明该方法教给机器人的是一种通用的“听从老板”的技能,而不仅仅是记忆特定的答案。

然而,论文也谨慎地指出,这并不是解决一切问题的魔杖。该方法确实会给机器人的思考过程增加一点额外的时间,因为图书管理员必须检查这些词。但作者认为,与其他试图实现同样目标的复杂方法相比,这种成本是非常小的。他们还警告说,如果你过度强调“规则遵循”,机器人可能会开始显得古怪或不自然,因此必须保持平衡。

简而言之,SYRUP 表明,如果你想在不重新训练整个大脑的情况下让机器人遵循一套复杂的规则,你不应该只是寄希望于它能记住。相反,你应该给它一个专门的、实时的引导员,在它想要说出每一个词时都对照规则进行检查,从而确保最终的故事始终忠于它从一开始所穿的那件戏服。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →