Influence of Prompt Engineering on Small Language Models for Guarded Query Routing
本文表明,提示工程技术(特别是少样本优化和 DSPy 签名)显著提升了紧凑型小语言模型的受保护查询路由性能,使其能够在保持低延迟的同时,接近大型前沿模型的准确度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在经营着一个为庞大知识图书馆服务的繁忙、高科技邮局。每天,数百万封信件(查询)都会寄达,询问关于法律合同到医疗建议的一切问题。但问题在于:有些信件是危险的,有些是胡言乱语,还有些只是询问了该图书馆并不涵盖的内容。如果你把一封危险的信件发给了一位医学专家,可能会得到错误的答案,甚至造成安全隐患。因此,在任何信件到达特定专家(如法律、金融或医疗)之前,必须先通过门口的一位“守护者”(Guardian)。这位守护者有两个任务:首先,判断这封信是否安全,以及是否属于该图书馆的范畴;其次,如果信件是安全的,则快速确定应该由哪位特定的专家(法律、金融或医疗)来阅读。
长期以来,人们认为你需要一个超级智能的大型机器人来担任这个守护者,因为这项工作非常复杂。但大型机器人既慢又贵,而且非常耗电。这篇论文提出了一个有趣的问题:我们能否使用更小、更便宜、更快的“口袋机器人”(称为小语言模型)来承担这个守护者的工作?问题的关键在于,这些较小的机器人有时会感到困惑。它们可能很擅长识别胡言乱语,但当看到一个真实的问题时,它们会变得过于胆小,不敢选择特定的专家,或者会忘记游戏规则。研究人员想看看,我们是否可以通过改变给它们的指令,而不是重新构建机器人本身,来教这些较小的机器人更好地遵守规则。
守护者的困境
在人工智能的世界里,我们拥有这些“大语言模型”,它们就像博学多才、无所不知的巫师。它们可以写故事、解数学题,还能进行各种聊天。但它们笨重且缓慢。为了让它们适用于实时任务,我们通常会在前面放置一个“路由”(router)。把这个路由想象成夜总会的保安。保安必须瞬间做出两个决定:“这个人可以进来吗?”(安全性/分布外)以及“他们应该去哪个 VIP 包厢?”(意图/分布内)。
如果保安太严格,就会把好客人拒之门外(拒绝有效问题);如果太宽松,则会让麻烦制造者混入其中(不安全的问题)。论文称之为“受保护的查询路由”(Guarded Query Routing)。目标是找到一个既快、又便宜、且足够准确的保安,既能保证俱乐部的安全,又能将正确的人送到正确的房间。
实验:训练口袋机器人
研究人员收集了 22 种不同的“口袋机器人”(小语言模型),其规模各异,从只有 2.7 亿个“脑细胞”(参数)的微型模型到拥有 700 亿参数的模型。他们通过一项特殊的测试来测试这些机器人,这项测试被称为 GQR-Bench,它就像一个巨大的障碍赛场,充满了三类有效问题(法律、金融、医疗)和七类棘手的、离题的或危险的问题。
他们使用一个名为 GQR-Score 的特殊分数来衡量机器人,这个分数平衡了它们捕捉有效问题与拒绝错误问题的能力。如果一个机器人拒绝所有内容,它的得分会很低,因为它毫无用处;如果它接受所有内容,得分也会很低,因为它不安全。
重大发现:不在于规模,而在于指令
团队发现的第一件事是,规模并非一切。最大的、最强大的机器人(Gemma 3 27B)得到了 96.01 的极高分。但你猜怎么着?一个规模小得多的机器人(Qwen3.5 9B)仅通过使用一套标准指令,就得到了几乎相同的分数(94.55)。即使是中等规模的机器人(Mistral 7B)表现也相当不错,得分 81.79。
然而,微型机器人遇到了一个奇怪的问题:它们对于说“不!”这件事做得太出色了。例如,Granite 4 Tiny 机器人因为太害怕犯错,竟然拒绝了 99.75% 的所有问题,包括那些正确的问题!它正确识别有效问题的概率仅为 37.29%。这就像是一个保安认为,运行俱乐部最安全的方法就是锁上大门,让谁也别进来。
魔法修复:“示例”技巧
研究人员想到了:“我们能否仅仅通过改变指令来修复这些胆小的机器人?”他们并没有重新训练机器人(这相当于重建机器人的大脑),而是使用了名为提示工程(Prompt Engineering)的技术。这就像是在机器人开始工作前,给它一份“小抄”或一组示例。
他们尝试了几种方法,但结果取决于具体的机器人。对于 Granite 4 Tiny 机器人来说,最有效的方法其实不是“示例”技巧,而是一种更简单的指令格式,叫做 DSPy Baseline。这种方法去掉了多余的废话,给了机器人一个严格、精简的模板。它从极其糟糕的 54.29 分跃升到了优秀的 83.05 分。它不再拒绝一切,而是开始真正地进行分类。
对于其他机器人,比如 Mistral 7B,“示例”技巧(称为少样本提示/Few-Shot Prompting)才是真正的魔法。想象一下你在教一名新员工如何分拣邮件。与其只说“分拣邮件”,不如给他们三个例子:
- “这封信是关于诉讼的 -> 发送到法律部。”
- “这封信是关于股票的 -> 发送到金融部。”
- “这封信是关于一只猫的 -> 放入‘拒绝’箱。”
当他们把这些例子交给 Mistral 7B 机器人时,它的分数从 81.79 跳升到了 90.87。Qwen3.5 9B 机器人通过这种方法也变得更强了,达到了 95.74,这几乎与那个巨大的机器人不相上下,但运行速度要快得多。
论文表明,问题不在于这些小机器人不知道答案,而在于它们不知道如何遵循游戏规则。这些示例(或严格的模板)向它们展示了正确的答案究竟是什么样子的,它们立刻就掌握了窍门。
权衡:速度 vs. 准确性
不过,这里有一个小代价。当你给机器人一份带有示例的“小抄”时,它需要阅读的信息量会变长。这会让机器人的反应速度稍微变慢。研究发现,使用这些示例会让机器人处理单个问题的速度增加约 2 到 6 倍。然而,它们仍然非常快(每个问题大约 0.05 到 0.28 秒),这对于大多数现实世界的应用来说已经足够快了。
研究人员还尝试了一种更复杂的方法,叫做 GEPA,这就像是让一个“老师机器人”自动重写指令。但效果并不如直接给机器人几个清晰的例子那样好。事实上,对于一些最小的机器人来说,复杂的重写反而会让情况变糟,导致它们再次陷入混乱。
这对未来意味着什么
主要的启示是,你不一定需要那个最大、最贵的机器人才能成为一个好的守护者。只要你给出正确的指令,一个更小、更便宜的机器人完全可以胜任这项工作。具体来说,给它展示一些例子(Few-Shot)有助于克服它的胆怯并让其遵守规则;而对于某些特定的机器人,一个严格、精简的模板则是最好的选择。
然而,论文也警告说,如果一个机器人实在太小了(比如那些只有 8 亿参数的模型),即使是最好的示例也可能无法拯救它。而且,如果一个机器人已经在做得很好,添加示例可能不会有太大帮助,甚至可能不必要地降低其速度。
简而言之,对于构建一个安全且快速的 AI 系统,秘诀不仅仅是购买更大的大脑,而是知道如何与你现有的大脑进行沟通。一点点“提示工程”就能将一个困惑、过度谨慎的机器人转变为一个敏锐、高效的守护者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。