← 最新论文
💻 computer science

Tunable Tool-Call Rates in LLM Agents via Representation Steering

本文证明,通过应用一个从模型残差流中提取的单一、无需训练的线性转向方向,可以在推理阶段精确控制 LLM 智能体中的工具调用率,而无需重新训练,该方向能够单调地调节调用倾向,从而在不同架构和工具类型中优化准确度与成本之间的权衡。

原作者: Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuqi Chen, Vincent Siu, Yang Liu, Dawn Song, Chenguang Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大型语言模型是强大的文本引擎,能够回答问题、编写故事并解决问题。然而,这些系统存在一个根本性的局限:它们完全依赖于存储在内部记忆中的信息。当一个问题涉及过于晦涩、过于近期或过于复杂而无法记忆的事实时,模型往往会带着危险的自信进行猜测,产生听起来看似合理但完全错误答案。为了解决这个问题,开发人员教会了这些模型使用外部工具,例如搜索引擎或计算器,在回答之前查找信息。然而,教会模型何时停止并伸手使用工具却出人意料地困难。如果模型调用工具过于频繁,会浪费时间和金钱,并面临触发非预期行为的风险;如果它调用工具太少,则会错失寻找正确答案的机会,并保持那种自信的错误状态。

研究人员长期以来一直在寻求让这些决策更加可靠的方法,通常是通过用新示例重新训练模型,或者通过仔细重写给它的指令。这些方法既昂贵又僵化;一旦模型的训练方式或提示词设定完成,改变其行为就需要重新开始整个过程。来自加州大学圣克鲁兹分校和加州大学伯克利分校研究人员的一项新研究提出了一种不同的方法。他们发现,使用工具的决策并不是一个需要通过重新训练来改变的复杂、隐藏的过程。相反,它是由模型内部工作中的一个单一、简单的信号控制的,就像调节旋钮一样,可以在不改变模型训练或指令的情况下进行实时调整。

研究人员首先观察了语言模型在面对一组可用工具(如搜索引擎、计算器和代码解释器)时的行为。他们注意到,在模型实际说话或编写响应之前,它会生成一个特定的内部信号,表明它是否打算使用任何工具。通过对比模型在决定使用工具与决定依靠记忆回答时的内部状态,团队识别出了模型数学空间中代表“使用工具冲动”的一个特定方向。这个方向并不绑定于特定的工具(如计算器或搜索引擎),而是一个通用的信号,仅仅意味着“使用工具”。

为了测试这一发现,研究人员并没有重新训练模型或更改其提示词。相反,他们提取了这个识别出的方向,并在模型生成答案的过程中将其添加到模型的内部处理中。通过添加少量的这种信号,他们可以鼓励模型更频繁地使用工具;通过减去这种信号,他们可以完全抑制使用工具的冲动。他们发现,这种调整具有惊人的精确度。随着研究人员增强信号强度,模型调用工具的频率平滑地从接近零上升到几乎百分之百。至关重要的是,模型并没有开始随机调用工具。当研究人员推动模型更频繁地使用工具时,它会专门针对那些它无法自行回答的问题,例如晦涩的历史事实或复杂的计算,而忽略那些它已经知道答案的问题。

研究还表明,这种控制机制具有高度的可适应性。研究人员从一个包含三种特定工具的设置中提取了“使用工具”信号,然后将其应用于一套完全不同的工具集,包括天气预报、股市查询和电子邮件发送。同一个信号成功诱导模型使用这些新工具,其效果与专门为它们进行过训练一样出色。此外,这种方法适用于各种不同的模型架构,从较小的标准模型到工业界使用的庞大复杂系统。在所有案例中,这个单一信号都允许研究人员在不破坏模型形成正确句子或选择合适工具的能力的前提下,调高或调低调用工具的行为。

当研究人员在模型可以实际执行网络搜索的实时环境中测试这种方法时,结果令人瞩目。在一组困难的事实性问题上,未经调整的模型仅在约 29% 的情况下回答正确,经常在应该搜索时进行猜测。通过应用转向信号来鼓励工具使用,准确率跃升至 56%,几乎翻了一番。这种提升伴随着可控的成本,因为模型在每个问题上大约进行一次搜索调用。研究人员能够追踪出使用工具的成本与答案准确性之间的清晰路径,表明操作者可以选择符合其需求的特定平衡点。

这项工作挑战了这样一个假设,即控制 AI 的行为需要繁重的重新训练或复杂的提示工程。它证明了,一个关键的决策过程——即知道何时寻求外部帮助——被编码在模型内部状态的一个简单的线性方向中。通过寻找并调整这个方向,研究人员可以在不改变模型基本训练的情况下,使 AI 代理变得更加可靠和高效。该方法提供了一种轻量级的方式来调节 AI 系统的成本和准确性,确保它们仅在必要时使用工具,并避免过度依赖或危险猜测的陷阱。虽然该技术并不能修复工具执行过程中的错误,但它为管理 AI 代理最基本也最昂贵的选择——是靠自己行动还是寻求帮助——提供了一个强大的新杠杆。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →