← 最新论文
🤖 machine learning

When Tool-Backed Skill Retrieval Fails: Source-Style Collapse in Executable Capability Retrieval

本文识别了“源风格崩溃”(source-style collapse)这一失效模式,即工具辅助的检索器尽管具有高度的词汇重叠,但在不同数据源之间泛化能力较差,并提出了 ToolScout,一种基于 TF-IDF 的路由方法,该方法通过检测并防范这些风格不匹配,显著提高了检索覆盖率。

原作者: Yiqi Liu, Joseph James, Yang Wang, Chenghao Xiao, Chenghua Lin

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiqi Liu, Joseph James, Yang Wang, Chenghao Xiao, Chenghua Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个能够通过调用庞大外部工具库来执行复杂任务的数字助手,就像一位人类厨师从巨大的储藏室中寻找特定食材一样。为了运行,这个助手必须首先从数千个选项中找到正确的工具,然后才能开始工作。这种初始搜索是一个关键的门槛;如果助手在第一次尝试时未能找到正确的工具,整个任务就会失败,因为后续无论多么精妙的规划都无法弥补缺失的“食材”。多年来,研究人员一直致力于让这些助手在规划和推理方面变得更聪明,并假设寻找正确工具的过程已经是一个解决的问题。然而,一项新的研究揭示了这些系统在搜索过程中的一个隐藏缺陷:搜索引擎本身会突然停止工作,并不是因为工具消失了,而是因为人们索取工具的方式发生了变化。

研究人员调查了一种他们称之为“来源风格坍缩”(source-style collapse)的现象。在人工智能领域,工具通常被组织成大型集合,系统被训练为根据用户描述其需求的方式来找到正确的工具。团队发现,一个被训练为理解一种特定语言风格的搜索系统,在面对另一种风格时可能会变得完全无法使用,即使工具本身完全没有变化。为了测试这一点,他们使用了一个基于一组以特定、结构化格式编写的 1,100 个查询语句进行训练的系统。当他们用另一组由不同来源生成的查询语句对同一个系统进行测试时,该系统找到正确工具的能力大幅下降。在一个引人注目的案例中,尽管新的查询语句所使用的词汇实际上比原始训练数据更接近正确的工具,但系统的成功率却降到了不到 1%。这种失败是无声且灾难性的,让助手对自己所需的能力变得盲目。

该研究排除了几种明显的解释。这既不是问题长度的问题,也不仅仅是词汇重叠的问题。研究人员还测试了失败是否是由工具描述的原始技术格式(通常看起来像复杂的代码)引起的。他们将每个工具都重写成了一张简洁、易读的“技能卡”,描述了该工具的功能、使用时机以及所需的输入。即使使用了这些人类友好的描述,当问题的风格发生变化时,搜索系统仍然会崩溃。这证明了问题不在于工具的外观,而在于系统学习搜索的方式与新问题措辞方式之间更深层次的不匹配。系统变得过于专注于一种语言方言,以至于无法理解另一种方言,即便两种方言都在请求完全相同的东西。

为了解决这个问题,团队开发了一种名为 ToolScout 的新方法,它充当了搜索过程中的交通指挥员。该系统不再强迫每个问题都通过单一的、专门化的搜索引擎,而是首先检查传入问题的“指纹”。它利用对单词的简单、轻量级分析来确定问题是否符合搜索引擎所接受训练的风格。如果问题看起来属于不同的风格,系统会立即将其路由到一个更广泛、更通用的搜索引擎,后者见过许多不同风格的问题。这种切换是瞬间且自动完成的。当他们将这种路由方法应用于近 5,000 个问题的混合流时,系统的找对工具的能力从失败的 22% 跳升到了可靠的 86%。

研究人员还发现,一旦系统被路由到正确的引擎,只需极少量的少量新信息即可快速提升其性能。通过向专门的搜索引擎展示仅 20 个新风格问题的示例,他们就能修复其性能,将针对这些特定案例的成功率从接近于零提高到 50% 以上。这表明问题并非技术的根本缺陷,而是搜索引擎在适应新表达方式方面缺乏灵活性。研究结论指出,要让数字助手真正可靠,它们不能仅仅是聪明的规划者;它们还必须拥有一种稳健、可适应的寻找工具的方法,这种方法能够识别用户语言的变化,并在任务开始之前就知道如何切换档位。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →