Scaling Enterprise Agent Routing: Degradation, Diagnosis, and Recovery
本文研究了企业级大语言模型助手在工具目录从 10 个代理扩展到 110 个代理时路由准确率如何下降,识别出检索差距和混淆差距是导致失败的主要原因,并证明基于嵌入的短列表筛选法能有效恢复多种前沿模型在 F1 指标上的显著性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位管理着一个庞大且繁忙办公室的经理。你拥有一支由 110 名专业员工(代理) 和 584 项特定技能(工具) 组成的团队。你的职责是接收来自客户的请求(例如“我需要发送一封电子邮件”),并立即挑选出处理该请求的唯一正确员工。
这篇论文是一份关于当这个办公室变得过于庞大时会发生什么的报告,以及那个经理(AI)是如何开始犯错的。
以下是他们研究结果的拆解,使用了简单的类比:
1. 问题所在:“选择过多”的陷阱
当办公室规模较小时(例如只有 10 名员工),经理的表现非常出色。但随着他们增加更多人员,经理开始感到困惑。
- 类比: 想象一下要在干草堆中寻找一根特定的针。如果干草堆很小,很容易找到;但当它长成一座大山时,你就会开始错过那些你应该找到的针。
- 结果: 随着工具目录从 10 个增长到 110 个,AI 寻找正确工具的能力显著下降(下降了约 16–23%)。这并不是说 AI 开始更频繁地挑选错误的工具,而是它开始完全遗漏了正确的工具。
2. 为什么会失败?两种类型的错误
研究人员将这种失败分解为两种截然不同的问题,就像侦探失败调查案件的两种不同原因一样:
- “检索差距”(图书管理员问题): AI 甚至无法在列表中看到正确的工具。这就像一位图书管理员,因为图书馆太大、太乱,导致他找不到书架上的书。这是研究人员可以修复的部分。
- “混淆差距”(双胞胎问题): 即使 AI 确实看到了正确的工具,它仍然会感到困惑。为什么?因为办公室里有很多“双胞胎”。
- 例子: 你有 Gmail、Outlook 和 Yahoo Mail。你有“改进”、“改写”和“校对”工具。它们的功能几乎完全一样。即使有了完美的列表,AI 仍然难以决定哪一个“双胞胎”才是最合适的。这种困惑导致了性能的永久性下降,而这无法通过更好地列出工具来解决。
3. 解决方案:“短名单”过滤器
研究人员测试了一个简单的修复方法:不要向 AI 展示整个 584 个工具的列表。 相反,先使用一个快速过滤器(类似于智能搜索栏)找出前 20 个最可能的候选者,然后再让 AI 从这个小群体中选出获胜者。
- 类比: 与其让一名评委从 584 名参赛者中挑选获胜者,不如先让一名侦察员选出前 20 名。然后,评委再从这 20 人中选出获胜者。
- 结果: 这种“短名单”方法效果惊人。它恢复了约 10–17% 的损失性能。它并没有解决“双胞胎问题”(混淆),但它完全解决了“图书管理员问题”(遗漏工具)。
4. 什么行不通(以及什么行得通)
团队尝试了多种构建这个“侦察员”(过滤器)的方法:
- 胜出者: 使用 Embeddings(嵌入)(一种理解单词含义而非仅仅是拼写的 AI 技术)。这是最好的方法。它理解“发送消息”和“给团队发邮件”是相似的,即使单词不同。
- 失败者: 关键词搜索(寻找精确的单词匹配)。这表现得很糟糕,因为在一个庞大的办公室里,每个人都会使用相同的词汇(如“电子邮件”或“日程安排”),所以搜索这些词并不能帮助区分不同的工具。
- “分组”方法: 将工具分为类别(如“邮件工具”对比“写作工具”)并先选择一个类别,效果不如直接挑选单个工具。
5. 现实世界测试
研究人员不仅使用了计算机生成的测试问题,还针对 1,435 个来自真实用户的实际请求 进行了测试。
- 真实用户是“混乱”的:他们会拼错单词、使用俚语,或者表达得并不准确。
- 结果依然成立:即使面对混乱的现实世界数据,“短名单”方法仍然显著提升了性能,证明这不仅仅是一个实验室里的技巧——它在现实世界中是有效的。
核心结论
当你扩大一个拥有过多工具的 AI 系统规模时,它会感到不堪重负并开始遗漏正确答案。
- 解决方法: 不要让 AI 同时观察所有事物。使用一个智能过滤器,先将其范围缩小到 20 个选项的短名单。
- 局限性: 即使有了短名单,AI 仍然会被功能非常相似的工具(比如不同的邮件应用)所迷惑。那部分很难修复,但“短名单”方法解决了大部分问题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。