LLM within MCP Matters: Measuring Inefficient Resource Utilization Driven by LLMs
这项研究表明,由于行为偏好,大语言模型经常忽略模型上下文协议(MCP)服务器指令中高效嵌入的参考数据,转而使用搜索工具,因此有必要建立显式的宿主级机制,以使指令上下文的优先级高于工具选择。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:你的智能助手不仅仅能和你聊天,它还拥有一种超能力——它可以瞬间调用庞大的工具库和数据库来解决你的问题。这就是大语言模型(LLMs)与工具协同工作的激动人心的前沿领域。你可以把大语言模型想象成一个非常聪明、充满好奇心的学生,他虽然知识渊博,但有时需要查阅资料。为了帮助这位学生,我们有了一个新的标准叫做模型上下文协议(Model Context Protocol, MCP)。你可以把 MCP 想象成一个万能遥控器,让运行这个学生的“宿主”(即应用程序)能够递交给学生特定的工具、数据以及一套使用这些工具的方法说明。
研究人员提出的核心问题是:这个学生真的会听从指令吗? 有时,指令会说:“嘿,我已经把你要的答案写在这一页上了,直接读就行!”但有时,指令也会说:“噢,顺便提一下,如果你愿意,这里还有一个搜索按钮可以按。”事实证明,即使是最聪明的学生也可能会被闪亮的搜索按钮分散注意力,从而忽略了就在眼前的答案。本论文深入探讨了这种场景,旨在观察“搜索习惯”是否比“阅读指令的能力”更强大,以及如果真是这样,我们该如何解决。
“看菜单”还是“叫服务员”的大实验
在这项研究中,研究人员搭建了一个名为 LexLink 的数字厨房,这是一个旨在帮助人们查找韩国法律的服务端。想象一下,这个服务端就是一份餐厅菜单。通常情况下,如果你想要一道特定的菜(一条法律),你必须要求服务员(搜索工具)去厨房寻找食谱并把它带回来。这既费时又费力。
然而,餐厅老板决定变得聪明一点。他们在桌子上印了一份“每日特选”清单(服务端指令),其中包含了最受欢迎的 20 道菜及其准确的订单编号。规则很简单:如果你想要的菜就在这张清单上,直接告诉服务员订单编号即可。不要麻烦他们去厨房搜索! 这本应更快速且成本更低。
随后,研究人员邀请了 24 个不同的 AI 学生(来自 Claude、Gemini 和 GPT 等家族)来这份菜单点餐。他们进行了一场包含 54,000 次试验的大规模实验,以观察会发生什么。AI 学生是会阅读“每日特选”清单并直接下单呢?还是会忽略清单,依然按下“搜索”按钮呢?
令人震惊的发现:搜索按钮太诱人了
结果令人警醒。当研究人员完全移除搜索按钮,迫使学生必须使用桌面清单时,24 个 AI 模型中的 23 个表现得非常出色,它们能以 98% 到 100% 的成功率正确阅读清单并下单。这证明了这些学生能够阅读指令;他们只是在有搜索按钮可用时,并不想去读。
但当搜索按钮存在时,情况发生了戏剧性的变化。24 个模型中的 9 个成功率降到了 15% 以下。它们完全忽略了“每日特选”清单,即便答案就在桌子上,它们依然不停地点击搜索按钮。研究人员将此称为一种**“行为偏好(behavioral preference)”**。这并不是因为 AI 太笨而读不懂,而是因为它养成了一种习惯,倾向于使用它最熟悉的工具,即使那是效率最低的选择。这就像一个孩子明明知道答案在第 5 页,却还是不断要求老师帮他翻开书到第 5 页一样。
有趣的是,是否“更新”或“更聪明”并不能保证更好的行为。一些最新的模型在遵循这类特定规则方面,表现甚至比它们的旧型号还要差。研究发现,模型的“新旧程度(recency)”并不能预测谁会成为一名优秀的倾听者。
我们能训练它们倾听吗?(神奇配方)
研究人员随后尝试通过改变桌面上的指令来纠正这种坏习惯。他们测试了三种不同的技巧:
- 霸道标题 (B): 一个醒目的大字警告,写着:“必须使用清单!严禁搜索!”
- 示例 (C): 展示一张做得对和做得错的对比图。
- 提示 (D): 修改搜索按钮的描述,改为:“在使用我之前,请先检查清单。”
他们在每种可能的组合中混合使用了这些技巧。结果显示,没有任何一种单一的技巧对所有模型都有效。事实上,对于某些 AI 模型来说,仅仅使用“霸道标题”反而会让它们的表现变差(在一种情况下降至 0%!)。这就像大声吼叫可能会吓退一个学生让他开始工作,却会让另一个学生陷入僵局。
然而,当他们将所有三种技巧结合在一起时,结果令人惊叹。24 个模型中的 20 个成功率回升到了 86% 或更高。这表明,虽然你不能仅仅通过对 AI 大喊大叫来纠正它的习惯,但一种结合了警告、示例和提示的全面方法可以让他们重回正轨。
这对未来意味着什么
主要的启示是,仅仅给 AI 一个工具和一套指令是不够的。AI 可能会有一种“搜索反射”,这种反射会覆盖掉指令,导致时间与资源的浪费。论文认为,运行这些 AI 的应用程序(即“宿主”)需要介入。与其寄希望于 AI 会阅读指令,不如由应用程序强制要求 AI 在被允许选择工具之前先检查指令。
在这种情况发生之前,开发者必须保持谨慎。他们不能只写一套指令就期望它适用于所有的 AI。他们需要针对他们预期使用的“最弱”模型来测试其指令,并且应该使用结合了示例和提示的综合方案,而不是仅仅使用霸道的命令。这项研究表明,虽然问题确实存在,但通过正确的指令“配方”是可以解决的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。