From Prompt to Service: An SLM-Based Agent Orchestration Gateway for AI-Driven Virtual Worlds
本文提出并评估了一种基于小语言模型(SLM)的智能体编排网关,该网关通过使用部署在边缘侧的经过微调的小语言模型来对用户意图进行分类并路由请求,从而将虚拟世界客户端与异构 AI 后端解耦,进而实现在无需修改客户端应用的情况下,实现可扩展、低延迟且具可扩展性的 AI 服务集成。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正漫步在一座神奇的数字博物馆中。你可以像与真实的导游交谈一样,与那些虚拟向导(化身)进行对话。但这里有一个限制:这些向导需要完成许多不同的任务。有时他们只是和你聊天;有时他们需要将你的话翻译成另一种语言;还有时,他们需要调取深层的历史事实、解释复杂的艺术品,或者根据你的请求凭空构建一座 3D 雕像。
在过去,构建一个能做所有这些事情的向导,就像是试图把一个图书馆、一个翻译间、一个施工队和一个聊天室全部塞进一个微小的背包里。它既沉重又混乱,而且如果你想增加一项新技能(比如绘画),你就必须重新构建整个背包。
问题:“一刀切”的瓶颈
本文的作者注意到,随着虚拟世界变得越来越智能,它们需要连接到位于不同地方的许多不同的“AI 大脑”(有些在你的本地计算机上,有些在云端)。如果虚拟世界尝试直接与每一个 AI 大脑进行交谈,它会变得混乱、缓慢且难以更新。
解决方案:“智能礼宾” (网关)
为了解决这个问题,研究人员构建了一个智能礼宾(称为“智能体编排网关”)。把这个智能礼宾想象成站在博物馆前台的一位高效前台接待员。
- 你向接待员说话: 你向你的虚拟向导提问。
- 接待员倾听并做出决定: 接待员并不试图自己回答所有问题,而是使用了一个小语言模型 (SLM)。把 SLM 想象成一个非常聪明但轻量级的实习生。它不是世界上最大、最强大的 AI,但它很快,并且擅长于一件特定的工作:弄清楚你到底想要什么。
- 路由分配:
- 如果你问:“现在几点了?”实习生会说:“这是一个聊天问题”,然后将其发送给聊天机器人。
- 如果你要求:“把这句话翻译成法语”,实习生会说:“这是一个翻译任务”,然后将其发送给翻译器。
- 如果你要求:“给我建一个 3D 龙”,实习生会说:“这是一个建筑任务”,然后将其发送给 3D 构建器。
- 结果: 虚拟向导得到了答案并展示给你。你甚至察觉不到工作是如何拆分的;它看起来就像一次流畅的对话。
实验:测试实习生
研究人员在一个关于塞浦路斯教堂的虚拟博物馆中测试了这个系统。他们想看看这些“轻量级实习生”(小型 AI 模型)是否足以胜任接待员的工作。
- 测试: 他们给实习生 50 **个不同的问题进行分类。
- 意外发现: 最初那些微小的、未经训练的实习生表现得很糟糕。它们会感到困惑,并将错误的请求发送到错误的部门。
- 修复方法: 他们给了实习生一些专门的训练(微调)。他们专门教导实习生如何识别“聊天”、“历史”和“构建”之间的区别。
- 结果: 经过训练后,这些微小的实习生成为了优秀的接待员。它们的分类能力几乎可以媲美那些庞大且昂贵的 AI 模型,但它们运行得快得多,且可以在更便宜的硬件(例如名为 Jetson Orin NX 的小型计算板)上运行。
“分层”策略:两人小组
研究人员还尝试了一个聪明的技巧。他们没有使用一个巨大的 AI 来同时负责排序和回答,而是使用了一个两人小组:
- 微型实习生: 非常擅长快速对请求进行分类(例如:“这是一个聊天问题”)。
- 大型助手: 一个稍大一点的 AI,它仅在需要编写聊天回答时才会介入。
他们发现,这个团队比让一个巨大的 AI 同时尝试做所有事情的效果更好。微型实习生快速做出决策,而大型助手只在必要时才工作。这使得整个系统保持了快速响应,即使是在普通的硬件上也是如此。
他们学到了什么(核心结论)
- 小即是美(如果训练得当): 你不需要一个庞大、极其昂贵的 AI 来管理虚拟世界的服务台。一个经过训练的小型 AI 完全可以完美胜任路由请求的工作。
- 解耦是关键: 通过拥有这个“礼宾”层,虚拟世界不需要知道 AI 大脑在哪里或它们是如何工作的。你可以更换“3D 构建器”或添加新的“翻译器”,而无需触动虚拟世界的代码。
- 速度至关重要: 这个系统足够快,能够让人感觉到是在进行真实的实时对话,这使得它在现实世界的虚拟场景中具有实用性。
简而言之,本文表明,通过使用一个聪明的、经过训练的“交通警察”(小型 AI),虚拟世界可以轻松地连接到许多不同的 AI 服务,而不会陷入停滞,这使得未来的数字博物馆和游戏变得更加灵活且响应迅速。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。