← 最新论文
💻 computer science

Enhancing Virtual Agents through SLMs and Edge-Computing: An Exploratory Evaluation of Think and Memory Processes

本文提出并评估了一种基于边缘侧的虚拟智能体系统,该系统利用小语言模型(SLMs)来实现认知具身智能体架构(CEAA)中的“思考”(Think)与“记忆”(Memory)过程,证明了在 NVIDIA Jetson 硬件上实现高效且具备上下文感知能力的认知编排,以用于沉浸式虚拟世界。

原作者: Aimilios Hadjiliasi, Louis Nisiotis

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Aimilios Hadjiliasi, Louis Nisiotis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下这样一个世界:你的视频游戏角色、虚拟导游或元宇宙中的朋友不再只是像机器人对着提词器朗读那样照本宣科。相反,他们在数字意义上是真正“活着”的:他们记得你昨天告诉他们的事,他们能理解你的笑话,并且可以即兴做出决策。这就是“具身智能虚拟代理”(Embodied Virtual Agents)的梦想。但问题在于,为了让这些角色变得聪明,它们通常需要将想法发送到云端那些庞大且功能强大的超级计算机中。这会产生延迟,造成断联感。

欢迎两位新英雄登场:小语言模型(SLMs)边缘计算(Edge Computing)。把 SLM 想象成一个虽然精巧但极其聪明的“口袋大脑”,它能够理解语言,而无需依赖超级计算机。而边缘计算则像是将这个大脑从遥远的数据中心移到了离行动现场更近的地方——甚至可能直接安装在你使用的设备上。科学家们提出的核心问题是:我们能否将这个“口袋大脑”直接放在我们的虚拟朋友身边,让他们能够即时思考、记忆和行动,而不必等待信号在云端与本地之间往返传输?这篇论文正是深入探讨了这一点,测试了这些较小的本地化大脑是否足够聪明,能够处理虚拟代理的记忆与决策等繁重任务。


大脑与图书管理员:虚拟代理的困境

在虚拟现实的世界里,一个代理人需要两个核心要素才能显得真实:**“思考”(Think)过程(用于决定做什么)和“记忆”(Memory)**过程(用于记住你是谁以及你们聊过什么)。这项研究背后的研究人员希望看看他们能否利用运行在本地设备(具体是一款名为 NVIDIA Jetson Orin NX 的强大微型计算机)上的小语言模型,为这些代理人构建一个“认知引擎”。他们不只是想让代理人进行聊天,还希望它能像一个真正的助手一样,将你的请求路由到正确的服务(例如生成 3D 模型或播放声音),并记录下对话的日志。

为了测试这一点,他们构建了一个系统,其中代理人的“大脑”是一个 Qwen2.5 模型。他们尝试了三种不同规模的“大脑”:一个拥有 5 亿参数的极小模型,一个拥有 15 亿参数的中型模型,以及一个拥有 30 亿参数的大型模型。他们将它们全部部署在边缘设备上,并给予一系列挑战,以观察它们的思考和记忆能力。

“思考”测试:请求路由

首先,他们测试了**“思考”**过程。想象一下你在虚拟世界中说:“我需要一个巨龙咆哮的音效”或者“你能为城堡墙壁生成一个纹理吗?”代理人需要瞬间判断该使用哪种工具。这就像繁忙酒店里的前台接待员,必须将客人引导至正确的房间:水疗中心、健身房或餐厅。

结果显示出明显的“速度与智能”之间的权衡。极小的 0.5B 模型速度很快,但经常迷失方向。它的正确率仅为 29.4%。它经常混淆相似的请求,比如把“图像转 3D 生成”与“对话生成器”搞混。它就像一个前台,因为忘了其他房间在哪,所以总是把所有人往健身房赶。

1.5B 模型有了巨大的进步,正确率达到了 85.4%。它能很好地处理大多数请求,尽管在处理复杂的 3D 任务时仍会出错。3.0B 模型是最聪明的,准确率达到了 87.7%,尤其是在处理棘手的生成任务时。然而,变聪明是有代价的:3.0B 模型的思考时间要长得多。它的平均响应时间为 5,067 毫秒(约 5 秒),而 1.5B 模型为 3,349 毫秒(约 3.3 秒)。极小的 0.5B 模型速度最快,为 1,504 毫秒,但由于过于不可靠,根本无法投入使用。

“记忆”测试:记住细节

接下来,他们测试了**“记忆”**过程。这就像要求代理人回忆你之前提到的某个细节,或者在你改变主意时更新一个事实。例如,如果你说“我的角色名字叫 Alex”,随后又说“其实,我的名字是勇敢者 Alex”,代理人需要记住这个更新,而不是感到困惑。

在这里,差异更加显著。0.5B 模型正确回忆事实的概率为 72.8%,但在处理修正信息方面表现糟糕。它经常会记住正确的人,却记错了细节,或者无法意识到你已经改变了主意。它就像一个朋友,虽然记得你的名字,却总是在你换了发型后忘记这件事。

1.5B 模型表现更好,正确回答了 78.4% 的问题。它擅长处理简单事实,但在处理复杂更新或区分相似记忆时仍显吃力。3.0B 模型是明显的赢家,准确率达到了 93.6%。它能可靠地处理事实、更新和修正。然而,正如思考测试所示,这种高准确度是以牺牲速度为代价的。3.0B 模型处理记忆请求的平均时间为 9,693 毫秒(近 10 秒),在最坏的情况下,某些请求甚至需要 14,531 毫秒(超过 14 秒)。0.5B 模型虽然快得多,为 2,025 毫秒,但其低下的准确率使其无法胜任任何严肃的任务。

结论:取决于任务需求

那么,研究人员发现了什么?他们发现,小语言模型确实可以在边缘侧部分驱动虚拟代理的“思考”和“记忆”部分,而无需依赖云端。但并没有一个单一的“完美”尺寸。

如果你需要速度且可以容忍一些错误,较小的模型速度更快但并不可靠。如果你需要高准确度来记忆细节或做出复杂决策,较大的模型要好得多,但它们很慢。论文建议,最好的解决方案可能是采用一种混合方法:使用一个较小、较快的模型来处理快速、简单的任务(如路由请求),并使用一个较大、更聪明的模型来处理繁重的工作(如记忆复杂的历史记录或处理修正)。

研究总结道,虽然我们正接近实现让虚拟代理在本地进行思考和记忆,但仍有很长的路要走。目前的模型在实时、即时交互方面仍然有些缓慢,有时也会对采取何种行动感到困惑。但这迈出了充满希望的第一步,表明通过合理的模型组合和精心的设计,我们可以开始构建那些不仅看起来漂亮,而且足够聪明、能与我们在元宇宙中真正共处的虚拟朋友。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →