← 最新论文
🤖 machine learning

Talk to Me, Jarvis: An Open-Source Edge-Deployable Voice Assistant Framework for Autonomous Racecars

本文介绍了 Jarvis,一个用于自主赛车的开源、可边缘部署的语音助手框架,该框架利用经过本地微调的 Mistral 7B 模型来实现高准确度的意图识别与低延迟,从而消除了在线托管方案的网络依赖和推理延迟。

原作者: Daniel Henel, Frederik Werner, Alexander Langmann, Johannes Betz

发布于 2026-09-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniel Henel, Frederik Werner, Alexander Langmann, Johannes Betz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在自动驾驶赛车的高风险世界中,车辆在没有人类驾驶员的情况下以惊人的速度穿梭于赛道,其误差范围是以微秒来衡量的。这些机器依赖复杂的软件来感知周围环境、规划路径并控制运动,但当出现意外情况时,仍需要人类操作员发出关键指令。传统上,赛车工程师可能会使用键盘或屏幕来告诉赛车停止、加速或返回维修区。然而,将视线从实时数据中移开去输入命令需要时间,而在比赛中,这种延迟可能就是胜利与失败之间的分水岭。这产生了一种对语音助手的需求,它能让操作员在保持视线紧盯赛道的同时进行自然表达。挑战在于如何让这个助手足够快速且可靠,以应对行驶中的赛车。虽然现代人工智能可以理解人类语言,但最强大的版本通常运行在远程云端服务器上。将语音命令发送到云端并等待回复会引入延迟,并且依赖于稳定的互联网连接,而这两者在赛车疾驰而下的过程中都是不可接受的。解决方案需要一个完全运行在车辆本身或附近本地计算机上的助手,它能够即时倾听、理解并执行动作,而无需依赖外部世界。

慕尼黑工业大学的研究人员开发了一个名为 Jarvis 的系统来解决这一特定问题。他们构建了一个旨在离线运行的语音助手,这意味着它不需要互联网连接即可工作。该系统通过监听特定的触发词“Hey Jarvis”来工作,然后等待指令。一旦操作员开口说话,助手就会使用一个在本地运行的轻量级语音识别工具将声音转换为文本。随后,这段文本会被传递给一个专门的人工智能模型,该模型充当翻译器,将人类操作员的自然语言转化为赛车可以执行的精确、预定义的指令。例如,如果工程师说“让车停下来(Bring the car to a halt)”,系统会将此识别为与“停止车辆(Stop the vehicle)”相同的命令,并将其映射为停止赛车的单一安全动作。整个过程——从听到声音到向赛车发送数字指令——都在本地硬件上完成,确保了系统保持快速且独立于网络状况。

为了构建这个系统,团队必须选择合适类型的人工智能。他们测试了许多不同的模型,包括互联网上一些最强大的模型,以及可以在笔记本电脑上运行的更小、更轻量级的模型。他们发现,虽然强大的在线模型非常擅长理解语言,但对于赛车来说太慢了。命令传输到云端再返回所需的时间往往长达数秒,这对于时间敏感的应用来说实在太长了。相比之下,在本地运行的小型模型要快得多,但最初在理解赛车所需的特定命令方面表现挣扎。研究人员通过采用其中一个较小的本地模型,并针对赛车指令数据集对其进行专门训练,解决了这个问题。他们教会了模型识别人类要求赛车启动、停止或改变速度的各种不同方式,从而确保模型在保持极速响应的同时,能够处理自然语言的多样性。

他们的研究结果表明,这种方法非常有效。在对本地模型进行训练后,该系统在正确识别预期命令方面的成功率达到了 9 7.63%。更重要的是,从文本准备好进行分析的那一刻起,系统处理这些命令的平均延迟仅为 1.39 秒。这种性能优于他们测试的大型云端模型,后者在这一特定场景下既慢又不准确。该系统还包含一个安全检查机制,即助手在将指令发送给赛车之前会向操作员进行确认,以确保误听的词汇不会导致非预期的动作。通过将整个系统开源,研究人员为他人构建类似的机器人和自动驾驶工具提供了蓝图,在这些领域,速度和可靠性至关重要。这项工作证明,对于控制赛车这类专业任务,一个经过精心调优的本地大脑可以胜过一个庞大而遥远的脑,证明了有时最好的智能就是那个留在原地、被紧迫需要的地方的智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →