✨ 要点🔬 技术摘要
在自动驾驶赛车的高风险世界中,车辆在没有人类驾驶员的情况下以惊人的速度穿梭于赛道,其误差范围是以微秒来衡量的。这些机器依赖复杂的软件来感知周围环境、规划路径并控制运动,但当出现意外情况时,仍需要人类操作员发出关键指令。传统上,赛车工程师可能会使用键盘或屏幕来告诉赛车停止、加速或返回维修区。然而,将视线从实时数据中移开去输入命令需要时间,而在比赛中,这种延迟可能就是胜利与失败之间的分水岭。这产生了一种对语音助手的需求,它能让操作员在保持视线紧盯赛道的同时进行自然表达。挑战在于如何让这个助手足够快速且可靠,以应对行驶中的赛车。虽然现代人工智能可以理解人类语言,但最强大的版本通常运行在远程云端服务器上。将语音命令发送到云端并等待回复会引入延迟,并且依赖于稳定的互联网连接,而这两者在赛车疾驰而下的过程中都是不可接受的。解决方案需要一个完全运行在车辆本身或附近本地计算机上的助手,它能够即时倾听、理解并执行动作,而无需依赖外部世界。
慕尼黑工业大学的研究人员开发了一个名为 Jarvis 的系统来解决这一特定问题。他们构建了一个旨在离线运行的语音助手,这意味着它不需要互联网连接即可工作。该系统通过监听特定的触发词“Hey Jarvis”来工作,然后等待指令。一旦操作员开口说话,助手就会使用一个在本地运行的轻量级语音识别工具将声音转换为文本。随后,这段文本会被传递给一个专门的人工智能模型,该模型充当翻译器,将人类操作员的自然语言转化为赛车可以执行的精确、预定义的指令。例如,如果工程师说“让车停下来(Bring the car to a halt)”,系统会将此识别为与“停止车辆(Stop the vehicle)”相同的命令,并将其映射为停止赛车的单一安全动作。整个过程——从听到声音到向赛车发送数字指令——都在本地硬件上完成,确保了系统保持快速且独立于网络状况。
为了构建这个系统,团队必须选择合适类型的人工智能。他们测试了许多不同的模型,包括互联网上一些最强大的模型,以及可以在笔记本电脑上运行的更小、更轻量级的模型。他们发现,虽然强大的在线模型非常擅长理解语言,但对于赛车来说太慢了。命令传输到云端再返回所需的时间往往长达数秒,这对于时间敏感的应用来说实在太长了。相比之下,在本地运行的小型模型要快得多,但最初在理解赛车所需的特定命令方面表现挣扎。研究人员通过采用其中一个较小的本地模型,并针对赛车指令数据集对其进行专门训练,解决了这个问题。他们教会了模型识别人类要求赛车启动、停止或改变速度的各种不同方式,从而确保模型在保持极速响应的同时,能够处理自然语言的多样性。
他们的研究结果表明,这种方法非常有效。在对本地模型进行训练后,该系统在正确识别预期命令方面的成功率达到了 9 7.63%。更重要的是,从文本准备好进行分析的那一刻起,系统处理这些命令的平均延迟仅为 1.39 秒。这种性能优于他们测试的大型云端模型,后者在这一特定场景下既慢又不准确。该系统还包含一个安全检查机制,即助手在将指令发送给赛车之前会向操作员进行确认,以确保误听的词汇不会导致非预期的动作。通过将整个系统开源,研究人员为他人构建类似的机器人和自动驾驶工具提供了蓝图,在这些领域,速度和可靠性至关重要。这项工作证明,对于控制赛车这类专业任务,一个经过精心调优的本地大脑可以胜过一个庞大而遥远的脑,证明了有时最好的智能就是那个留在原地、被紧迫需要的地方的智能。
技术摘要:Jarvis —— 一种用于自主赛车的开源边缘部署语音助手
问题陈述
在自主赛车领域,决策发生在毫秒之间,这要求软件系统必须优先考虑速度和可靠性。虽然自动驾驶车辆具有高度的自主性,但人类操作员仍需要一种机制来发布高层行为指令(例如“启动”、“停止”、“进站”),或对突发赛道状况做出反应。传统的交互界面,如图形用户界面(GUI)或命令行,需要视觉注意力,这会增加反应时间并分散对实时遥测数据的关注。
语音助手提供了一种免提的替代方案,但在时间敏感的赛车场景中部署面临着重大障碍:
延迟与网络依赖性: 在线托管的大型语言模型(LLM)会引入可变的推理延迟,并需要稳定的网络连接,这不适用于分秒必争的赛车决策。
语义不匹配: 自然语言是无界的,而车辆控制需要一组有限的可执行命令。操作员可能会用多种方式表达“停止”指令(如“停下”、“让它停下来”),这需要强大的意图识别能力,将这些变体映射到特定动作。
资源限制: 移动赛车环境中的边缘硬件计算能力有限,因此需要既不牺牲推理速度又足够轻量化的模型。
现有的解决方案(如 LLM4AD)利用基于云端的 API 来实现一般的乘客舒适度,但存在高延迟和依赖网络的问题。相反,轻量级的小语言模型(SLM)在特定任务中展现出了潜力,但需要进行领域特定适配,以实现高精度的命令分类。
作者开发了 Jarvis ,一种离线的、可部署在边缘端的语音助手架构,专门用于自主赛车的高层控制。该系统集成了三个主要组件:
1. 系统架构
Jarvis 作为基站中的一个独立模块运行,该基站与车辆的机载软件(基于 ROS2)进行交互。其工作流程如下:
唤醒词检测: 使用 openWakeWord 框架通过关键词检测持续监测音频,寻找触发短语“Hey Jarvis!”。
语音转文本 (STT): 激活后,系统使用 OpenAI 轻量级的英文专用 Whisper (“base.en”) 模型进行本地转录。这确保了处理过程不依赖网络。
意图分类: 转录后的文本由经过微调的 LLM 处理,将自然语言映射到预定义的行为命令(例如速度目标、进站请求)。
确认与执行: 系统通过文本转语音(TTS)模块(Coqui TTS 与 VITS)提供听觉反馈。至关重要的是,操作员必须在指令通过 ROS2 发送到基站之前确认该指令,由基站在将指令转发给车辆前进行安全检查。
2. 模型开发与微调
其核心创新在于文本到命令的分类器。作者评估了多种在线和本地模型,最后选择了 Mistral 7B 进行领域特定微调。
数据集准备: 最初 85 个样本的数据集不足以进行训练。作者利用 GPT-4 采用增强技术(同义词替换、改写、重排序)将数据集扩展到了 1,645 个样本(包含 17 个命令类别 + 1 个超出范围类)。
训练流水线: 团队采用了使用 Unsloth 框架进行 4 位量化的 QLoRA (量化低秩自适应)。这使得在资源受限的硬件(NVIDIA GeForce RTX 3060 笔记本 GPU)上进行高效微调成为可能。
优化: 针对学习率、轮数(epochs)、梯度累积步数和 LoRA 秩进行了网格搜索。该过程分为两个阶段:首先是在命令子集上进行初步微调以确定最佳模型架构,随后是在完整数据集上进行全量微调。
核心贡献
本文概述了三个主要贡献:
对比分析: 基准测试对比了在线托管模型(如 GPT-4、GPT-3.5)与本地部署的开源权重模型,评估了推理延迟与意图识别准确度之间的权衡。
微调流水线: 展示了一个通过适配轻量级本地模型(Mistral 7B)来实现卓越意图识别准确度并保持低延迟的流程,其表现优于云端替代方案。
开源框架: 发布了一个集成了唤醒词检测、本地 STT 和命令分类的开源离线语音助手架构,并在移动硬件上得到了验证。
实验结果
评估重点在于 意图分类准确度 和 推理时间 。
基准性能: 初步基准测试显示,虽然在线模型(如 GPT-4o)达到了中等准确度(74–85%),但其延迟较高(3.38s 至 21.08s)。本地模型(如 Llama 3.2 3B)延迟较低(<0.5s),但初始准确度较差(<25%)。
微调后的性能: 经过两阶段微调后,Mistral 7B 模型实现了:
准确度: 在测试集上的分类准确度达到 97.63% ,超过了所有评估的云端模型。这一结果是通过按照表 III 指定配置进行全量微调后的最佳性能变体获得的。
延迟: 端到端平均处理时间(从分词输入到最终 Token 生成)为 1.39 秒 。
效率提升: 微调过程将模型的准确度从最初的 27.06% 提升至 97.63%,证明了在 4 位量化硬件上对 7B 规模模型进行领域特定适配是非常有效的。
重要性与主张
作者声称,对于时间敏感环境下的狭窄范围命令分类任务,通过领域特定微调轻量级本地语言模型,可以超越更大规模的在线托管系统。
论文强调的关键意义包括:
确定性性能: 通过完全在设备上运行,Jarvis 消除了对网络的依赖,确保了无论连接条件如何都能表现出一致的行为。
边缘可行性: 在笔记本级 GPU(RTX 3060)上成功部署微调后的 7B 模型,证明了在资源受限的边缘硬件上实现高性能意图识别是可行的。
安全与控制: 系统通过确认循环和严格的命令验证来优先保障安全,使其适用于对误操作极其敏感的高速赛车场景。
论文总结道,尽管当前系统受限于预定义的命令空间和合成数据增强,但它为需要低延迟和网络独立性的自主系统中的交互式语音控制提供了一个稳健的开源基础。未来的工作计划包括多轮对话和双向遥测查询。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。