← 최신 논문
🤖 machine learning

Talk to Me, Jarvis: An Open-Source Edge-Deployable Voice Assistant Framework for Autonomous Racecars

이 논문은 온라인 호스팅 솔루션의 네트워크 의존성과 추론 지연을 제거하기 위해 로컬에서 미세 조정된 Mistral 7B 모델을 활용하여 높은 정확도의 의도 인식을 달성하는, 자율 주행 레이스카를 위한 오픈 소스 기반의 엣지 배포 가능 음성 비서 프레임워크인 Jarvis를 소개한다.

원저자: Daniel Henel, Frederik Werner, Alexander Langmann, Johannes Betz

게시일 2026-09-21
📖 3 분 읽기☕ 가벼운 읽기

원저자: Daniel Henel, Frederik Werner, Alexander Langmann, Johannes Betz

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

운전자가 직접 운전대를 잡지 않고도 엄청난 속도로 트랙을 주행하는 자율주행 레이싱의 고도의 긴박한 세계에서, 오차 범위는 0.1초의 찰나로 측정됩니다. 이 기계들은 주변 환경을 인지하고, 경로를 계획하며, 움직임을 제어하기 위해 복잡한 소프트웨어에 의존하지만, 예상치 못한 상황이 발생했을 때는 여전히 인간 운영자가 결정적인 명령을 내려주어야 합니다. 전통적으로 레이스 엔지니어는 키보드나 화면을 사용하여 자동차에게 멈추거나, 속도를 높이거나, 피트 레인으로 돌아오라고 지시할 수 있습니다. 하지만 실시간 데이터를 보던 눈을 돌려 명령어를 타이핑하는 것은 시간이 걸리며, 레이스에서는 그 지연이 승리와 패배를 가르는 차이가 될 수 있습니다. 이는 운영자가 트랙에서 눈을 떼지 않은 채 자연스럽게 말할 수 있게 해주는 음성 비서의 필요성을 만들어냅니다. 과제는 이 비서를 움직이는 자동차에 충분히 빠르고 신뢰할 수 있게 만드는 것입니다. 현대의 인공지능은 인간의 말을 이해할 수 있지만, 가장 강력한 버전들은 대개 멀리 떨어진 클라우드의 서버에 존재합니다. 음성 명령을 클라우드로 보내고 답변을 기다리는 과정은 지연을 유발하며 안정적인 인터넷 연결에 의존하게 되는데, 자동차가 트랙을 질주하고 있는 상황에서 이 두 가지 모두 용납될 수 없습니다. 해결책은 외부 세계의 도움 없이도 듣고, 이해하고, 즉각적으로 행동할 수 있는, 차량 내부나 근처의 로컬 컴퓨터에서 완전히 구동되는 비서를 필요로 합니다.

뮌헨 공과대학교의 연구진은 이 특정 문제를 해결하기 위해 '자비스(Jarvis)'라고 불리는 시스템을 개발했습니다. 그들은 인터넷 연결 없이도 작동할 수 있는 오프라인 전용 음성 비서를 구축했습니다. 이 시스템은 "헤이 자비스(Hey Jarvis)"라는 특정 트리거 문구를 듣고 명령을 기다리는 방식으로 작동합니다. 운영자가 말을 하면, 비서는 로컬에서 실행되는 경량 음성 인식 도구를 사용하여 소리를 텍텍스트로 변환합니다. 이 텍ech스트는 그 후 특화된 인공지능 모델로 전달되어, 인간 운영자의 자연어를 자동차가 실행할 수 있는 정밀하고 미리 정의된 명령어로 바꾸는 번역가 역할을 수행합니다. 예를 들어, 엔지니어가 "차를 멈춰줘(Bring the car to a halt)"라고 말하면, 시스템은 이를 "차량을 정지하라(Stop the vehicle)"와 동일한 명령으로 인식하여 자동차를 멈추는 단 하나의 안전한 동작으로 매핑합니다. 음성을 듣는 순간부터 자동차에 디지털 명령을 보내는 전체 과정은 로컬 하드웨어에서 발생하므로, 시스템이 네트워크 상태와 관계없이 빠르고 독립적으로 유지되도록 보장합니다.

이를 구축하기 위해 연구팀은 적절한 유형의 인공지능을 선택해야 했습니다. 그들은 인터넷에서 사용 가능한 가장 강력한 모델들을 포함하여, 노트북에서 실행할 수 있는 더 작고 가벼운 모델들을 포함한 많은 다양한 모델을 테스트했습니다. 그들은 강력한 온라인 모델들이 언어를 이해하는 데 매우 뛰어나지만, 레이싱에는 너무 느리다는 것을 발견했습니다. 명령이 클라우드로 이동했다가 돌아오는 데 걸리는 시간은 종종 몇 초에 달했는데, 이는 시간 제약이 엄격한 애플리케이션에서 너무 긴 시간입니다. 반면, 로컬에서 실행되는 더 작은 모델들은 훨씬 빨랐지만, 초기에는 레이싱에 필요한 특정 명령들을 이해하는 데 어려움을 겪었습니다. 연구진은 이러한 작은 로컬 모델 중 하나를 가져와 레이싱 명령 데이터셋을 통해 특별히 학습시킴으로써 이 문제를 해결했습니다. 그들은 모델에게 인간이 자동차를 출발시키거나, 멈추거나, 속도를 조절할 때 사용할 수 있는 다양한 방식의 표현들을 인식하도록 가르쳤으며, 이를 통해 다양한 자연어 표현을 처리하면서도 놀라운 속도를 유지할 수 있도록 했습니다.

그들의 연구 결과는 이러한 접근 방식이 매우 효과적임을 보여줍니다. 로컬 모델을 학습시킨 후, 시스템은 의도한 명령을 정확히 식별하는 데 있어 97.63%의 성공률을 달림했습니다. 더 중요한 점은, 이 시스템이 텍스트 분석 준비가 된 시점부터 평균 단 1.39초의 지연 시간만으로 명령을 처리했다는 것입니다. 이러한 성능은 그들이 테스트했던 더 크고 클라우드 기반인 모델들보다 우수했는데, 그 모델들은 이 특정 맥락에서 더 느리고 정확도도 낮았습니다. 또한 시스템에는 비서가 자동차에 명령을 보내기 전 운영자에게 명령을 확인하는 안전 점검 기능이 포함되어 있어, 잘못 들은 단어가 의도치 않은 동작으로 이어지는 것을 방지합니다. 연구진은 이 시스템을 오픈 소스로 공개함으로써, 속도와 신뢰성이 최우선인 로보틱스 및 자율주행 차량을 위한 유사한 도구를 구축할 수 있는 청사진을 제공했습니다. 이 작업은 특화된 작업을 수행할 때 정교하게 조정된 로컬 브레인이 거대하고 먼 곳에 있는 브레인보다 뛰어날 수 있음을 보여주며, 때로는 가장 좋은 지능이 바로 필요한 그 자리에 머무는 것임을 증명합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →