Talk to Me, Jarvis: An Open-Source Edge-Deployable Voice Assistant Framework for Autonomous Racecars
यह शोध पत्र जार्विस (Jarvis) को प्रस्तुत करता है, जो स्वायत्त रेसकारों के लिए एक ओपन-सोर्स, एज-डिप्लॉय करने योग्य वॉयस असिस्टेंट फ्रेमवर्क है, जो ऑनलाइन-होस्टेड समाधानों की नेटवर्क निर्भरता और इन्फरेंस विलंबता को समाप्त करने के लिए उच्च-सटीक इरादा पहचान (intent recognition) प्राप्त करने हेतु स्थानीय रूप से फाइन-ट्यून किए गए मिस्ट्रल 7B (Mistral 7B) मॉडल का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
स्वायत्त रेसिंग (autonomous racing) की उच्च-दांव वाली दुनिया में, जहाँ वाहन बिना किसी मानव चालक के अविश्वसनीय गति से ट्रैक पर चलते हैं, त्रुटि की गुंजाइश सेकंड के सौवें हिस्से में मापी जाती है। ये मशीनें अपने परिवेश को समझने, अपने पथ की योजना बनाने और अपनी गतिविधियों को नियंत्रित करने के लिए जटिल सॉफ्टवेयर पर निर्भर करती हैं, लेकिन अप्रत्याशित स्थितियों में महत्वपूर्ण आदेश जारी करने के लिए उन्हें अभी भी एक मानव ऑपरेटर की आवश्यकता होती है। पारंपरिक रूप से, एक रेस इंजीनियर कार को रुकने, गति बढ़ाने या पिट लेन में वापस जाने के लिए कहने हेतु कीबोर्ड या स्क्रीन का उपयोग कर सकता है। हालाँकि, लाइव डेटा से नज़र हटाकर कमांड टाइप करने में समय लगता है, और एक रेस में, वह देरी जीत और हार के बीच का अंतर बन सकती है। यह एक ऐसे वॉइस असिस्टेंट की आवश्यकता पैदा करता है जो ऑपरेटर को अपनी आँखें ट्रैक पर रखते हुए स्वाभाविक रूप से बोलने की अनुमति दे सके। चुनौती इस असिस्टेंट को एक चलती कार के लिए पर्याप्त तेज़ और विश्वसनीय बनाने में निहित है। जबकि आधुनिक आर्टिफिशियल इंटेलिजेंस मानव भाषण को समझ सकता है, इसके सबसे शक्तिशाली संस्करण अक्सर क्लाउड में दूर स्थित सर्वरों पर रहते हैं। वॉयस कमांड को क्लाउड पर भेजने और जवाब की प्रतीक्षा करने में देरी होती है और यह एक स्थिर इंटरनेट कनेक्शन पर निर्भर करता है, जो दोनों ही चीजें अस्वीकार्य हैं जब एक कार ट्रैक पर तेज़ी से दौड़ रही हो। इसका समाधान एक ऐसे असिस्टेंट की मांग करता है जो पूरी तरह से वाहन या पास के स्थानीय कंप्यूटर पर रहे, जो बाहरी दुनिया की आवश्यकता के बिना सुनने, समझने और तुरंत कार्य करने में सक्षम हो।
टेक्निकल यूनिवर्सिटी ऑफ म्यूनिख के शोधकर्ताओं ने इस विशिष्ट समस्या को हल करने के लिए 'जार्विस' (Jarvis) नामक एक प्रणाली विकसित की है। उन्होंने एक ऐसा वॉयस असिस्टेंट बनाया है जिसे ऑफलाइन चलाने के लिए डिज़ाइन किया गया है, जिसका अर्थ है कि इसे कार्य करने के लिए इंटरनेट कनेक्शन की आवश्यकता नहीं है। यह प्रणाली एक विशिष्ट ट्रिगर वाक्यांश, "हे जार्विस" (Hey Jarvis), को सुनने और फिर कमांड की प्रतीक्षा करने के माध्यम से काम करती है। एक बार जब ऑपरेटर बोलता है, तो असिस्टेंट ध्वनि को एक हल्के (lightweight) स्पीच रिकग्निशन टूल का उपयोग करके टेक्स्ट में बदल देता है जो स्थानीय रूप से चलता है। इस टेक्स्ट को फिर एक विशेष आर्टिफिशियल इंटेलिजेंस मॉडल को भेजा जाता है जो एक अनुवादक के रूप में कार्य करता है, जो मानव ऑपरेटर की प्राकृतिक भाषा को एक सटीक, पूर्व-निर्धारित निर्देश में बदल देता है जिसे कार निष्पादित कर सके। उदाहरण के लिए, यदि कोई इंजीनियर कहता है, "कार को रोक दो" (Bring the car to a halt), तो सिस्टम इसे "वाहन को रोकें" (Stop the vehicle) के समान कमांड के रूप में पहचानता है और इसे कार को रोकने के एकल, सुरक्षित कार्य से जोड़ देता है। पूरी प्रक्रिया, आवाज सुनने से लेकर कार को डिजिटल कमांड भेजने तक, स्थानीय हार्डवेयर पर होती है, जिससे यह सुनिश्चित होता है कि सिस्टम तेज़ बना रहे और नेटवर्क की स्थितियों से स्वतंत्र रहे।
इसे बनाने के लिए, टीम को आर्टिफिशियल इंटेलिजेंस के सही प्रकार को चुनना था। उन्होंने इंटरनेट पर उपलब्ध कुछ सबसे शक्तिशाली मॉडलों के साथ-साथ लैपटॉप पर चल सकने वाले छोटे, हल्के मॉडलों सहित कई अलग-अलग मॉडलों का परीक्षण किया। उन्होंने पाया कि जबकि शक्तिशाली ऑनलाइन मॉडल भाषा समझने में बहुत अच्छे थे, वे रेसिंग के लिए बहुत धीमे थे। कमांड को क्लाउड तक जाने और वापस आने में लगने वाला समय अक्सर कई सेकंड होता है, जो समय-संवेदनशील अनुप्रयोग के लिए बहुत लंबा है। इसके विपरीत, स्थानीय रूप से चलने वाले छोटे मॉडल बहुत तेज़ थे लेकिन शुरुआत में उन्हें रेसिंग के लिए आवश्यक विशिष्ट कमांड को समझने में संघर्ष करना पड़ा। शोधकर्ताओं ने इसे एक छोटे, स्थानीय मॉडल को लेकर और उसे रेसिंग कमांड के डेटासेट पर विशेष रूप से प्रशिक्षित करके हल किया। उन्होंने मॉडल को उन कई तरीकों को पहचानने के लिए सिखाया जिनसे एक इंसान कार को शुरू करने, रोकने या गति बदलने के लिए कह सकता है, यह सुनिश्चित करते हुए कि वह प्राकृतिक भाषण की विविधता को संभाल सके और साथ ही अविश्वसनीय रूप से तेज़ भी रहे।
उनके कार्य के परिणाम दर्शाते हैं कि यह दृष्टिकोण अत्यधिक प्रभावी है। स्थानीय मॉडल को प्रशिक्षित करने के बाद, सिस्टम ने इच्छित कमांड को सही ढंग से पहचानने में 97.63 प्रतिशत की सफलता दर हासिल की। अधिक महत्वपूर्ण बात यह है कि इसने विश्लेषण के लिए टेक्स्ट तैयार होने के क्षण से औसतन केवल 1.39 सेकंड की देरी के साथ इन कमांड्स को प्रोसेस किया। यह प्रदर्शन उनके द्वारा परीक्षण किए गए बड़े, क्लाउड-आधारित मॉडलों की तुलना में बेहतर था, जो इस विशिष्ट संदर्भ में धीमे और कम सटीक दोनों थे। सिस्टम में एक सुरक्षा जांच भी शामिल है जहाँ असिस्टेंट कार को कमांड भेजने से पहले ऑपरेटर के साथ पुष्टि करता है, यह सुनिश्चित करते हुए कि गलत सुनी गई बात अनचाहे कार्य का कारण न बने। पूरे सिस्टम को ओपन-सोर्स बनाकर, शोधकर्ताओं ने दूसरों को रोबोटिक्स और स्वायत्त वाहनों के लिए समान उपकरण बनाने के लिए एक ब्लूप्रिंट प्रदान किया है जहाँ गति और विश्वसनीयता सर्वोपरि है। यह कार्य प्रदर्शित करता है कि रेस कार को नियंत्रित करने जैसे विशेष कार्यों के लिए, एक सावधानीपूर्वक ट्यून किया गया स्थानीय मस्तिष्क एक विशाल, दूरस्थ मस्तिष्क से बेहतर प्रदर्शन कर सकता है, जो यह सिद्ध करता है कि कभी-कभी सबसे अच्छा इंटेलिजेंस वही होता है जो वहीं रहता है जहाँ उसकी आवश्यकता होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।