← नवीनतम पेपर
💻 computer science

Audio2Tool: Bridging Spoken Language Understanding and Function Calling

यह शोध पत्र Audio2Tool प्रस्तुत करता है, जो एक बड़े पैमाने का, बहु-डोमेन डेटासेट है जिसे भाषाई जटिलता के विभिन्न स्तरों और वास्तविक ध्वनिक वातावरणों में स्पीच लैंग्वेज मॉडल्स की टूल-कॉलिंग क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Ramit Pahwa, Apoorva Beedu, Parivesh Priye, Rutu Gandhi, Saloni Takawale, Aruna Baijal, Zengli Yang

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ramit Pahwa, Apoorva Beedu, Parivesh Priye, Rutu Gandhi, Saloni Takawale, Aruna Baijal, Zengli Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपकी कार या घर में एक स्मार्ट असिस्टेंट है। अभी, उनमें से अधिकांश एक ऐसे छात्र की तरह हैं जो बहुविकल्पीय प्रश्नों (multiple-choice questions) में तो बहुत अच्छे हैं, लेकिन एक शोर भरे कॉफी शॉप में लंबी, अनर्गल बातचीत के दौरान घबरा जाते हैं।

यह पेपर Audio2Tool पेश करता है, जो एक नया "फाइनल एग्जाम" है जिसे यह देखने के लिए बनाया गया है कि क्या अगली पीढ़ी के एआई (AI) असिस्टेंट वास्तव में मानव जीवन की अव्यवस्थित, शोर भरी और जटिल वास्तविकता को संभाल सकते हैं।

यहाँ उन्होंने जो किया है, उसका विवरण कुछ सरल उपमाओं (analogies) का उपयोग करते हुए दिया गया है:

1. समस्या: "टेलीफोन गेम" का दोष

वर्तमान में, अधिकांश वॉयस असिस्टेंट "टेलीफोन गेम" की तरह काम करते हैं।

  • चरण 1: एक सिस्टम आपकी आवाज़ सुनता है और उसे टेक्स्ट में बदल देता है (जैसे एक लेखक जो आपके द्वारा बोले गए शब्दों को लिख रहा हो)।
  • चरण 2: वह टेक्स्ट एक मस्तिष्क (AI) को सौंपा जाता है ताकि वह समझ सके कि क्या करना है।

समस्या क्या है? यदि "लेखक" ने एक शब्द भी गलत सुना, तो "मस्तिष्क" को गलत निर्देश मिल जाएंगे। इसके अलावा, लेखक यह भी नहीं पकड़ पाता कि आपने किस तरीके से कुछ कहा—जैसे कि क्या आप निराश थे, गंभीर थे, या मज़ाक कर रहे थे। शोधकर्ता "SpeechLMs" का परीक्षण करना चाहते हैं, जो ऐसे AI मॉडल हैं जो लेखक (scribe) को छोड़ देते हैं और सीधे कच्चे ऑडियो को सुनते हैं, बिल्कुल वैसे ही जैसे एक इंसान करता है।

2. परीक्षण: "कठिनाई के आठ स्तर"

केवल यह पूछने के बजाय कि, "लाइट चालू करो," शोधकर्ताओं ने 30,000 अलग-अलग चुनौतियाँ बनाईं जिन्हें एक वीडियो गेम की तरह आठ बढ़ते हुए कठिनाई स्तरों में व्यवस्थित किया गया है:

  • स्तर 1 (शिशु): सरल, एक शब्द वाले कमांड। "लाइट चालू।"
  • स्तर 4 (संकेत): आप कमांड नहीं बोलते; आप एक भावना का वर्णन करते हैं। "हीट बढ़ा दो" कहने के बजाय, आप कहते हैं, "ब्र्रर्र, यहाँ बहुत ठंड है!" AI को इन कड़ियों को जोड़ने के लिए पर्याप्त स्मार्ट होना होगा।
  • स्तर 5 (बड़बड़ाने वाला): यह "भूसे के ढेर में सुई" (Needable in a Haystack) जैसा है। कल्पना कीजिए कि कोई अपने दिन, अपने नाश्ते और मौसम के बारे में एक मिनट तक बात कर रहा है, और फिर अचानक बीच में बोल देता है, "वैसे, गैरेज का दरवाज़ा खोल दो।" क्या AI बातचीत के बीच छिपे हुए कमांड को ढूंढ पाएगा?
  • स्तर 6 ("रुको, नहीं!"): यह सुधार (corrections) का परीक्षण करता है। "7 बजे का अलार्म लगाओ... दरअसल, इसे 8 कर दो।" अधिकांश AI यहाँ भ्रमित हो जाते हैं, लेकिन इंसान नहीं।
  • स्तर 8 (पार्टी का मेहमान): यह "इन्टेंट ब्लेंडिंग" (Intent Blending) है। कल्पना कीजिए कि आप गाड़ी चला रहे हैं और अपने GPS से बात कर रहे हैं, लेकिन बैकग्राउंड में, आपका यात्री थर्मोस्टेट के बारे में किसी और से बात कर रहा है। AI को इतना स्मार्ट होना चाहिए कि वह यात्री की बातों को अनदेखा करे और केवल ड्राइवर की बात सुने।

3. वातावरण: "वास्तविक दुनिया" का फिल्टर

शोधकर्ताओं ने इन परीक्षणों को किसी शांत, आदर्श स्टूडियो में रिकॉर्ड नहीं किया। उन्होंने इसमें "ध्वनिक मसाला" (acoustic spice) जोड़ा: जैसे कार की छत पर गिरती बारिश की आवाज़, इंजन की गड़गड़ाहट, बर्तनों की खड़खड़ाहट और विभिन्न लहजे (accents)। यह एक शांत कमरे में भाषण का अभ्यास करने और व्यस्त सबवे स्टेशन के बीच में अभ्यास करने के बीच का अंतर है।

4. परिणाम: "स्मार्ट लेकिन तनावग्रस्त" AI

शोधकर्ताओं ने आज उपलब्ध सर्वश्रेष्ठ AI मॉडलों का परीक्षण किया, और परिणाम एक वास्तविकता की जाँच (reality check) थे:

  • वे बुनियादी बातों में माहिर हैं: यदि आप शांत कमरे में एक स्पष्ट, सरल कमांड देते हैं, तो वे एक स्टार स्टूडेंट की तरह होते हैं।
  • वे जटिलता के साथ संघर्ष करते हैं: जैसे ही आप "बड़बड़ाने वाले" या "बातचीत" वाले स्तरों पर पहुँचते हैं, उनका प्रदर्शन काफी गिर जाता है। वे मल्टी-स्टेप कार्यों और शोर भरे वातावरण से "तनावग्रस्त" हो जाते हैं।

निष्कर्ष

Audio2Tool डेटासेट एक हाई-टेक बाधा दौड़ (obstacle course) की तरह है। इस "परीक्षा" को प्रदान करके, शोधकर्ता AI डेवलपर्स को अपने मॉडलों को "टेक्स्ट-रीडर" होने के बजाय वास्तविक, चौकस मानव सहायकों की तरह प्रशिक्षित करने का एक तरीका दे रहे हैं, जो हमें तब भी समझ सकें जब हम बड़बड़ा रहे हों, खुद को सुधार रहे हों, या भारी ट्रैफिक में फंसे हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →