← नवीनतम पेपर
⚡ electrical engineering

JASTIN: Aligning LLMs for Zero-Shot Audio and Speech Evaluation via Natural Language Instructions

JASTIN एक नवीन, निर्देश-संचालित ढांचा है जो विविध ऑडियो और स्पीच सामग्री के अत्याधुनिक ज़ीरो-शॉट मूल्यांकन को प्राप्त करने के लिए बड़े भाषा मॉडलों को फ्रोजन ऑडियो एनकोडर के साथ संरेखित करता है, जो मूल्यांकन को एक स्व-निर्देशित तर्क कार्य के रूप में तैयार करता है।

मूल लेखक: Leying Zhang, Bowen Shi, Haibin Wu, Bach Viet Do, Yanmin Qian

प्रकाशित 2026-05-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Leying Zhang, Bowen Shi, Haibin Wu, Bach Viet Do, Yanmin Qian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक संगीत निर्माता या वॉयस-ओवर कलाकार हैं। आपने अभी-अभी एक नया ऑडियो क्लिप बनाया है, और आपको जानना है: "क्या यह अच्छा है?"

अतीत में, आपके पास दो विकल्प थे:

  1. "मानवीय पैनल" (The Human Panel): लोगों के एक समूह को सुनने के लिए भुगतान करना और उनसे एक स्कोर लेना। यह स्वर्ण मानक (gold standard) है, लेकिन यह महंगा, धीमा और स्केल करने में कठिन है।
  2. "रोबोट रूलर" (The Robot Ruler): एक कंप्यूटर प्रोग्राम का उपयोग करना जिसमें निश्चित नियम (जैसे कि एक रूलर या पैमाना) होते हैं जो ध्वनि को मापते हैं। समस्या यह है कि ये रूलर कठोर होते हैं। एक रूलर जिसे पेंसिल की रेखा की सीधी रेखा मापने के लिए बनाया गया है, वह टूट सकता है यदि आप उसका उपयोग मुस्कान के घुमाव को मापने के लिए करने की कोशिश करते हैं। इसी तरह, पुराने ऑडियो उपकरण अक्सर विफल हो जाते हैं जब आप स्पीच से म्यूजिक पर स्विच करते हैं, या जब "अच्छा" क्या है, इसके "नियम" बदल जाते हैं।

यहाँ आता है JASTIN

JASTIN क्या है?

JASTIN को एक सुपर-स्मार्ट, अनुकूलन योग्य ऑडियो आलोचक के रूप में सोचें जिसे एक इंसान की तरह सुनने के लिए प्रशिक्षित किया गया है लेकिन एक मशीन की तरह काम करने के लिए बनाया गया है।

एक एकल, कठोर रूलर का उपयोग करने के बजाय, JASTIN एक "बातचीत" का उपयोग करता है। आप इसे बताते हैं कि आप क्या जानना चाहते हैं (जैसे, "1 से 10 के पैमाने पर रेट करें कि यह आवाज़ कितनी स्वाभाविक है," या "बताएं कि क्या यह संगीत बहुत शोर भरा लग रहा है"), और यह निर्देशों के आधार पर ठीक वैसे ही ऑडियो को सुनता है और आपको स्कोर देता है।

यह कैसे काम करता है? ("अनुवादक" रूपक)

यह पेपर एक तीन-भाग वाली प्रणाली का वर्णन करता है जो विशेषज्ञों की एक टीम की तरह काम करती है:

  1. कान (The Frozen Encoder): कल्पना कीजिए कि अत्यंत संवेदनशील कान हैं जिन्होंने पहले ही लाखों ध्वनियाँ सुनी हैं। वे "फ्रोजन" (जमे हुए) हैं, जिसका अर्थ है कि वे कुछ भी नया नहीं सीखते; वे बस वही करते हैं जिसके लिए वे पैदा हुए हैं: ध्वनि को सूक्ष्म, विस्तृत टुकड़ों में तोड़ना।
  2. अनुवादक (The Adapter): "कान" कच्ची ध्वनि तरंगों (sound waves) की भाषा बोलते हैं, लेकिन "मस्तिष्क" केवल मानवीय भाषा बोलता है। एडॉप्टर एक अनुवादक है जो उन ध्वनि तरंगों को उन शब्दों में परिवर्तित करता है जिन्हें मस्तिष्क समझ सके, बिना किसी बारीकी को खोए।
  3. मस्तिष्क (The LLM): यह एक लार्ज लैंग्वेज मॉडल (जैसे कि एक बहुत उन्नत चैटबॉट) है। यह निर्देशों, तर्क और संदर्भ को समझने में माहिर है। यह अनुवादित ध्वनि और आपके द्वारा दिए गए विशिष्ट निर्देशों को लेता है, और फिर अपने "कॉमन सेंस" का उपयोग करके स्कोर तय करने का निर्णय लेता है।

इनका गुप्त नुस्खा (Secret Sauce): इन्होंने इसे कैसे प्रशिक्षित किया?

AI आलोचकों के साथ सबसे बड़ी चुनौती यह है कि वे अक्सर भ्रमित हो जाते हैं यदि आप अपने प्रश्न का शब्द बदल देते हैं। यदि आप पूछते हैं, "कितना शोर है?" तो यह "क्या यह शांत है?" की तुलना में अलग उत्तर दे सकता है, भले ही आपका मतलब एक ही हो।

इसे ठीक करने के लिए, शोधकर्ताओं ने एक ट्रेनिंग पाइपलाइन बनाई है जो AI के लिए एक "ड्रिल सार्जेंट" की तरह है:

  • बहु-स्रोत (Multi-Source): उन्होंने AI को हर जगह से ऑडियो खिलाया: मानव भाषण, संगीत और यादृच्छिक (random) ध्वनियाँ।
  • बहु-कार्य (Multi-Task): उन्होंने इसे केवल "गुणवत्ता" रेट करने के लिए नहीं कहा। उन्होंने इसे "भावना", "विकृति (distortion)", "स्वाभाविकता" को रेट करने के लिए कहा, और इसे सोचने का तरीका सिखाने के लिए नकली कार्य भी बनाए।
  • "पैराफ्रेसिंग" (Paraphrasing) का तरीका: यह सबसे रचनात्मक हिस्सा है। उन्होंने एक ही प्रश्न लिया और दूसरे AI से उसे 20 अलग-अलग तरीकों से (छोटा, लंबा, औपचारिक, अनौपचारिक, उलटा तर्क) फिर से लिखवाया। उन्होंने JASTIN को सिखाया कि "शोर को रेट करें" और "सिग्नल कितना स्पष्ट है, यह बताएं" एक ही अनुरोध हैं। यह JASTIN को रोबस्ट (मजबूत) बनाता है—यह इस बात से नहीं लड़खड़ाता कि आपने अपने प्रश्न को कैसे प्रस्तुत किया है।

उन्हें क्या मिला?

पेपर का दावा है कि JSTAIN तीन कारणों से एक गेम-चेंजर है:

  1. यह एक "जीरो-शॉट चैंपियन" है: आमतौर पर, यदि आप चाहते हैं कि कोई AI संगीत का न्याय करे, तो आपको इसे विशेष रूप से संगीत पर प्रशिक्षित करना होगा। यदि आप चाहते हैं कि यह स्पीच का न्याय करे, तो आप इसे स्पीच पर प्रशिक्षित करते हैं। JASTIN अलग है। आप इसे किसी ऐसे गाने, आवाज या साउंड इफेक्ट को जज करने के लिए कह सकते हैं जिसे इसने पहले कभी नहीं देखा है, और यह बिना किसी अतिरिक्त प्रशिक्षण के अभी भी बहुत अच्छा काम करेगा।
  2. यह मानवीय पसंद से मेल खाता है: जब शोधकर्ताओं ने JASTIN के स्कोर की तुलना वास्तविक मानव श्रोताओं से की, तो JASTIN पुराने "रोबोट रूलर्स" या अन्य फैंसी AI मॉडल की तुलना में मानवीय राय के बहुत करीब था।
  3. यह लचीला है: आप JSTIN को बता सकते हैं कि वह 1-5 का पैमाना, 1-100 का पैमाना, या यहाँ तक कि "पास/फेल" प्रणाली का उपयोग करे, और यह तुरंत अपनी स्कोरिंग लॉजिक को समायोजित कर लेगा।

यह कहाँ संघर्ष करता है? (सीमाएँ)

सबसे अच्छे आलोचकों की भी कुछ कमियाँ होती हैं। पेपर स्वीकार करता है कि JSTIN हर चीज़ में परफेक्ट नहीं है:

  • स्पीड रेटर (Speed Rater): यह इस बात को आंकने में बहुत अच्छा नहीं है कि कोई कितनी तेज़ी से या धीरे बोल रहा है। यह कभी-कभी लय (rhythm) को मिस कर देता है।
  • फुसफुसाहट (ASMR): ASMR (फुसफुसाने वाली ध्वनियों) को जज करते समय, AI भ्रमित हो जाता है। यह अक्सर फुसफुसाहट की "सांस भरी" प्रकृति को एक तकनीकी खराबी या शोर समझ लेता है, क्योंकि यह स्पष्ट, तेज़ आवाजों को आंकने के लिए बना है।

निष्कर्ष (The Bottom Line)

JASTIN ऑडियो मूल्यांकन का एक नया तरीका है। ऑडियो को एक एकल माप के साथ एक बॉक्स में डालने के बजाय, यह ऑडियो मूल्यांकन को एक बातचीत के रूप में मानता है। AI को निर्देशों को समझने और विभिन्न संदर्भों के अनुकूल होने के लिए सिखाकर, शोधकर्ताओं ने एक ऐसा उपकरण बनाया है जो अधिक लचीला, अधिक सटीक और पहले के किसी भी उपकरण की तुलना में अधिक मानवीय श्रोता जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →