← नवीनतम पेपर
💻 computer science

ReasonAudio: A Benchmark for Evaluating Reasoning Beyond Matching in Text-Audio Retrieval

यह शोधपत्र ReasonAudio प्रस्तुत करता है, जो निषेध (negation) और अवधि (duration) जैसे जटिल तर्क कार्यों पर टेक्स्ट-ऑडियो रिट्रीवल मॉडलों का मूल्यांकन करने के लिए डिज़ाइन किया गया पहला बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल और मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स बुनियादी सिमेंटिक मिलान में अपनी दक्षता के बावजूद इन चुनौतियों के साथ काफी संघर्ष करते हैं।

मूल लेखक: Honglei Zhang, Yuting Chen, Chenpeng Hu, Siyue Zhang, Yilei Shi

प्रकाशित 2026-05-06
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Honglei Zhang, Yuting Chen, Chenpeng Hu, Siyue Zhang, Yilei Shi

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप ध्वनि प्रभावों (sound effects) के एक विशाल पुस्तकालय में एक विशिष्ट गीत खोजने की कोशिश कर रहे हैं, लेकिन केवल एक धुन गुनगुनाने के बजाय, आपको लाइब्रेरियन को बहुत विशिष्ट तार्किक निर्देश देने होंगे।

यह शोध पत्र ReasonAudio पेश करता है, जो एक नया "परीक्षण" है जिसे यह देखने के लिए डिज़ाइन किया गया है कि कंप्यूटर ध्वनियों को खोजने के लिए उन पेचीदा निर्देशों का कितनी अच्छी तरह पालन कर सकते हैं।

समस्या: कंप्यूटर "तर्क" (Logic) में खराब हैं

अभी, कंप्यूटर सामान्य वाइब्स (vibes) के आधार पर ध्वनियों को शब्दों से मिलाने में बहुत अच्छे हैं। यदि आप "एक कुत्ता भौंक रहा है" के लिए पूछते हैं, तो कंप्यूटर आमतौर पर कुत्ते वाली एक क्लिप ढूंढ सकता है।

लेकिन वास्तविक जीवन अधिक जटिल है। कल्पना कीजिए कि आप मांग रहे हैं:

  • "एक कुत्ता भौंक रहा है, लेकिन बिल्ली के म्याऊं करने वाला नहीं।" (निषेध/Negation)
  • "पहले एक दरवाजा बंद होता है, फिर एक कार हॉर्न बजाती है।" (क्रम/Order)
  • "एक सायरन और एक फायर अलार्म ठीक एक ही समय पर हो रहे हैं।" (ओवरलैप/Overlap)
  • "एक ड्रम बीट जो ठीक 5 सेकंड तक चलती है।" (अवधि/Duration)

शोधकर्ताओं ने पाया कि वर्तमान कंप्यूटर इन "तर्क पहेलियों" में बहुत खराब हैं। वे "लेकिन नहीं", "फिर", और "कितनी देर" जैसे शब्दों से भ्रमित हो जाते हैं। वे बस उन चीजों को पकड़ लेते हैं जो शब्दों जैसी सुनाई देती हैं, नियमों को अनदेखा कर देते हैं।

समाधान: कंप्यूटरों के लिए एक नया "परीक्षा"

इसे सिद्ध करने के लिए, टीम ने ReasonAudio बनाया, जो एक विशाल अभ्यास परीक्षा है।

  • पुस्तकालय: उन्होंने सरल ध्वनियों (जैसे एक घंटी, एक कार, या एक पक्षी) को विशिष्ट पैटर्न में मिलाकर 10,000 कस्टम साउंड क्लिप्स बनाईं।
  • प्रश्न: उन्होंने 1,000 प्रश्न लिखे जिनमें तर्क (logic) का उपयोग करने की आवश्यकता होती है, न कि केवल याददाश्त का।
  • नियम: उत्तर 100% सही हैं क्योंकि उन्हें एक कंप्यूटर प्रोग्राम द्वारा जेनरेट किया गया है, इसलिए ग्रेडिंग में मानवीय त्रुटि की कोई गुंजाइश नहीं है।

परिणाम: सब फेल हो गए

शोधकर्ताओं ने इस परीक्षा के माध्यम से 10 सबसे स्मार्ट, सबसे उन्नत ऑडियो-सर्च कंप्यूटरों को टेस्ट किया। परिणाम चौंकाने वाले थे:

  1. "दो-चरणीय" छात्र (The "Two-Step" Students): कुछ कंप्यूटर पहले ध्वनि को "सुनने", उसका विवरण लिखने और फिर उस विवरण के लिए खोजने का प्रयास करते हैं। यह सबसे खराब दृष्टिकोण था। यह किसी किताब को खोजने के लिए पहले अपने दोस्त से उसके कथानक (plot) का वर्णन पूछने और फिर उस वर्णन को खोजने जैसा है। दोस्त का वर्णन अक्सर बहुत विस्तृत होता था या मुख्य बात छोड़ देता था, जिससे कंप्यूटर भटक जाता था।
  2. "प्रत्यक्ष" छात्र (The "Direct" Students): अन्य कंप्यूटर ध्वनि और टेक्स्ट को सीधे समझने का प्रयास करते हैं। वे थोड़ा बेहतर प्रदर्शन करते हैं लेकिन फिर भी बहुत कम स्कोर (लगभग 8% सटीकता) करते हैं।
  3. "सुपर-छात्र" (MLLMs): सबसे उन्नत मॉडल (विशाल AI दिमागों पर आधारित) सबसे अच्छा प्रदर्शन करते हैं, लेकिन वे अभी भी केवल 20% उत्तर सही कर पाते हैं। यह अनुमान लगाने से मुश्किल से बेहतर है।

बड़ी हैरानी: भले ही ये "सुपर-स्टूडेंट्स" टेक्स्ट पढ़ने या चित्रों को देखने के मामले में तर्क में महान होने के लिए प्रसिद्ध हैं, लेकिन वे सुनने के दौरान अपना तर्क (logic) इस्तेमाल करना भूल गए। जब उन्हें ध्वनियों को खोजने के लिए फाइन-ट्यून किया गया, तो ऐसा लगा कि वे "नहीं", "पहले", या "कितनी देर" को समझने की अपनी क्षमता खो चुके हैं।

वे क्यों विफल हुए?

शोधकर्ताओं ने इन कंप्यूटरों के "मस्तिष्क" के अंदर झांका और दो मुख्य समस्याएं पाईं:

  1. वे नियमों को अनदेखा करते हैं: जब एक कंप्यूटर "कुत्ता" शब्द देखता है, तो वह कुत्ते वाली हर क्लिप को पकड़ लेता है, भले ही निर्देश में कहा गया हो "कोई कुत्ता नहीं"। यह एक ऐसे लाइब्रेरियन की तरह है जो "कुत्ता" शब्द सुनता है और आपके अनुरोध के उस हिस्से को अनदेखा कर देता है जिसमें कहा गया था "कोई बिल्ली नहीं"।
  2. वे अव्यवस्थित हैं: जब कंप्यूटर एक टेक्स्ट प्रश्न को ध्वनि के साथ मिलाने की कोशिश करता है, तो वह उन्हें ठीक से व्यवस्थित नहीं करता है। कंप्यूटर की सोच में, "गलत" उत्तर कभी-कभी प्रश्न के अधिक करीब दिखाई देता है।

निचोड़ (The Bottom Line)

यह पेपर यह नहीं कहता कि हम अभी ऑडियो सर्च नहीं कर सकते। यह केवल यह कहता है कि यदि आप चाहते हैं कि एक कंप्यूटर जटिल, तार्किक नियमों (जैसे "बारिश की आवाज, लेकिन केवल तभी जब बिजली न कड़क रही हो, और यह छोटी होनी चाहिए") के आधार पर एक ध्वनि खोजे, तो वर्तमान तकनीक अभी तैयार नहीं है। कंप्यूटर वर्तमान में शब्दों को ध्वनियों के साथ "मैच" कर रहे हैं, लेकिन वे वास्तव में उनके बारे में "तर्क" (reasoning) नहीं कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →