← नवीनतम पेपर
💻 computer science

AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers

यह शोध पत्र AVRT को पेश करता है, जो एक नवीन फ्रेमवर्क है जो छोटे मल्टीमॉडल मॉडल्स को प्रशिक्षित करने के लिए उच्च-गुणवत्ता वाले ऑडियो-विजुअल रीजनिंग ट्रेसेस (reasoning traces) उत्पन्न करने हेतु सिंगल-मोडैलिटी टीचर मॉडल्स का लाभ उठाता है, जो तत्पश्चात मल्टीमॉडल और सिंगल-मोडैलिटी रीजनिंग बेंचमार्क्स दोनों पर अत्याधुनिक प्रदर्शन प्राप्त करते हैं।

मूल लेखक: Edson Araujo, Saurabhchand Bhati, M. Jehanzeb Mirza, Brian Kingsbury, Samuel Thomas, Rogerio Feris, James R. Glass, Hilde Kuehne

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Edson Araujo, Saurabhchand Bhati, M. Jehanzeb Mirza, Brian Kingsbury, Samuel Thomas, Rogerio Feris, James R. Glass, Hilde Kuehne

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक फिल्म के दृश्य को समझने के लिए सिखाने की कोशिश कर रहे हैं जिसमें ध्वनि (sound) और दृश्य (sight) दोनों हैं। रोबोट को न केवल यह समझना है कि वह क्या देख रहा है, बल्कि यह भी कि वह जो सुन रहा है, उसके आधार पर चीजें क्यों हो रही हैं।

समस्या क्या है? आज के अधिकांश स्मार्ट रोबोट टेक्स्ट पढ़ने या चित्रों को देखने में माहिर हैं, लेकिन वे ऑडियो और वीडियो को मिलाकर गहराई से "सोचने" में संघर्ष करते हैं। और ऐसे "पाठ्यपुस्तकों" (डेटासेट्स) की भारी कमी है जो रोबोट को इस तरह की सोच चरण-दर-चरण सिखा सकें।

यहाँ AVRT (ऑडियो-विजुअल रीजनिंग ट्रांसफर) आता है। AVRT को एक चतुर कुकिंग रेसिपी के रूप में समझें जो आपको एक शानदार भोजन (एक स्मार्ट रोबोट) बनाने का तरीका बताती है, भले ही आपके पास दो अलग-अलग विशेषज्ञ शेफ के अवयवों (ingredients) का उपयोग करके बनाया गया हो, भले ही आपके पास कोई ऐसा "मास्टर शेफ" न हो जो दोनों को एक साथ बनाना जानता हो।

यहाँ इस पेपर की विधि कैसे काम करती है, इसे सरल चरणों में समझाया गया है:

1. समस्या: "मूक फिल्म" बनाम "रेडियो प्ले"

कल्पना कीजिए कि आपके पास एक रोबोट है जो एक दृष्टि विशेषज्ञ (Vision Expert) है (वह सब कुछ देखता है लेकिन बहरा है) और दूसरा रोबोट है जो एक ध्वनि विशेषज्ञ (Audio Expert) है (वह सब कुछ सुनता है लेकिन अंधा है)।

  • यदि आप दृष्टि विशेषज्ञ से पूछते हैं, "महिला क्यों रो रही है?" तो वह कह सकता है, "क्योंकि उसने टिश्यू पकड़ा हुआ है।"
  • यदि आप ध्वनि विशेषज्ञ से पूछते हैं, "महिला क्यों रो रही है?" तो वह कह सकता है, "क्योंकि वह ज़ोर-ज़ोर से सिसक रही है।"
  • लेकिन दोनों मिलकर यह नहीं कह पाते कि, "वह इसलिए रो रही है क्योंकि उसने एक दुखद फोटो देखते हुए एक दुखद गाना सुना।"

आमतौर पर, रोबोट को यह सिखाने के लिए, आपको भारी मात्रा में ऐसे डेटा की आवश्यकता होती है जहाँ मनुष्यों ने पहले से ही ऑडियो और वीडियो दोनों के लिए सोचने की प्रक्रिया लिख दी हो। लेकिन ऐसा डेटा बड़ी मात्रा में मौजूद नहीं है।

2. समाधान: "अनुवादक" रसोई (The "Translator" Kitchen)

AVRT टीम ने एक बहुत ही चतुर तरीका निकाला। दो विशेषज्ञों (विज़न और ऑडियो) और एक अनुवादक (केवल टेक्स्ट वाला AI) का उपयोग करने के बजाय, उन्होंने एक नया रास्ता खोजा।

  • चरण 1: विशेषज्ञ अकेले काम करते हैं।
    वे दृष्टि विशेषज्ञ से जो वह देख रहा है उस पर एक विस्तृत रिपोर्ट लिखने को कहते हैं। फिर, वे ध्वनि विशेषज्ञ से जो वह सुन रहा है उस पर एक विस्तृत रिपोर्ट लिखने को कहते हैं। दोनों अपनी "भाषाओं" (फॉर्मेट) में लिख रहे हैं जिनमें वे सहज हैं।
  • चरण 2: अनुवादक रिपोर्टों को मिलाता है।
    एक तीसरा AI (जो "मर्जर" या मिलाने वाला है) एक अनुवादक या प्रोजेक्ट मैनेजर की तरह कार्य करता है। यह विज़न रिपोर्ट और ऑडियो रिपोर्ट लेता है, उन्हें पढ़ता है, और उन्हें एक एकल, सुसंगत कहानी में जोड़ देता है। यह कहता है, "ठीक है, विज़न विशेषज्ञ एक आतिशबाजी देख रहा है, और ऑडियो विशेषज्ञ एक धमाका सुन रहा है। चलिए इसे जोड़ते हैं: महिला उछल पड़ी क्योंकि उसने एक आतिशबाजी की आवाज़ सुनी।"
  • चरण 3: फ़िल्टर।
    वे केवल उन कहानियों को रखते हैं जहाँ दोनों विशेषज्ञों ने सही उत्तर दिया हो। यह सुनिश्चित करता है कि वे जो "पाठ्यपुस्तक" बना रहे हैं वह उच्च गुणवत्ता वाली है और गलतियों से मुक्त है।

3. छात्र को प्रशिक्षित करना: "शिक्षु" (The "Apprentice")

अब उनके पास "ऑडियो-विजुअल थिंकिंग" की एक नई, उच्च-गुणवत्ता वाली पाठ्यपुस्तक है। वे इसका उपयोग एक छात्र रोबोट (वह मॉडल जिसे वे सुधारना चाहते हैं) को प्रशिक्षित करने के लिए करते हैं।

  • कोल्ड स्टार्ट (सुपरवाइज्ड फाइन-ट्यूनिंग): पहले, वे छात्र रोबोट को वह पाठ्यपुस्तक दिखाते हैं। रोबोट सोचने की प्रक्रिया की नकल करना सीखता है: "पहले मैं वीडियो देखता हूँ, फिर मैं ध्वनि सुनता हूँ, फिर मैं उत्तर खोजने के लिए उन्हें जोड़ता हूँ।"
  • रीइन्फोर्समेंट लर्निंग (Reinforcement Learning): इसके बाद, वे छात्र रोबोट को अपने आप अभ्यास करने देते हैं। यदि वह सही उत्तर देता है और उसे अच्छी तरह समझाता है, तो उसे एक "गोल्ड स्टार" (पुरस्कार) मिलता है। यदि वह गलत होता है, तो वह फिर से प्रयास करता है। यह एक वीडियो गेम की तरह है जहाँ रोबोट खेलकर अपने स्तर को बढ़ाता है।

4. जादुई परिणाम: क्रॉस-ट्रेनिंग

इस पेपर का सबसे आश्चर्यजनक हिस्सा वह है जो प्रशिक्षण के बाद होता है।

  • छात्र रोबोट को ऑडियो + वीडियो डेटा पर प्रशिक्षित किया गया था।
  • लेकिन जब उन्होंने इसे केवल वीडियो वाले कार्यों या केवल ऑडियो वाले कार्यों पर टेस्ट किया, तो यह पहले की तुलना में बेहतर प्रदर्शन कर रहा था!

उपमा (Analogy): यह एक बास्केटबॉल खिलाड़ी की तरह है जो एक जटिल खेल खेलकर प्रशिक्षण लेता है जिसमें पास देना (विज़न) और ड्रिबल करना (ऑडियो) दोनों की आवश्यकता होती है। भले ही बाद में आपसे केवल ड्रिबल करने के लिए कहा जाए, वे इसमें बेहतर होते हैं क्योंकि उनके मस्तिष्क ने दोनों कौशल को एक साथ समन्वयित करना सीख लिया है। "क्रॉस-ट्रेनिंग" ने उन्हें एक बेहतर ऑल-राउंड एथलीट बना दिया।

यह क्यों महत्वपूर्ण है

  • परफेक्ट डेटा का इंतज़ार करने की ज़रूरत नहीं: आपको यह लिखने के लिए किसी मनुष्य की आवश्यकता नहीं है कि लाखों ऑडियो-वीडियो सोचने के चरण क्या हैं। आप बस मौजूदा स्मार्ट मॉडल्स का उपयोग ऑडियो और वीडियो के लिए अलग-अलग कर सकते हैं और "अनुवादक" को भारी काम करने दे सकते हैं।
  • बेहतर तर्क (Reasoning): परिणामी रोबोट केवल अनुमान नहीं लगाता; वह वास्तव में समस्या को हल करने के लिए "सोचता" है, जो देखता है उसे सुनता है के साथ जोड़ता है।
  • स्टेट-ऑफ-द-आर्ट: उनके छोटे रोबोट (3 बिलियन और 7 बिलियन पैरामीटर्स वाले) कठिन परीक्षणों पर बहुत बड़े और महंगे मॉडलों को भी पीछे छोड़ देते हैं।

संक्षेप में: AVRT एक "सुपर-रोबोट" बनाने का एक स्मार्ट तरीका है जो दो विशेषज्ञों को अलग-अलग नोट्स लिखने, एक अनुवादक को एक पूर्ण पाठ योजना में उन्हें मिलाने, और फिर एक छात्र रोबोट को उस योजना का पालन करने के लिए सिखाकर फिल्मों और वीडियो को समझ सकता है। यह दो "एक-हुनर वाले" (one-trick ponies) को एक "सोचने वाले जीनियस" में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →