← नवीनतम पेपर
🤖 AI

Separate First, Fuse Later: Mitigating Cross-Modal Interference in Audio-Visual LLMs Reasoning with Modality-Specific Chain-of-Thought

यह शोध पत्र "सेपरेट फर्स्ट, फ्यूज़ लेटर" (SFFL) का प्रस्ताव करता है, जो एक नवीन ऑडियो-विजुअल रीजनिंग फ्रेमवर्क है जो मोडैलिटी-विशिष्ट चेन-ऑफ-थॉट रीजनिंग के बाद एविडेंस फ्यूजन को लागू करके ऑडियो-विजुअल लार्ज लैंग्वेज मॉडल्स में क्रॉस-मोडल इंटरफेरेंस और हैलुसिनेशन को कम करता है, जिसके परिणामस्वरूप AVQA बेंचमार्क पर महत्वपूर्ण सटीकता और मजबूती में सुधार होता है।

मूल लेखक: Xuanchen Li, Yuheng Lu, Chenrui Cui, Tianrui Wang, Zikang Huang, Yu Jiang, Long Zhou, Longbiao Wang, Jianwu Dang

प्रकाशित 2026-05-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xuanchen Li, Yuheng Lu, Chenrui Cui, Tianrui Wang, Zikang Huang, Yu Jiang, Long Zhou, Longbiao Wang, Jianwu Dang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वीडियो देखते हुए और साथ ही ऑडियो सुनते हुए एक रहस्य को सुलझाने की कोशिश कर रहे हैं। आमतौर पर, आपका मस्तिष्क यह काम बिना किसी प्रयास के कर लेता है। लेकिन आर्टिफिशियल इंटेलिजेंस (AI) के लिए, यह एक जाल हो सकता है।

यह शोध पत्र AI को इन "ऑडियो-विजुअल" रहस्यों को बिना भ्रमित हुए सुलझाने के लिए सिखाने का एक नया तरीका पेश करता है। लेखक इस पद्धति को SFFL (सेपरेट फर्स्ट, फ्यूज लेटर - पहले अलग करें, फिर मिलाएँ) कहते हैं।

यहाँ समस्या और उनके समाधान का विवरण, सरल उपमाओं (analogies) का उपयोग करते हुए दिया गया है:

समस्या: "शोर वाले कमरे" का प्रभाव

वर्तमान AI मॉडल एक बहुत ही शोर वाले कमरे में बैठे जासूस की तरह हैं, जो एक साथ दो लोगों को बात करने की कोशिश कर रहे हैं।

  • विजुअल डिटेक्टिव (दृश्य जासूस): वीडियो में एक भेड़ देखता है।
  • ऑडियो डिटेक्टिव (श्रव्य जासूस): एक कुत्ते के भौंकने की आवाज़ सुनता है।
  • गलती: क्योंकि AI दोनों को एक ही समय में प्रोसेस करने की कोशिश करता है, इसलिए विजुअल सुराग (भेड़) ऑडियो सुराग (भौंकने) के रास्ते में आ जाता है। AI भ्रमित हो सकता है और कह सकता है, "मुझे एक भेड़ सुनाई दे रही है!" भले ही वीडियो में स्पष्ट रूप से एक कुत्ता भौंक रहा है और भेड़ शांत है। इसे क्रॉस-मोडल इंटरफेरेंस (cross-modal interference) या हलुसिनेशन (hallucination) कहा जाता है। AI केवल इसलिए एक आवाज़ की कल्पना कर रहा है क्योंकि उसने एक ऐसा जानवर देखा जो आमतौर पर वह आवाज़ करता है।

समाधान: "दो-चरणीय साक्षात्कार"

लेखकों ने महसूस किया कि AI को सब कुछ तुरंत मिलाने देने के बजाय, उसे एक स्मार्ट जासूस की तरह व्यवहार करना चाहिए जो कहानियों को मिलाने से पहले अलग-अलग गवाहों का अलग-अलग साक्षात्कार लेता है।

1. सेपरेट फर्स्ट (सोलो इंटरव्यू - अकेले साक्षात्कार)
वीडियो को देखते हुए और ऑडियो को सुनते हुए एक साथ करने के बजाय, AI को दो अलग-अलग "साक्षात्कार" करने के लिए मजबूर किया जाता है:

  • इंटरव्यू A: AI केवल वीडियो को देखता है और जो वह देखता है उसे लिखता है (जैसे, "मैं एक कुत्ता और एक भेड़ देख रहा हूँ")। उसे अभी ऑडियो सुनने की अनुमति नहीं है।
  • इंटरव्यू B: AI केवल ऑडियो सुनता है और जो वह सुनता है उसे लिखता है (जैसे, "मुझे भौंकने की आवाज़ सुनाई दे रही है")। उसे अभी वीडियो देखने की अनुमति नहीं है।

यह सुनिश्चित करने के लिए कि AI इन साक्षात्कारों के दौरान गलती से दूसरे गवाह की "झाँकना" न शुरू कर दे, लेखकों ने एक विशेष डिजिटल दीवार बनाई है जिसे मोडैलिटी एसिमेट्रिक अटेंशन मास्क (Modality Asymmetric Attention Mask) कहा जाता है। इसे विजुअल डिटेक्टिव को हेडफ़ोन पहनाकर ऑडियो न सुनने देने और ऑडियो डिटेक्टिव की आँखों पर पट्टी बाँधकर वीडियो न देखने के रूप में समझें।

2. फ्यूज लेटर (टीम हडल - टीम की बैठक)
केवल तभी जब दोनों जासूसों ने अपनी अलग-अलग रिपोर्ट लिख ली हो, AI उन्हें एक साथ लाता है।

  • यह "वीडियो रिपोर्ट" और "ऑडियो रिपोर्ट" को पढ़ता है।
  • यह तुलना करता है: "वीडियो कहता है कि वहाँ एक भेड़ है, लेकिन ऑडियो रिपोर्ट कहती है कि भेड़ की कोई आवाज़ नहीं है, केवल भौंकना है।"
  • निर्णय: यह निष्कर्ष निकालता है कि आवाज़ कुत्ते की होनी चाहिए, और भेड़ बस वहाँ चुपचाप खड़ी है।

द "प्रेफर्ड एविडेंस" कोच (पसंदीदा साक्ष्य कोच)

यह शोध पत्र एक चतुर प्रशिक्षण तकनीक का भी उल्लेख करता है। AI को यह पहचानने के लिए सिखाया जाता है कि किसी विशिष्ट प्रश्न के लिए कौन सा गवाह "स्टार" है।

  • यदि प्रश्न है "कौन सा जानवर शोर कर रहा है?", तो AI सीखता है कि ऑडियो गवाह सबसे महत्वपूर्ण है।
  • यदि प्रश्न है "कार का रंग क्या है?", तो विजुअल गवाह स्टार है।

AI को प्रत्येक विशिष्ट पहेली के लिए किस गवाह पर सबसे अधिक भरोसा करना है, इसे सही ढंग से पहचानने के लिए पुरस्कृत किया जाता है। यह उसे केवल इसलिए वीडियो पर आँख मूँदकर भरोसा करने से रोकता है क्योंकि वह आमतौर पर कमरे में सबसे तेज़ आवाज़ होता है।

परिणाम

जब शोधकर्ताओं ने इस "सेपरेट फर्स्ट, फ्यूज लेटर" पद्धति का परीक्षण किया:

  • कम गलतियाँ: AI ने शांत जानवरों के लिए आवाज़ें बनाना बंद कर दिया।
  • बेहतर सटीकता: इसने मानक परीक्षणों पर सही उत्तर अधिक बार दिए।
  • मजबूती (Robustness): AI को भ्रमित करने वाले वीडियो या ध्वनियों से छलना बहुत कठिन हो गया।

संक्षेप में: यह शोध पत्र AI को बहुत जल्दी मल्टीटास्किंग करने से रोकने की शिक्षा देता है। AI को पहले जो वह देखता है और जो वह सुनता है, उसके बारे में अलग-अलग सोचने के लिए मजबूर करके, और फिर अंत में उन विचारों को सावधानीपूर्वक संयोजित करके, यह मूर्खतापूर्ण गलतियाँ करना बंद कर देता है और एक बहुत बेहतर जासूस बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →