← नवीनतम पेपर
💻 computer science

See Fair, Speak Truth: Equitable Attention Improves Grounding and Reduces Hallucination in Vision-Language Alignment

यह शोध पत्र DOP-OBC का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त डिकोडिंग रणनीति है जो एक डोमिनेंट ऑब्जेक्ट पेनल्टी और एक आउटलियर बूस्ट कोएफिशिएंट के माध्यम से समान अटेंशन आवंटन लागू करके मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स में ऑब्जेक्ट हेलुसिनेशन को कम करती है, जिससे मॉडल को पुन: प्रशिक्षित किए बिना ग्राउंडिंग और जनरेशन की गुणवत्ता में सुधार होता है।

मूल लेखक: Mohammad Anas Azeez, Ankan Deria, Zohaib Hasan Siddiqui, Adinath Madhavrao Dukre, Rafiq Ali, Sara Atito, Yutong Xie, Imran Razzak

प्रकाशित 2026-04-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohammad Anas Azeez, Ankan Deria, Zohaib Hasan Siddiqui, Adinath Madhavrao Dukre, Rafiq Ali, Sara Atito, Yutong Xie, Imran Razzak

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "See Fair, Speak Truth" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: कमरे में एक "ज़ोरदार आवाज़"

कल्पना कीजिए कि आप एक भीड़ भरे कमरे में हैं जहाँ लोगों का एक समूह एक अंधे मित्र को एक जटिल पेंटिंग का वर्णन करने की कोशिश कर रहा है।

इस कमरे में, एक विशाल, चमकीली लाल फायर ट्रक (एक प्रमुख वस्तु) है और एक नन्ही, शर्मीली नीली चिड़िया (एक दुर्लभ वस्तु) एक टहनी पर बैठी है।

वर्तमान में, AI मॉडल (पेंटिंग का वर्णन करने वाले लोग) की एक बुरी आदत है: वे उस विशाल फायर ट्रक के बारे में बताने के लिए इतने जुनूनी हो जाते हैं कि वे भूल जाते हैं कि नीली चिड़िया का अस्तित्व है। वे यहाँ तक कि एक "नीला कुत्ता" भी बना सकते हैं क्योंकि वे जानवरों के बारे में बात करने के इतने आदी हैं, भले ही चित्र में कोई कुत्ता न हो।

इसे ऑब्जेक्ट हैलुसिनेशन (Object Hallucination) कहा जाता है। AI उन चीजों के बारे में "भ्रम" (hallucinate) पाल लेता है जो वहाँ नहीं हैं या उन चीजों को अनदेखा कर देता है जो वहाँ मौजूद हैं, केवल इसलिए क्योंकि वह बड़ी, शोर करने वाली चीजों पर बहुत अधिक ध्यान देता है और छोटी, शांत चीजों को नज़रअंदाज़ कर देता है।

समाधान: ध्यान में "निष्पक्षता" (Fairness in Attention)

इस पेपर के लेखक एक नई विधि प्रस्तावित करते हैं जिसे DOP-OBC कहा जाता है। इसे एक फेयरनेस कोच (Fairness Coach) के रूप में सोचें जो बातचीत के दौरान हस्तक्षेप करता है ताकि यह सुनिश्चित किया जा सके कि हर किसी को बोलने का समान अवसर मिले।

यह विधि दो सरल चरणों में काम करती है, जैसे एक रेफरी खेल का प्रबंधन करता है:

1. "डोमिनेंट ऑब्जेक्ट पेनल्टी" (DOP) – आवाज़ कम करना

जब विशाल फायर ट्रक इतना ज़ोर से चिल्लाने लगता है कि वह बाकी सबको दबा देता है, तो फेयरनेस कोच धीरे से कहता है, "ठीक है, फायर ट्रक, हमने तुम्हें सुन लिया। चलो, तुम्हारी आवाज़ थोड़ी कम करते हैं।"

  • तकनीकी शब्दों में: AI आमतौर पर अपनी 90% दिमागी शक्ति सबसे बड़ी वस्तु पर लगा देता है। यह विधि उस ध्यान (attention) को कोमलता से दबा देती है, जिससे अन्य चीजों को देखने के लिए मानसिक स्थान खाली हो जाता है।

2. "आउटलायर बूस्ट कोएफिशिएंट" (OBC) – शांत लोगों को माइक्रोफ़ोन थमाना

अब जब फायर ट्रक उतना ज़ोर से नहीं चिल्ला रहा है, तो कोच चारों ओर देखता है और नन्ही नीली चिड़िया को देख लेता है। कोच कहता है, "हे, नीली चिड़िया! तुम छोटी हो, लेकिन तुम वहाँ हो और तुम महत्वपूर्ण हो। यह लो माइक्रोफ़ोन। ज़ोर से बोलो!"

  • तकनीकी शब्दों में: AI अक्सर छोटी या दुर्लभ वस्तुओं को अनदेखा कर देता है क्योंकि वे उसके ट्रेनिंग डेटा में कम दिखाई देती हैं। यह विधि उन दुर्लभ वस्तुओं के संकेत (signal) को बढ़ा देती है यदि AI को विश्वास हो कि वह उन्हें देख रहा है।

यह कैसे काम करता है ( "नो-रीवायरिंग" ट्रिक)

आमतौर पर, किसी रोबोट के दिमाग को ठीक करने के लिए, आपको उसे खोलना पड़ता है, उसकी वायरिंग बदलनी पड़ती है और उसे नए सबक सिखाने पड़ते हैं (जिसमें महीनों और विशाल कंप्यूटर लगते हैं)।

DOP-OBC अलग है। यह रोबोट के दिमाग को बिल्कुल नहीं छूता है। यह रोबोट के चश्मे पर एक स्मार्ट फ़िल्टर लगाने जैसा है, जो बोलने से ठीक पहले लगाया जाता है।

  • यह रोबोट के बोलने के दौरान (इन्फरेंस के दौरान) तुरंत होता है।
  • इसके लिए किसी नई ट्रेनिंग की आवश्यकता नहीं होती।
  • यह बिना कोड बदले किसी भी रोबट (इमेज या वीडियो) पर काम करता है।

पेपर से एक वास्तविक उदाहरण

पेपर एक तस्वीर दिखाता है जिसमें एक व्यक्ति कच्ची सड़क पर मोटरसाइकिल चला रहा है।

  • पुराना AI (LLaVA-1.5): मोटरसाइकिल और सवार को देखता है। यह पृष्ठभूमि में एक साइकिल के पास खड़ी लड़की को अनदेखा कर देता है। यह कहता है: "एक व्यक्ति मोटरसाइकिल चला रहा है।" (इसने लड़की को मिस कर दिया)।
  • नया AI (DOP-OBC के साथ): "फेयरनेस कोच" हस्तक्षेप करता है। यह AI को मोटरसाइकिल को इतनी गहराई से घूरना बंद करने और बैकग्राउंड को देखने के लिए कहता है। यह कहता है: "एक व्यक्ति मोटरसाइकिल चला रहा है, और उसके पीछे एक लड़की अपनी साइकिल के पास खड़ी है।"

परिणाम? विवरण अधिक पूर्ण, सटीक और चीज़ों को मनगढ़ंत बनाने की संभावना कम है।

यह क्यों मायने रखता है?

  1. यह झूठ को कम करता है: AI उन वस्तुओं को नहीं बनाता जो वहाँ नहीं हैं (जैसे हमारे पहले वाले उदाहरण में "नीला कुत्ता")।
  2. यह अधिक देखता है: यह उन छोटी बारीकियों को नोटिस करता है जो पहले AI के लिए अदृश्य थीं।
  3. इसे उपयोग करना आसान है: क्योंकि इसके लिए री-ट्रेनिंग की आवश्यकता नहीं है, इसलिए इन AI मॉडल्स का उपयोग करने वाली कोई भी कंपनी इसे तुरंत बेहतर परिणाम प्राप्त करने के लिए "प्लग इन" कर सकती है।

निष्कर्ष

यह पेपर तर्क देता है कि निष्पक्षता केवल एक अच्छी विचार नहीं है; यह एक तकनीकी आवश्यकता है। यदि एक AI चित्र में प्रत्येक वस्तु के साथ समान सम्मान के साथ व्यवहार करता है—यानी शोर करने वालों को धीमा करना और शांत रहने वालों को बढ़ावा देना—तो वह एक बहुत बेहतर और अधिक सच्चा कहानीकार बन जाता है।

संक्षेप में: DOP-OBC AI को कमरे में मौजूद हाथी को घूरना बंद करने और मेज पर बैठी चूहे पर भी वास्तव में ध्यान देने के लिए सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →