← नवीनतम पेपर
💻 computer science

AFTER: Mitigating the Object Hallucination of LVLM via Adaptive Factual-Guided Activation Editing

यह शोध पत्र AFTER का प्रस्ताव करता है, जो एक अनुकूली तथ्यात्मक-निर्देशित सक्रियण संपादन ढांचा (adaptive factual-guided activation editing framework) है, जिसमें तथ्यात्मक-संवर्धित सक्रियण स्टीयरिंग (Factual-Augmented Activation Steering) और क्वेरी-अनुकूली ऑफसेट अनुकूलन (Query-Adaptive Offset Optimization) शामिल हैं, ताकि पक्षपाती सक्रियणों को स्पष्ट रूप से तथ्यात्मक अर्थों की ओर निर्देशित करके लार्ज विजन-लैंग्वेज मॉडल्स में ऑब्जेक्ट हैलुसिनेशन (वस्तु मतिभ्रम) को प्रभावी ढंग से कम किया जा सके।

मूल लेखक: Tianbo Wang, Yuqing Ma, Kewei Liao, Zhange Zhang, Simin Li, Jinyang Guo, Xianglong Liu

प्रकाशित 2026-03-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianbo Wang, Yuqing Ma, Kewei Liao, Zhange Zhang, Simin Li, Jinyang Guo, Xianglong Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, विद्वान मित्र है जिसे तस्वीरें देखना और उनके बारे में आपको बताना बहुत पसंद है। यह मित्र एक AI (विशेष रूप से एक Large Vision-Language Model) है। वे टेक्स्ट पढ़ने में माहिर हैं, लेकिन जब बात तस्वीरों को देखने की आती है, तो वे कभी-कभी इस बात से "विचलित" हो जाते हैं कि उन्हें क्या देखना चाहिए, बजाय इसके कि वास्तव में वहां क्या है।

यह शोध पत्र इस समस्या को ठीक करने के लिए एक नई विधि पेश करता है जिसे AFTER कहा जाता है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

समस्या: "अति-आत्मविश्वासी मित्र"

आपके AI मित्र में एक बुरी आदत है जिसे Object Hallucination (वस्तु मतिभ्रम) कहते हैं।

  • परिदृश्य: आप उन्हें एक बेंच पर बैठे हुए एक व्यक्ति की फोटो दिखाते हैं जिसके पास एक बैकपैक है।
  • गलती: क्योंकि आपके मित्र ने "स्कीइंग" के बारे में लाखों कहानियाँ पढ़ी हैं, उनका दिमाग निष्कर्ष निकालने के लिए दौड़ पड़ता है। वे कहते हैं, "वह एक स्नोबोर्ड है!" (भले ही वह एक बैकपैक हो) या "उसने दो दस्ताने पहने हुए हैं!" (भले ही केवल एक हो)।
  • कारण: आपका मित्र Language Bias (भाषाई पूर्वाग्रह) से पीड़ित है। वे फोटो में मौजूद वास्तविक पिक्सेल के बजाय अपनी आंतरिक कहानियों के पुस्तकालय पर अधिक भरोसा करते हैं। वे उस व्यक्ति की तरह हैं जो आँखों को खोलने के बजाय किसी अफवाह के आधार पर कमरे में मौजूद चीजों का अनुमान लगाता है।

पुराने समाधान: मित्र की "आंखों पर पट्टी बांधना"

पिछले तरीकों ने चित्र को खराब (degrade) करके इसे ठीक करने की कोशिश की।

  • उपमा: कल्पना करें कि आप फोटो लेते हैं, उसे धुंधला (blur) कर देते हैं, या उसमें शोर (static noise) डाल देते हैं, और फिर मित्र को उसका वर्णन करने के लिए कहते हैं। विचार यह था, "यदि छवि खराब होगी, तो मित्र को तर्क पर अधिक और छवि पर कम निर्भर रहने के लिए मजबूर किया जाएगा।"
  • दोष: यह किसी को आँखों पर पट्टी बांधकर गाड़ी चलाना सिखाने जैसा है और फिर यह उम्मीद करने जैसा है कि वे बेहतर देखना सीख जाएंगे। यह भ्रमित करने वाला है और वास्तव में उन्हें यह नहीं सिखाता कि वास्तविकता क्या है। यह इस तथ्य को अनदेखा करता है कि यदि उनके पास सही तथ्य होते, तो वे सही हो सकते थे।

नया समाधान: AFTER (एक "तथ्य-जांचकर्ता" मार्गदर्शक)

लेखक AFTER (Adaptive Factual-Guided Visual-Textual Editing) का प्रस्ताव देते हैं। इसे अपने मित्र को एक अति-सटीक तथ्य-जांचकर्ता (fact-checker) और एक व्यक्तिगत कोच देने के रूप में समझें।

AFTER मुख्य रूप से दो चरणों में काम करता है:

चरण 1: "तथ्य-जांचकर्ता" (Factual-Augmented Activation Steering)

छवि को धुंधला करने के बजाय, AFTER छवि के बारे में सच्चे तथ्यों (जैसे, "वहाँ एक लाल बैकपैक है," "व्यक्ति ने हेलमेट पहना है") को लेता है और उन्हें एक स्पष्ट, सत्य वाक्य में बदल देता है।

  • उपमा: कल्पना करें कि आपका मित्र अनुमान लगाने ही वाला है। बोलने से पहले, एक तथ्य-जांचकर्ता उनके कान में सच्चाई फुसफुसाता है: "याद रखें, वस्तु एक बैकपैक है, स्नोबोर्ड नहीं।"
  • यह कैसे काम करता है: AI अपने "हैलुसिनेटेड" मस्तिष्क की स्थिति (जो वह कहना चाहता है) की तुलना "तथ्यात्मक" मस्तिष्क की स्थिति (जो सत्य है) से करता है। फिर यह एक करेक्शन वेक्टर (correction vector) की गणना करता है—एक मानसिक धक्का जो मित्र के मस्तिष्क को झूठ से दूर और सत्य की ओर धकेलता है।

चरण 2: "व्यक्तिगत कोच" (Query-Adaptive Offset Optimization)

पुराने तरीके हर प्रश्न के लिए एक ही सुधार का उपयोग करते थे। लेकिन कभी-कभी, मित्र को अलग सवाल पूछने पर अलग तरह के धक्के की आवश्यकता होती है।

  • उपमा: यदि आप पूछते हैं, "कार का रंग क्या है?", तो मित्र को रंग के बारे में धक्के की आवश्यकता है। यदि आप पूछते हैं, "कितने लोग हैं?", तो उन्हें गिनती के बारे में धक्के की आवश्यकता है।
  • यह कैसे काम करता है: AFTER के पास एक छोटा, स्मार्ट सहायक (एक एस्टिमेटर) है जो आपके विशिष्ट प्रश्न को देखता है। वह कहता है, "ठीक है, इस विशेष प्रश्न के लिए, मानक सुधार पर्याप्त नहीं है। आइए यहाँ थोड़ा अतिरिक्त धक्का दें।" यह सुधार को सटीक और क्षण के अनुकूल बनाता है।

यह एक बड़ी बात क्यों है?

  1. यह तेज़ है: अन्य तरीकों के विपरीत जिनमें पूरे मस्तिष्क को फिर से प्रशिक्षित (retraining) करने की आवश्यकता होती है (जिसमें हफ्तों और सुपरकंप्यूटर लगते हैं), AFTER वास्तविक समय में मस्तिष्क के आंतरिक संकेतों को बस थोड़ा सा बदल देता है। यह मित्र को एक साल की स्कूल की शिक्षा भेजने के बजाय कंधे पर एक त्वरित थपकी देने जैसा है।
  2. यह सटीक है: परीक्षणों में, इस पद्धति ने मतिभ्रम (hallucinations) को 16.3% तक कम कर दिया। यह एक बहुत बड़ा सुधार है।
  3. यह अच्छी चीज़ों को बनाए रखता है: कभी-कभी, जब आप एक गलती ठीक करते हैं, तो आप अनजाने में AI को अन्य चीजों में कम बुद्धिमान बना देते हैं। AFTER झूठ को ठीक करता है बिना मित्र को मददगार या रचनात्मक होना भुलाए।

सारांश

AFTER को एक ऐसे AI के लिए सत्यनिष्ठ GPS के रूप में सोचें जो अपनी ही कल्पना में खो जाता रहता है।

  • पुराना तरीका: "यहाँ एक धुंधला नक्शा है; अनुमान लगाने की कोशिश करें कि आप कहाँ हैं।" (भ्रमित करने वाला और अप्रभावी)।
  • AFTER का तरीका: "यहाँ एक स्पष्ट नक्शा है कि आप वास्तव में कहाँ हैं, और यहाँ एक व्यक्तिगत टर्न-बाय-टर्न गाइड है ताकि आप वापस सही रास्ते पर आ सकें।"

AI के आंतरिक विचारों को निर्देशित करने के लिए छवि के वास्तविक तथ्यों का उपयोग करके, AFTER AI को कहानियाँ बनाने से रोकता है और उसे वह बताने में मदद करता है जो वह वास्तव में देख रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →