← नवीनतम पेपर
💬 NLP

Focus Matters: Phase-Aware Suppression for Hallucination in Vision-Language Models

यह शोध पत्र एक हल्का, प्रशिक्षण-मुक्त अनुमान-समय हस्तक्षेप (inference-time intervention) प्रस्तावित करता है जो एक तीन-चरणीय अटेंशन संरचना की पहचान करके और "फोकस" चरण के दौरान डिटर्मिनेंटल पॉइंट प्रोसेस का उपयोग करके कम-अटेंशन वाले टोकन को चुनिगत रूप से दबाकर लार्ज विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम करता है, जिससे पुनरावृत्ति अनुकूलन विधियों की तुलना में नगण्य विलंबता के साथ मतिभ्रम को कम किया जाता है।

मूल लेखक: Sohyeon Kim, Sang Yeon Yoon, Kyeongbo Kong

प्रकाशित 2026-04-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sohyeon Kim, Sang Yeon Yoon, Kyeongbo Kong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, विद्वान मित्र है जो तस्वीरें देखने में बहुत बुरा है। आप उसे एक फोटो दिखाते हैं जिसमें एक बिल्ली टॉयलेट बाउल में बैठी है, और वह आत्मविश्वास से कहता है, "आह, मैं एक बिल्ली, एक टॉयलेट और... एक छोटी लाल छतरी देख पा रहा हूँ!"

वहाँ कोई छतरी नहीं है। आपके मित्र ने इसे खुद से बनाया है। AI की दुनिया में, इसे हैलुसिनेशन (Hallucination) कहा जाता है। लार्ज विजन-लैंग्वेज मॉडल्स (LVLMs) बिल्कुल उस मित्र की तरह हैं: वे बात करने और भाषा समझने में अविश्वसनीय रूप से अच्छे हैं, लेकिन जब वे किसी छवि को देखते हैं, तो वे कभी-कभी उन चीजों को भी "भर देते हैं" जो वास्तव में वहाँ नहीं हैं, यह समझने के बजाय कि वे वास्तव में क्या देख रहे हैं, वे इस पर अधिक भरोसा करते हैं कि उन्हें क्या होना चाहिए

"फोकस मैटर्स" (Focus Matters) नामक शोध पत्र इस समस्या को बिना AI को कोई नया पाठ सिखाए, एक चतुर और कम लागत वाले तरीके से ठीक करने का प्रस्ताव देता है। यहाँ सरल उपमाओं का उपयोग करके इसका विवरण दिया गया है।

1. समस्या: "अति-सक्रिय कल्पना"

इन AI हैलुसिनेशन्स को रोकने के मौजूदा तरीके एक सख्त संपादक को काम पर रखने जैसे हैं जो AI द्वारा वाक्य लिखे जाने के दौरान ही हर एक वाक्य की जाँच करता है। यह संपादक (एक विधि जिसे AUE कहा जाता है) बहुत प्रभावी है, लेकिन यह धीमा है। इसके लिए AI को छवि को फिर से पढ़ने, यह अनुमान लगाने कि क्या गलत हो सकता है, और इसे बार-बार फिर से पढ़ने की आवश्यकता होती है। यह एक छात्र को गणित का सवाल हल करने के लिए कहने जैसा है, फिर उत्तर की जाँच करने के लिए कहना, फिर से उत्तर की जाँच करने के लिए हल करना, और होमवर्क जमा करने से पहले इसे दस बार दोहराना। यह काम करता है, लेकिन इसमें बहुत समय लगता है।

2. खोज: देखने का "तीन-अंकों वाला नाटक"

शोधकर्ताओं ने AI के मस्तिष्क के भीतर झाँकने का निर्णय लिया ताकि यह देखा जा सके कि वह एक छवि को कैसे देखता है। उन्होंने पाया कि AI केवल पूरी तस्वीर को एक साथ नहीं "देखता"। इसके बजाय, उसका ध्यान एक सुसंगत तीन-अंकों वाले नाटक से गुजरता है:

  • अंक 1: डिफ्यूजन (स्कैनिंग चरण): AI पूरी छवि को व्यापक रूप से देखता है, जैसे कोई पर्यटक शहर के क्षितिज (skyline) को स्कैन कर रहा हो। वह सब कुछ देख रहा है, लेकिन अभी तक कुछ भी बहुत स्पष्ट नहीं है।
  • अंक 2: फोकस (ज़ूम-इन चरण): यह महत्वपूर्ण क्षण है। AI अचानक कुछ विशिष्ट स्थानों पर ज़ूम करता है। वह अपना ध्यान पूरी तरह से "टोकन्स" (छवि डेटा के छोटे टुकड़े) के एक छोटे समूह पर केंद्रित करता है।
  • अंक 3: रिडिफ्यूजन (फैलाव का चरण): ज़ूम करने के बाद, ध्यान बिंदुओं को जोड़ने और अंतिम विवरण बनाने के लिए फिर से फैल जाता है।

बड़ी अंतर्दृष्टि: शोधकर्ताओं ने पाया कि अंक 2 (फोकस) वह जगह है जहाँ जादू (और गलतियाँ) होता है। यदि AI एक विशिष्ट स्थान पर ध्यान केंद्रित कर रहा है लेकिन वह स्थान वास्तव में "शोरयुक्त" (noisy) या भ्रमित करने वाला है, तो AI भ्रमित हो जाता है और चीजें बनाने लगता है।

3. समाधान: "नॉइज़-कैंसलिंग हेडफ़ोन"

टीम ने महसूस किया कि उस "फोकस" चरण के दौरान, AI कभी-कभी "डिस्ट्रैक्टर्स" (विचलित करने वाली चीजों)—छवि के उन छोटे हिस्सों—पर ध्यान देता है जो धुंधले या महत्वहीन हैं। ये डिस्ट्रैक्टर्स रेडियो पर आने वाले स्टैटिक शोर (static noise) की तरह काम करते हैं, जिससे AI गलत स्टेशन ट्यून करने लगता है और हैलुसिनेशन करने लगता है।

उनका समाधान एक हल्का फिल्टर (lightweight filter) है जो इस प्रकार काम करता है:

  1. एक बार सुनें: AI एक बार छवि को देखता है (ठीक एक सामान्य इंसान की तरह)।
  2. शोर की पहचान करें: यह जाँचता है कि छवि के कौन से हिस्से "फोकस" चरण के दौरान बहुत कम ध्यान प्राप्त कर रहे हैं। ये "डिस्ट्रैक्टर्स" हैं।
  3. शोर को म्यूट करें: यह विशेष रूप से उन कम-ध्यान वाले हिस्सों को केवल तभी धीरे से म्यूट (mute) कर देता है जब AI "फोकस" चरण में होता है।
  4. अच्छी चीजों को रखें: यह सुनिश्चित करने के लिए कि वे गलती से महत्वपूर्ण विवरणों को म्यूट न कर दें, वे एक विशेष गणितीय उपकरण (जिसे DPP कहा जाता है) का उपयोग करते हैं जो एक स्मार्ट क्यूरेटर की तरह कार्य करता है। यह सुनिश्चित करता है कि जबकि वे शोर को म्यूट कर रहे हैं, वे महत्वपूर्ण दृश्य संकेतों के एक विविध और समृद्ध सेट को बनाए रखते हैं।

4. यह गेम-चेंजर क्यों है

  • यह तेज़ है: पुराने "सख्त संपादक" वाले तरीके के विपरीत, जो छवि को दस बार फिर से पढ़ता है, यह तरीका बस एक बार सुनता है और शोर को "म्यूट" कर देता है। यह प्रक्रिया में लगभग शून्य अतिरिक्त समय जोड़ता है।
  • यह ट्रेनिंग-फ्री है: आपको AI को फिर से सिखाने या उसे हजारों नई तस्वीरें खिलाने की आवश्यकता नहीं है। आप बस काम करते समय उसके देखने के तरीके को थोड़ा बदल देते हैं।
  • यह हर जगह काम करता है: उन्होंने विभिन्न AI मॉडल्स (जैसे LLaVA, Qwen, और Intern-VL) पर इसका परीक्षण किया, और इसने कमाल किया, हैलुसिनेशन्स को काफी कम कर दिया और विवरणों को सटीक बनाए रखा।

उपमा का सारांश

कल्पना कीजिए कि AI एक जासूस है जो एक धुंधली फोटो के आधार पर अपराध को सुलझाने की कोशिश कर रहा है।

  • पुराना तरीका: जासूस फोटो को एक घंटे तक घूरता है, आँखें सिकोड़ता है, अनुमान लगाता है, और सच खोजने के लिए बार-बार देखता है। (सटीक, लेकिन धीमा)।
  • नया तरीका (फोकस मैटर्स): जासूस ने स्मार्ट चश्मा पहन लिया है। ये चश्मे स्वचालित रूप से पृष्ठभूमि के शोर (जैसे चमकती रोशनी या रैंडम छाया) को धुंधला कर देते हैं केवल तभी जब जासूस संदिग्ध पर ध्यान केंद्रित करने की कोशिश कर रहा होता है। जासूस संदिग्ध को स्पष्ट रूप से देखता है, शोर को अनदेखा करता है, और तुरंत मामला सुलझा लेता है।

संक्षेप में: यह शोध हमें सिखाता है कि AI को वह देखने के बारे में झूठ बोलने से रोकने के लिए कि वह क्या देख रहा है, हमें उसे और अधिक कठिन सोचने के लिए मजबूर करने की आवश्यकता नहीं है। हमें बस उसे सही चीजों पर बेहतर फोकस करने और उस दृश्य "स्टैटिक" को अनदेखा करने में मदद करने की आवश्यकता है जो उसकी कल्पना को धोखा देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →