← नवीनतम पेपर
💻 computer science

YARD: Y-Architecture Register Decoding for Efficient Hallucination Mitigation in Large Vision-Language Models

YARD एक प्रशिक्षण-मुक्त ढांचा है जो एक Y-आर्किटेक्चर का उपयोग करके लार्ज विजन-लैंग्वेज मॉडल्स में मतिभ्रम (hallucinations) को कम करता है, जहाँ यह उथले गणनाओं (shallow computations) को साझा करने के लिए और मध्य परतों पर शाखा बनाने के लिए उपयोग करता है, जहाँ यह दूसरे फॉरवर्ड पास की विलंबता के बिना एक प्रभावी कंट्रास्टिव सिग्नल उत्पन्न करने के लिए सूक्ष्म दृश्य टोकन (fine-grained visual tokens) को रजिस्टर टोकन से बदल देता है।

मूल लेखक: Ting Chen, Geng Li, Guohao Chen, Yu Hu, Guan Huang, Mai Chen, Langsheng Lei, Jun Du

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ting Chen, Geng Li, Guohao Chen, Yu Hu, Guan Huang, Mai Chen, Langsheng Lei, Jun Du

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक लार्ज विजन-लैंग्वेज मॉडल (LVVM) एक बहुत ही प्रतिभाशाली लेकिन थोड़ी अति-आत्मविश्वासी कहानीकार है। आप उसे समुद्र तट (बीच) की एक तस्वीर दिखाते हैं, और वह दृश्य का वर्णन करना शुरू कर देता है। कभी-कभी वह चीजें सही बताता है ("वहाँ छतरियां और लोग हैं"), लेकिन अन्य बार, वह आत्मविश्वास के साथ ऐसी चीजें गढ़ लेता है जो वहां मौजूद ही नहीं हैं ("और देखो, वहां एक सर्फ़बोर्ड और एक कुत्ता भी है!")। इसे हैलुसिनेशन (Hallucination) कहा जाता है।

यह शोध पत्र एक नई विधि पेश करता है जिसे YARD (Y-Architecture Register Decoding) कहा जाता है, ताकि इस कहानीकार को चीजें मनगढ़ंत बनाने से रोका जा सके, और इसके लिए मॉडल को फिर से प्रशिक्षित (retrain) करने या उसे धीमा करने की आवश्यकता नहीं है।

YARD कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. पुराने तरीकों के साथ समस्या

YARD से पहले, शोधकर्ता "कॉन्ट्रास्टिव डिकोडिंग" (Contrastive Decoding) नामक तकनीक का उपयोग करके हैलुसिनेशन को ठीक करने की कोशिश करते थे। इसे ऐसे समझें जैसे कहानीकार को दो बार कहानी सुनाने के लिए कहना:

  • वर्जन A (साफ/Clean): "असली फोटो को देखो और मुझे बताओ कि तुम्हें क्या दिख रहा है।"
  • वर्जन B (विकृत/Degraded): "मुझे बताओ कि तुम्हें क्या दिख रहा है, लेकिन कल्पना करो कि फोटो धुंधली है या उसके कुछ हिस्से गायब हैं।"

कंप्यूटर फिर दोनों कहानियों की तुलना करता है। यदि वर्जन B एक सर्फ़बोर्ड का आविष्कार करता है लेकिन वर्जन A नहीं करता, तो कंप्यूटर समझ जाता है कि अंतिम उत्तर में "सर्फ़बोर्ड" वाले विचार को दबा देना चाहिए।

हालाँकि, पिछले तरीकों के दो बड़े दोष थे:

  • "आंखों पर पट्टी" वाला दृष्टिकोण (The "Blindfold" Approach): कुछ तरीकों ने वर्जन B के लिए विजुअल इनपुट को पूरी तरह से हटा दिया था। यह बहुत चरम था। मॉडल केवल सामान्य ज्ञान के आधार पर अनुमान लगाने लगता (जैसे, "समुद्र तटों पर आमतौर पर सर्फ़बोर्ड होते हैं"), जिससे इस विशिष्ट बीच के बारे में झूठ पकड़ने में मदद नहीं मिल पाती थी।
  • "दोहरा काम" वाला दृष्टिकोण (The "Double-Work" Approach): अन्य तरीकों ने इमेज पिक्सल को खराब कर दिया (शोर/noise जोड़ दिया)। इसके लिए कंप्यूटर को शुरुआत से इमेज को दो बार प्रोसेस करना पड़ता था, जो बहुत धीमा और महंगा था।

2. YARD समाधान: "Y" आकार का रूप

YARD एक Y-आकार का पथ (Y-shaped path) मॉडल के मस्तिष्क के भीतर बनाकर खेल बदल देता है।

  • तना (Stem - साझा पथ): दोनों "साफ" कहानी और "विकृत" कहानी एक साथ शुरू होती हैं। वे प्रोसेसिंग के पहले कुछ स्तरों (layers) को साझा करती हैं। यह एक साथ किताब का पहला पैराग्राफ पढ़ने जैसा है। इससे समय बचता है क्योंकि मॉडल को दो बार काम नहीं करना पड़ता।
  • विभाजन (The Split - मध्य परत): मॉडल की सोचने की प्रक्रिया के एक विशिष्ट बिंदु पर, पथ विभाजित हो जाता है।
    • बायां भाग (Clean Branch): सामान्य रूप से चलता है, छवि के हर छोटे विवरण (पैच) को देखता है।
    • दायां भाग (Degraded Branch): यहीं असली जादू होता है। इस भाग को हर छोटे विवरण को देखने के बजाय, एक "रजिस्टर" (Register) के माध्यम से छवि देखने के लिए मजबूर किया जाता है।

3. "रजिस्टर" का रूपक (Metaphor)

कल्पना कीजिए कि छवि एक हाई-रिज़ॉल्यूशन वाला नक्शा है।

  • क्लीन ब्रांच (Clean Branch) नक्शे को देखती है और हर सड़क, पेड़ और घर को देखती है।
  • विकृत ब्रांच (Degraded Branch) (YARD का उपयोग करते हुए) को एक "रजिस्टर" दिया जाता है। रजिस्टर एक सारांश नोट की तरह है जो कहता है, "यह समुद्र तट का दृश्य है जिसमें पानी और रेत है," लेकिन यह विशिष्ट विवरणों को छिपा देता है। यह जानता है कि वहां लोग हैं, लेकिन यह नहीं देख सकता कि वे कहाँ खड़े हैं या उन्होंने क्या पकड़ा हुआ है।

यह क्यों चतुर है?
यदि मॉडल कहने की कोशिश करता है, "वहाँ एक सर्फ़बोर्ड है," तो क्लीन ब्रांच (जो विवरण देखती है) नक्शे की जांच करती है और कहती है, "नहीं, मुझे सर्फ़बोर्ड नहीं दिख रहा है।" विकृत ब्रांच (जो केवल समुद्र तट के सामान्य अहसास को देखती है) कह सकती है, "खैर, समुद्र तटों पर अक्सर सर्फ़बोर्ड होते हैं, तो शायद?"

जब कंप्यूटर इन दोनों की तुलना करता है, तो उसे एहसास होता है: "क्लीन ब्रांच 'नहीं' कहती है, लेकिन विकृत ब्रांच सामान्य वाइब्स के आधार पर 'हाँ' का अनुमान लगा रही है।" YARD फिर "सर्फ़बोर्ड" के अनुमान को दबा देता है। यह कहानी को वास्तविकता में टिकाए रखता है क्योंकि क्लीन ब्रांच के पास सबूत है, और विकृत ब्रांच एक डिटेक्टर के रूप में कार्य करती है कि मॉडल केवल अनुमान लगा रहा है।

4. "मध्य" का महत्व क्यों है?

शोध ने पाया कि मॉडल का मस्तिष्क चरणों में काम करता है।

  • शुरुआती लेयर्स: बस तस्वीर को तैयार करना।
  • मध्य लेयर्स: यह वह "स्वीट स्पॉट" है जहाँ मॉडल टेक्स्ट को विशिष्ट विजुअल विवरणों से जोड़ना शुरू करता है।
  • देर वाली लेयर्स: मॉडल पहले ही तय कर चुका होता है कि उसे क्या कहना है।

YARD पथ को बिल्कुल बीच में विभाजित करता है। यदि आप बहुत जल्दी विभाजित करते हैं, तो मॉडल ने अभी तक तस्वीर को पर्याप्त रूप से नहीं देखा होगा। यदि आप बहुत देर से विभाजित करते हैं, तो मॉडल पहले ही विवरणों को "याद" कर चुका होगा और विकृत संस्करण से मूर्ख नहीं बनेगा। मध्य भाग "रजिस्टर" पेश करने के लिए एकदम सही समय है ताकि यह परीक्षण किया जा सके कि मॉडल वास्तव में तस्वीर को देख रहा है या केवल अनुमान लगा रहा है।

5. परिणाम

इस Y-आकार के पथ और "रजिस्टर" ट्रिक का उपयोग करके:

  • यह तेज़ है: क्योंकि दोनों पथ शुरुआत साझा करते हैं, मॉडल को इमेज को शून्य से दो बार प्रोसेस नहीं करना पड़ता।
  • यह स्मार्ट है: यह पिछले तरीकों की तुलना में हैलुसिनेशन को बेहतर तरीके से पकड़ता है क्योंकि यह एक विस्तृत दृश्य और एक सामान्य दृश्य के बीच एक "निष्पक्ष मुकाबला" बनाता है, न कि एक विस्तृत दृश्य बनाम एक अंधा अनुमान।
  • यह हर जगह काम करता है: शोध पत्र में कई अलग-अलग AI मॉडल्स पर इसका परीक्षण किया गया, और यह बिना उन्हें फिर से प्रशिक्षित किए लगातार अच्छा काम करता है।

संक्षेप में, YARD एक तथ्य-जांचकर्ता (fact-checker) की तरह है जो AI के मस्तिष्क के अंदर बैठा है, और पूछ रहा है, "क्या आप वाकई वह देख रहे हैं, या आप केवल अनुमान लगा रहे हैं कि आमतौर पर क्या होता है?" यह यह सब कुशलतापूर्वक करता है, बिना बातचीत को धीमा किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →