← नवीनतम पेपर
💻 computer science

Bad Seeing or Bad Thinking? Rewarding Perception for Vision-Language Reasoning

यह शोध पत्र मोडैलिटी-अवेयर क्रेडिट असाइनमेंट (MoCA) नामक एक सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) फ्रेमवर्क पेश करता है जो जनरेशन को इंटरलीव्ड स्टेप्स में विभाजित करके और त्रुटियों को दोषपूर्ण धारणा या दोषपूर्ण तर्क में से किसी एक के रूप में सटीक रूप से आरोपित करने के लिए विशिष्ट सत्यापन तंत्रों का उपयोग करके विजन-लैंग्वेज मॉडल्स में धारणा-तर्क (परसेप्शन-रीजनिंग) ट्रेड-ऑफ को हल करता है, जिससे दोनों क्षमताओं को एक साथ सुधारने वाले लक्षित पुरस्कारों को सक्षम बनाया जा सके।

मूल लेखक: Haozhe Wang, Qixin Xu, Changpeng Wang, Taofeng Xue, Chong Peng, Wenhu Chen, Fangzhen Lin

प्रकाशित 2026-05-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haozhe Wang, Qixin Xu, Changpeng Wang, Taofeng Xue, Chong Peng, Wenhu Chen, Fangzhen Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य को सुलझाने के लिए एक जासूस को काम पर रख रहे हैं, जो केवल एक तस्वीर और सुरागों की एक सूची पर आधारित है।

आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन जासूसों को विज़न-लैंग्वेज मॉडल्स (VLMs) कहा जाता है। वे एक छवि को देखते हैं (देखना) और फिर एक समस्या को हल करने या प्रश्न का उत्तर देने का प्रयास करते हैं (सोचना)।

लंबे समय तक, इन AI जासूसों के पास एक बड़ी समस्या थी: जब वे गलत उत्तर देते थे, तो किसी को पता नहीं चलता था कि क्यों।

समस्या: "खराब देखना" बनाम "खराब सोचना"

इसे पेपर में "सी-सॉ इफेक्ट" (Seesaw Effect) कहा गया है।

  • यदि आप AI को तस्वीर को अधिक ध्यान से देखने के लिए प्रेरित करते हैं, तो अक्सर इसकी तर्क शक्ति (logic) खराब हो जाती है।
  • यदि आप इसे और अधिक गहराई से सोचने के लिए प्रेरित करते हैं, तो यह अक्सर तस्वीर के बारे में ऐसी चीजें बताने लगता है (hallucinations) जो वहां मौजूद ही नहीं हैं।

यह एक छात्र द्वारा गणित की परीक्षा देने जैसा है। यदि वह गलत उत्तर देता है, तो क्या इसका कारण यह है कि उसने पेज पर लिखे नंबरों को गलत पढ़ा (खराब देखना), या इसलिए कि उसने गणित गलत किया (खराब सोचना)?

पिछले AI प्रशिक्षण में, शिक्षक केवल यह कहता था, "गलत उत्तर," और पूरे छात्र को दंडित करता था। छात्र फिर सब कुछ बदलने की कोशिश करता था, जिससे वह अनजाने में नंबरों को पढ़ने का तरीका भूल जाता था ताकि गणित ठीक हो सके, या इसके विपरीत। पेपर का तर्क है कि यही अस्पष्टता समस्या की जड़ है।

समाधान: MoCA (द "ब्लाइंडफोल्डेड" डिटेक्टिव)

लेखक एक नई प्रशिक्षण विधि पेश करते हैं जिसे MoCA (मोडैलिटी-अवेयर क्रेडिट असाइनमेंट) कहा जाता है। वे AI के मस्तिष्क को एक फैक्ट्री असेंबली लाइन के दो अलग-अलग स्टेशनों की तरह मानते हैं:

  1. स्टेशन A (आंखें): AI को पहले तस्वीर में जो कुछ भी दिख रहा है उसे सटीक रूप से लिखना होगा, जिसमें <recognition> जैसा एक विशेष टैग का उपयोग किया जाएगा। यह एक कोर्ट स्टेनोग्राफर की तरह कार्य करता है, जो केवल तथ्यों को ट्रांसक्राइब करता है।
  2. स्टेशन B (मस्तिष्क): AI फिर उन लिखित नोट्स का उपयोग करके समस्या को हल करता है, जिसमें <thinking> जैसा एक टैग उपयोग किया जाता है।

"ब्लाइंडफोल्डेड रीज़नर" (आंखों पर पट्टी बंधे तर्ककर्ता) परीक्षण

यहाँ चालाकी भरी बात है। यह जांचने के लिए कि क्या स्टेशन A (आंखों) ने अच्छा काम किया, लेखक एक ब्लाइंडफोल्डेड रीज़नर का उपयोग करते हैं।

कल्पना कीजिए कि आप AI की "आंखों" द्वारा लिखे गए नोट्स लेते हैं और उन्हें एक बहुत बुद्धिमान इंसान को देते जो मूल फोटो को नहीं देख सकता

  • यदि इंसान केवल उन नोट्स का उपयोग करके रहस्य को सुलझा लेता है: तो "आंखों" ने बेहतरीन काम किया! उन्होंने सभी आवश्यक तथ्यों को पकड़ लिया। AI को "अच्छे देखने" के लिए इनाम मिलता है।
  • यदि इंसान मुख्य विवरणों की कमी के कारण असफल हो जाता है: तो "आंखों" ने विफल प्रदर्शन किया। AI को "खराब देखने" के लिए दंड मिलता है।

यह सिस्टम को विशेष रूप से तस्वीर को सही ढंग से देखने के लिए पुरस्कृत करने की अनुमति देता है, भले ही अंतिम गणितीय उत्तर अभी भी गलत रहा हो।

ग्रेडिंग के लिए "स्ट्रक्चर्ड स्क्रिप्ट"

अंतिम उत्तर की जांच करने के लिए, लेखकों ने महसूस किया कि AI से "क्या यह सही है?" पूछना बहुत अस्पष्ट और असंगत है (जैसे किसी दोस्त को टेस्ट ग्रेड करने के लिए कहना)। इसके बजाय, उन्होंने ग्रेडिंग करने वाले AI को एक कठोर, चरण-दर-चरण स्क्रिप्ट (एक "स्ट्रक्चर्ड वर्बल वेरिफिकेशन") दी।

इसे एक स्पोर्ट्स रेफरी की तरह समझें। रेफरी यह अनुमान लगाने के बजाय कि कोई खेल "फेयर" था या नहीं, नियमों की किताब का पालन करता है: चरण 1: पैरों की जांच करें। चरण 2: गेंद की जांच करें। चरण 3: सीटी की जांच करें। यह ग्रेडिंग को सुसंगत और विश्वसनीय बनाता है, जिससे AI के लिए ग्रेडिंग सिस्टम को "धोखा देना" कठिन हो जाता है।

परिणाम: सी-सॉ को तोड़ना

"आंखों" को "मस्तिष्क" से अलग करके और उन्हें स्वतंत्र रूप से ग्रेड करके, AI सी-सॉ प्रभाव को रोक देता है।

  • यदि AI गणित में गलत है लेकिन उसने तस्वीर को सही देखा, तो वह अपने "देखने के कौशल" को बनाए रखता है और केवल अपने गणित को ठीक करता है।
  • यदि उसने तस्वीर गलत देखी, तो वह अपने तर्क को बिगाड़े बिना अपनी दृष्टि (vision) को ठीक करता है।

पेपर दिखाता है कि यह विधि एक एकल AI मॉडल को जटिल छवियों (जैसे चार्ट पर छोटे टेक्स्ट को पढ़ना) में विवरण देखने और कठिन तर्क समस्याओं को हल करने, दोनों में काफी बेहतर बनने की अनुमति देती है, जो महंगे और जटिल बाहरी उपकरणों की आवश्यकता के बिना कई मौजूदा मॉडलों से बेहतर प्रदर्शन करती है।

संक्षेप में: यह पेपर AI को यह अनुमान लगाना बंद करने के लिए सिखाता है कि वह क्यों विफल हुआ। इसके बजाय, यह AI को अपना काम दिखाने के लिए मजबूर करता है, यह जांचता है कि क्या काम ईमानदार है, और मस्तिष्क के उस विशिष्ट हिस्से को पुरस्कृत करता है जिसने काम को सही ढंग से किया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →