← नवीनतम पेपर
💻 computer science

Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models

यह शोध पत्र KAWHI को प्रस्तुत करता है, जो एक प्लग-एंड-प्ले रिवॉर्ड रीवेटिंग तंत्र है जो संरचनात्मक बाधाओं को दूर करने और मल्टीमॉडल रीजनिंग प्रदर्शन को बढ़ाने के लिए स्थानिक दृश्य साक्ष्य (spatial visual evidence) को अर्थपूर्ण रूप से निर्णायक तर्क चरणों (semantically decisive reasoning steps) के साथ अनुकूल रूप से संरेखित करके लार्ज विजन-लैंग्वेज मॉडल्स में विजुअल रिप्रेजेंटेशन और रिइन्फोर्समेंट लर्निंग फ्रॉम वेरीफिएबल रिवार्ड्स (RLVR) के बीच के अंतर को पाटता है।

मूल लेखक: Yuhang Han, Yuyang Wu, Zhengbo Jiao, Yiyu Wang, Xuyang Liu, Shaobo Wang, Hanlin Xu, Xuming Hu, Linfeng Zhang

प्रकाशित 2026-03-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuhang Han, Yuyang Wu, Zhengbo Jiao, Yiyu Wang, Xuyang Liu, Shaobo Wang, Hanlin Xu, Xuming Hu, Linfeng Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े विचलित (distracted) छात्र को एक पाठ्यपुस्तक और एक आरेख (diagram) का उपयोग करके जटिल ज्यामिति (geometry) की समस्याओं को हल करना सिखा रहे हैं।

समस्या: "शोर भरी कक्षा" का प्रभाव (The "Noisy Classroom" Effect)
वर्तमान में, लार्ज विजन-लैंग्वेज मॉडल्स (AI जो देख और पढ़ सकते हैं) उन छात्रों की तरह हैं जो पृष्ठ के हर एक शब्द को पढ़ने की कोशिश करते हैं, जिसमें खाली मार्जिन, धूल के कण और सजावटी बॉर्डर भी शामिल हैं। जब वे अपनी गलतियों से सीखने की कोशिश करते हैं (एक प्रक्रिया जिसे रीइन्फोर्समेंट लर्निंग कहा जाता है), तो वे शोर से अभिभूत हो जाते हैं। वे पृष्ठभूमि (background) पर बहुत अधिक मानसिक ऊर्जा खर्च कर देते हैं और आरेख की महत्वपूर्ण रेखाओं और कोणों पर पर्याप्त ध्यान नहीं दे पाते।

शोधकर्ताओं ने पाया कि AI की लगभग 50% गलतियाँ इसलिए नहीं थीं कि उसका गणित खराब था; बल्कि इसलिए थीं क्योंकि उसने चित्र को गलत तरीके से पढ़ा। वह या तो चित्र के गलत हिस्से को देख रहा था या किसी सूक्ष्म, महत्वपूर्ण विवरण को चूक गया क्योंकि वह एक ही समय में पूरी छवि को समान तीव्रता के साथ प्रोसेस करने की कोशिश कर रहा था।

समाधान: KAWHI (द "स्मार्ट हाइलाइटर")
लेखक एक नया टूल प्रस्तावित करते हैं जिसे KAWHI कहा जाता है। इसे एक स्मार्ट, जादुई हाइलाइटर के रूप में समझें जिसका उपयोग शिक्षक (AI) सीखते समय करता है।

यह तीन सरल चरणों में कैसे काम करता है, यहाँ दिया गया है:

1. "स्पॉटलाइट" (महत्वपूर्ण हिस्सों को खोजना)

कल्पना कीजिए कि आरेख एक अंधेरा कमरा है। कमरे का अधिकांश हिस्सा खाली है (पृष्ठभूमि), लेकिन महत्वपूर्ण सुराग (कोण, रेखाएं, संख्याएं) चमक रहे हैं।

  • पुराना तरीका: AI पूरे कमरे पर एक विशाल फ्लडलाइट जला देता है, जिससे खाली कोनों पर ऊर्जा बर्बाद होती है।
  • KAWHI का तरीका: KAWHI एक "ज्यामितीय टॉर्च" (geometric flashlight) का उपयोग करता है। यह छवि को स्कैन करता है, चमकते हुए सुरागों (स्ट्रोक्स, प्रतीक, अक्ष) को ढूंढता है, और केवल उन विशिष्ट क्षेत्रों पर एक स्पॉटलाइट बनाता है। यह AI को बताता है: "खाली जगह को अनदेखा करें; केवल यहाँ ध्यान केंद्रित करें।"

2. "डिटेक्टिव" (शब्दों को चित्रों से जोड़ना)

एक बार जब AI अपना उत्तर लिखना शुरू करता है, तो उसे यह सुनिश्चित करने की आवश्यकता होती है कि उसके शब्द चित्र से मेल खाते हों।

  • पुराना तरीका: AI "कोण A" के बारे में वाक्य लिख सकता है जबकि उसकी आँखें वास्तव में चित्र में "कोण B" को देख रही होती हैं। यह एक बेमेल (mismatch) स्थिति है।
  • KAWHI का तरीका: KAWHI एक डिटेक्टिव की तरह कार्य करता है। जब भी AI कोई शब्द लिखता है, डिटेक्टिव जाँच करता है: "क्या यह शब्द छवि के सही हिस्से को देख रहा है?"
    • यदि AI एक विशिष्ट रेखा के बारे में लिखता है और स्पॉटलाइट उस रेखा पर है? बहुत अच्छा!
    • यदि AI एक रेखा के बारे में लिख रहा है लेकिन पृष्ठभूमि को देख रहा है? गलत काम!

3. "फेयर ग्रेडर" (रिपोर्ट कार्ड को फिर से लिखना)

यह सबसे चतुर हिस्सा है। पारंपरिक शिक्षण में, यदि AI अंतिम उत्तर सही देता है, तो उसे पूरे उत्तर के लिए एक गोल्ड स्टार मिलता है। यदि वह गलत है, तो उसे पूरे उत्तर के लिए एक लाल 'X' मिलता है। यह अनुचित है क्योंकि AI ने पहले तीन चरणों में बहुत अच्छा काम किया होगा लेकिन अंतिम चरण में विफल रहा होगा।

KAWHI ग्रेडिंग प्रणाली को बदल देता है:

  • यह उत्तर को अनुच्छेदों (विचारों के टुकड़ों) में तोड़ देता है।
  • यह "डिटेक्टिव" की रिपोर्ट को देखता है।
  • पुरस्कार (Reward): यदि एक अनुच्छेद ने सही दृश्य सुराग खोजने के लिए "स्पॉटलाइट" का सही उपयोग किया, तो उस अनुच्छेद को एक बड़ा बोनस मिलता है। यदि कोई अनुच्छेद इधर-उधर भटक रहा था और गलत चीजों को देख रहा था, तो उसे बहुत छोटा पुरस्कार (या दंड भी) मिलता है।

परिणाम:
केवल यह कहने के बजाय कि "आपने सही/गलत किया," KAWHI कहता है: "आपने चरण 2 में आरेख पर ध्यान केंद्रित करने में शानदार काम किया, लेकिन चरण 4 में आप विचलित हो गए।" यह AI को सिखाता है कि दृश्य साक्ष्य पर ठीक उसी समय ध्यान देना है जब उसे इसकी आवश्यकता होती है।

यह क्यों महत्वपूर्ण है

इस "स्मार्ट हाइलाइटर" और "फेयर ग्रेडर" का उपयोग करके, AI भ्रमित (hallucinate) होना बंद कर देता है (छवि के बारे में तथ्य बनाना) और बहुत अधिक सटीकता के साथ समस्याओं को हल करना शुरू कर देता है। यह एक ऐसे छात्र को चश्मा देने जैसा है जो छत की ओर देख रहा था और अब उसे मजबूर करता है कि वह पृष्ठ पर दिए गए गणित के प्रश्न को देखे।

संक्षेप में: KAWHI AI को वहाँ देखने के लिए सिखाता है जहाँ उसे देखना चाहिए और ऐसा करने के लिए विशेष रूप से पुरस्कृत करता है, जिससे एक विचलित प्रतिभाशाली व्यक्ति एक केंद्रित विशेषज्ञ में बदल जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →