← नवीनतम पेपर
🤖 AI

ViCuR: Visual Cues as Recoverable Privilege for Multimodal On-Policy Distillation

ViCuR एक मल्टीमॉडल ऑन-पॉलिसी डिस्टिलेशन फ्रेमवर्क है जो एक लाइटवेट क्यू रिकवरी मॉड्यूल के माध्यम से आंसर-साइड प्रिविलेज को रिकवरेबल विजुअल क्यूज़ से बदल देता है, जिससे ट्रेन-टेस्ट मिसमैच समाप्त हो जाता है और विभिन्न बेंचमार्क एवं मॉडल स्केल्स पर रीजनिंग प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Kanghui Tian, Siyuan Liu, Ziang Yan, Sheng Xia, Shuai Dong, Yi Wang

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kanghui Tian, Siyuan Liu, Ziang Yan, Sheng Xia, Shuai Dong, Yi Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र को एक जटिल पहेली हल करना सिखाने की कोशिश कर रहे हैं, जैसे कि कोई ज्यामिति (geometry) की समस्या या किसी चार्ट को पढ़ना। आपके पास एक शानदार शिक्षक है जो उत्तर जानता है, और आप चाहते हैं कि छात्र शिक्षक को समस्या हल करते हुए देखकर सीखे।

यह शोध पत्र, ViCuR, इस समस्या पर प्रहार करता है कि हम आमतौर पर इन AI "छात्रों" को कैसे सिखाते हैं।

समस्या: "जादुई उत्तर" की चीट शीट (Cheat Sheet)

कई वर्तमान AI प्रशिक्षण विधियों में, शिक्षक को पाठ के दौरान एक "चीट शीट" दी जाती है जो छात्र को नहीं मिलती। इस चीट शीट में पहेली को देखना शुरू करने से पहले ही अंतिम उत्तर या चरण-दर-चरण समाधान मौजूद होता है।

  • उपमा (Analogy): कल्पना कीजिए कि एक गणित का शिक्षक बोर्ड पर समस्या हल कर रहा है। लेकिन, शिक्षक गुप्त रूप से किताब के पीछे देख रहा है जहाँ उत्तर लिखा है। शिक्षक कहता है, "ठीक है, मैं देख रहा हूँ कि उत्तर 42 है, इसलिए मैं यहाँ एक रेखा खींचूँगा ताकि वहाँ तक पहुँच सकूँ।"
  • समस्या: छात्र (AI) देखता है कि शिक्षक एक रेखा खींचता है और उसकी नकल करता है, लेकिन छात्र कभी यह नहीं सीख पाता कि वह रेखा क्यों खींची गई। छात्र ने केवल पैटर्न को रट लिया: "जब शिक्षक उत्तर देखता है, तो वह एक रेखा खींचता है।"
  • परिणाम: जब छात्र बाद में बिना चीट शीट के (वास्तविक दुनिया में) परीक्षा देता है, तो वह अटक जाता है। वह उत्तर नहीं ढूँढ पाता क्योंकि उसने पहेली को देखना नहीं सीखा; उसने केवल शिक्षक की प्रतिक्रिया की नकल करना सीखा। इसे "ट्रेन-टेस्ट मिसमैच" (train-test mismatch) कहा जाता है।

समाधान: उत्तर के बजाय "स्पॉटलाइट" (Spotlight)

ViCuR के लेखक कहते हैं: "शिक्षक को उत्तर देना बंद करें। इसके बजाय, शिक्षक को एक विजुअल क्यू (visual cue) दें।"

उनके नए तरीके में, शिक्षक को अतिरिक्त मदद दी जाती है, लेकिन उत्तर के बजाय, उसे एक विजुअल क्यू दिया जाता है (जैसे, "बीच में दो रेखाओं के मिलन बिंदु को देखें" या "ध्यान दें कि लाल बार नीले वाले से लंबा है")।

  • उपमा: शिक्षक के पास अभी भी एक गुप्त नोट है, लेकिन यह नोट यह नहीं कहता कि "उत्तर 42 है।" यह कहता है, "हे, इन दो रेखाओं के मिलन बिंदु को देखो।"
  • यह क्यों काम करता है: छात्र भी उस मिलन बिंदु को देख सकता है! "चीट शीट" अब उस चीज़ की ओर इशारा कर रही है जो छात्र के पास मौजूद चित्र में पहले से मौजूद है। शिक्षक कोई रहस्य प्रकट नहीं कर रहा है; वह केवल मौजूद साक्ष्य (evidence) को उजागर कर रहा है।

छात्र की सुपरपावर: "इंटरनल स्पॉटलाइट" (Internal Spotlight)

यहाँ पेचीदा हिस्सा है: छात्र AI को अभी भी टेक्स्ट नोट नहीं मिलता है। वह केवल चित्र और प्रश्न देखता है। तो, वह सही जगह पर देखना कैसे सीखता है?

यह पेपर छात्र AI के भीतर एक चतुर छोटे उपकरण को पेश करता है जिसे "सिंक टोकन" (Sink Token) कहा जाता है।

  • उपमा: कल्पना कीजिए कि छात्र के मस्तिष्क में एक विशेष "आवर्धक लेंस" (magnifying glass) टोकन (सिंक टोकन) है जो उसके मन के सामने बैठा है। पाठ के दौरान, यह आवर्धक लेंस चित्र को स्कैन करना सीखता है और महत्वपूर्ण विवरणों (मिलती हुई रेखाएं, लंबा लाल बार) को पकड़कर उन्हें अपनी स्मृति में रखता है।
  • यह कैसे सीखता है: शिक्षक कहता है, "मिलती हुई रेखाओं पर ध्यान केंद्रित करने के लिए बहुत अच्छा!" छात्र का आवर्धक लेंस सीखता है, "ओह, जब मैं मिलती हुई रेखाओं पर ध्यान केंद्रित करता हूँ, तो शिक्षक खुश होता है।" समय के साथ, छात्र बिना किसी शिक्षक के फुसफुसाहट के, अपने आप सही साक्ष्य खोजने के लिए अपने आंतरिक आवर्धक लेंस का उपयोग करने में बहुत कुशल हो जाता है।

परिणाम: स्मार्ट, न कि केवल शक्तिशाली

शोधकर्ताओं ने सात अलग-अलग बेंचमार्क (जैसे ज्यामिति परीक्षण और चार्ट पढ़ने की चुनौतियाँ) पर विभिन्न आकार के AI मॉडल का उपयोग करके इसका परीक्षण किया।

  1. पुराने तरीके से बेहतर: जब उन्होंने "उत्तर की चीट शीट" को "विजुअल स्पॉटलाइट" से बदल दिया, तो छात्र समस्याओं को हलने में काफी बेहतर हो गए। उन्होंने केवल पैटर्न को याद नहीं किया; उन्होंने वास्तव में चित्रों में साक्ष्य देखना सीखा।
  2. बड़े शिक्षकों के साथ भी काम करता है: यहाँ तक कि जब उन्होंने एक अत्यंत बुद्धिमान, विशाल शिक्षक मॉडल का उपयोग किया, तब भी इस विधि ने छोटे छात्र मॉडलों को पहले की तुलना में बेहतर सीखने में मदद की।
  3. कोई अतिरिक्त लागत नहीं: "आवर्धक लेंस" वाला यह उपकरण बहुत हल्का है। जब छात्र वास्तव में परीक्षा दे रहे होते हैं (inference), तो यह उनकी गति धीमी नहीं करता है। यह अपना काम केवल प्रशिक्षण के दौरान करता है।

मुख्य निष्कर्ष (The Bottom Line)

यह शोध पत्र तर्क देता है कि AI को छवियों के साथ तर्क करना सिखाने में, आप शिक्षक को "अतिरिक्त मदद" के रूप में क्या देते हैं, यह इस बात जितना महत्वपूर्ण है कि शिक्षक कितना बुद्धिमान है।

यदि आप शिक्षक को उत्तर देते हैं, तो छात्र नकल करना सीख जाता है।
यदि आप शिक्षक को दृश्य साक्ष्य की ओर इशारा करते हैं, तो छात्र सोचना सीख जाता है।

ViCuR वह प्रणाली है जो "उत्तर की चीट शीट" को "विजुअल स्पॉटलाइट" से बदल देती है, जिससे AI मॉडल को केवल अनुमान लगाने के बजाय, वास्तव में जो वे देख सकते हैं, उसी के आधार पर तर्क करना सिखाया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →