← नवीनतम पेपर
💻 computer science

Visual-Advantage On-Policy Distillation for Vision-Language Models

यह शोध पत्र विज़ुअल-एडवांटेज ऑन-पॉलिसी डिस्टिलेशन (VA-OPD) को प्रस्तुत करता है, जो विज़न-लैंग्वेज मॉडल्स के लिए एक नवीन प्रशिक्षण विधि है जो डिस्टिलेशन के दौरान विज़न-क्रिटिकल टोकन्स को अलग करने और प्राथमिकता देने के लिए टोकन-लेवल विज़ुअल एडवांटेज सिग्नल्स का लाभ उठाती है, जिससे विभिन्न टीचर मॉडल आकारों में गणितीय तर्क और विज़ुअल अंडरस्टैंडिंग बेंचमार्क पर प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Ruiqi Liu, Xiaolei Lv, Gengsheng Li, Ximo Zhu, Zhiheng Wang, Zhengbo Zhang, Junkai Chen, Zhiheng Li, Bo Li, Jun Gao, Shu Wu

प्रकाशित 2026-05-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruiqi Liu, Xiaolei Lv, Gengsheng Li, Ximo Zhu, Zhiheng Wang, Zhengbo Zhang, Junkai Chen, Zhiheng Li, Bo Li, Jun Gao, Shu Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Visual-Advantage On-Policy Distillation for Vision-Language Models" का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: "नकलची" छात्र (The "Copycat" Student)

कल्पना कीजिए कि आपके पास एक बहुत बुद्धिमान शिक्षक (एक बड़ा AI मॉडल) है जो चित्रों (diagrams) का उपयोग करके गणित के सवाल हल करने में माहिर है। आप एक छोटे और सस्ते छात्र AI को भी वही काम करने के लिए प्रशिक्षित करना चाहते हैं।

आमतौर पर, आप छात्र को एक समस्या हल करने देते हैं, और यदि वह सही उत्तर देता है, तो आप कहते हैं, "अच्छा काम किया! अब देखो कि शिक्षक ने इसे कैसे हल किया और उनके चरणों की नकल करो।" इसे डिस्टिलेशन (distillation) कहा जाता है।

चुनौती:
इस शोध पत्र में इस प्रक्रिया में एक छिपे हुए दोष का पता चला है। एक विशिष्ट गणित के सवाल में जिसमें एक चित्र होता है, AI द्वारा लिखे गए अधिकांश शब्द केवल "फिलर" या "ढांचा" (जैसे यह कहना कि "सबसे पहले, आइए आरेख को देखें" या "कोणों का योग है...") होते हैं। केवल बहुत कम शब्द वास्तव में चित्र पर आधारित होते हैं (जैसे किसी विशिष्ट संख्या को पढ़ना: "130 डिग्री")।

जब मानक प्रशिक्षण विधि काम करती है, तो वह छात्र द्वारा लिखे गए हर एक शब्द को समान रूप से महत्वपूर्ण मानती है। यह एक ऐसे शिक्षक की तरह है जो छात्र के निबंध को ग्रेड दे रहा है जहाँ वे "द" (The) जैसे शब्द को उतना ही महत्व देते हैं जितना कि महत्वपूर्ण संख्या "130" को।

परिणाम: छात्र शब्दों की तो पूरी तरह से नकल करना सीख जाता है, लेकिन वह वास्तव में चित्र को देखना नहीं सीखता। वह एक ऐसा "नकलची" बन जाता है जो शिक्षक के टेक्स्ट की नकल तो करता है, लेकिन दृश्य विवरणों (visual details) को अनदेखा कर देता है। यदि आप उसे थोड़ा अलग चित्र दिखाते हैं, तो वह विफल हो सकता है क्योंकि उसने कभी चित्र पर निर्भर रहना नहीं सीखा।

समाधान: "विजुअल एडवांटेज" (VA) का परिचय

शोधकर्ताओं ने एक नया तरीका बनाया जिससे यह मापा जा सके कि शिक्षक को प्रत्येक विशिष्ट शब्द लिखने के लिए वास्तव में चित्र की कितनी आवश्यकता थी। वे इसे विजुअल एडवांटेज (Visual Advantage - VA) कहते हैं।

इसे एक "क्या-होता-अगर" (What-If) परीक्षण की तरह समझें:

  1. शिक्षक पूर्ण, उच्च-गुणवत्ता वाले चित्र को देखता है और एक वाक्य लिखता है।
  2. फिर शिक्षक उसी चित्र के धुंधले (blurry/pixelated) संस्करण को देखता है (जहाँ छोटे विवरण गायब हैं) और उसी वाक्य को फिर से लिखने की कोशिश करता है।
  3. अंतर: यदि शिक्षक धुंधले चित्र के साथ भी "द" (The) शब्द आसानी से लिख सकता है, तो उस शब्द का लो विजुअल एडवांटेज (Low Visual Advantage) है (यह केवल भाषा है)। लेकिन यदि शिक्षक संख्या "130" पर अटक जाता है या गलत अनुमान लगाता है क्योंकि धुंधला चित्र उसे छिपा देता है, तो उस शब्द का हाई विजुअल एडवांटेज (High Visual Advantage) है।

शोध पत्र में पाया गया कि हाई विजुअल एडवांटेज वाले शब्द दुर्लभ हैं (केवल लगभग 10% शब्द), लेकिन वे ही एकमात्र शब्द हैं जो वास्तव में छात्र को चित्र देखना सिखाते हैं।

VA-OPD कैसे काम करता है: "स्पॉटलाइट" विधि

नया तरीका, जिसे VA-OPD कहा जाता है, प्रशिक्षण के नियमों को बदल देता है ताकि छात्र उन दुर्लभ, महत्वपूर्ण शब्दों पर ध्यान केंद्रित कर सके। यह दो चतुर तरीकों से ऐसा करता है:

1. "सर्वश्रेष्ठ प्रयास" बोनस (Rollout-Level)

कभी-कभी, छात्र एक ही समस्या के कई अलग-अलग उत्तर उत्पन्न करता है।

  • पुराना तरीका: सभी प्रयासों के साथ समान व्यवहार करें।
  • VA-OPD तरीका: यह जाँचता है कि किस प्रयास ने चित्र पर सबसे अधिक भरोसा किया (जिसका "विजुअल एडवांटेज" सबसे अधिक था)। यह उस विशिष्ट प्रयास को एक बोनस वेट (bonus weight) देता है, छात्र को निर्देश देता है, "यह वह है जहाँ आपने वास्तव में चित्र को देखा था; इसे सीखने के लिए इस पर अतिरिक्त ध्यान दें।"

2. "वीआईपी सेक्शन" (Token-Level)

एक ही उत्तर के भीतर, यह विधि शब्दों को दो समूहों में विभाजित करती है:

  • वीआईपी (VIPs - High VA): वे शब्द जो चित्र पर निर्भर हैं (जैसे चार्ट से पढ़ी गई संख्याएँ)।
  • रेगुलर (Regulars - Low VA): फिलर शब्द (जैसे "इसलिए", "है", "और")।

सीखने के संकेत (learning signal) को सभी शब्दों में औसत करने के बजाय (जो वीआईपी को कमजोर कर देता है), VA-OPD वीआईपी के लिए लर्निंग स्कोर की गणना अलग से करता है। यह सुनिश्चित करता है कि छात्र को दृश्य भागों को सीखने के लिए एक मजबूत "धक्का" मिले, बिना उस संकेत के हजारों उबाऊ फिलर शब्दों में दब जाने के।

परिणाम: स्मार्ट, न कि केवल तेज़

शोधकर्ताओं ने गणित और दृश्य तर्क (visual reasoning) कार्यों पर इसका परीक्षण किया। यहाँ क्या हुआ:

  • बेहतर सटीकता: VA-OPD के साथ प्रशिक्षित छात्रों ने पुराने तरीके की तुलना में उच्च स्कोर प्राप्त किया।
  • वास्तविक दृश्य सीखना: सबसे महत्वपूर्ण खोज यह है कि छात्रों ने केवल उत्तरों को रटा नहीं। जब शोधकर्ताओं ने जाँच की, तो पाया कि VA-OPD छात्र वास्तव में समस्याओं को हल करने के लिए चित्रों पर अधिक निर्भर होने लगे थे। जैसे-जैसे वे स्मार्ट हुए, उनके "विजुअल एडवांटेज" स्कोर भी बढ़े।
  • स्केलिंग अप: यह विधि तब और भी बेहतर काम करती है जब एक बड़ा, अधिक बुद्धिमान शिक्षक या अधिक प्रशिक्षण डेटा का उपयोग किया जाता है। यह भ्रमित नहीं हुआ; यह बस महत्वपूर्ण दृश्य सुरागों को पहचानने में और बेहतर हो गया।

सारांश उपमा (Summary Analogy)

कल्पना कीजिए कि आप एक बच्चे को टोकरी में फल पहचानना सिखा रहे हैं।

  • मानक प्रशिक्षण: आप उन्हें एक सेब की तस्वीर दिखाते हैं और कहते हैं, "यह एक लाल, गोल फल है जो पेड़ों पर उगता है।" बच्चा "लाल, गोल, पेड़ों पर उगता है" वाक्य को याद कर लेता है लेकिन वास्तव में सेब के आकार या रंग को पहचानना नहीं सीखता।
  • VA-OPD प्रशिक्षण: आप महसूस करते हैं कि बच्चे को केवल "लाल" और "गोल" शब्दों पर ध्यान देने की आवश्यकता है क्योंकि वे ही साबित करते हैं कि यह एक सेब है। आप "पेड़ों पर उगता है" जैसे शब्दों को अनदेखा कर देते हैं (जो नाशपाती पर भी लागू हो सकते हैं) और हर बार जब बच्चा "लाल" और "गोल" वाले हिस्से को सही पहचानता है, तो आप उसे एक विशेष इनाम देते हैं।
  • परिणाम: बच्चा सेब का वर्णन रटने के बजाय, वास्तव में सेब को देखना सीख जाता है।

संक्षेप में: यह शोध पत्र AI प्रशिक्षण के एक अंधे मोड़ (blind spot) को ठीक करता है, जिससे छोटे मॉडल केवल टेक्स्ट की नकल करने के बजाय वास्तव में चित्रों को देखना सीखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →