← नवीनतम पेपर
💬 NLP

VSPO: Vector-Steered Policy Optimization for Behavioral Control

यह शोध पत्र वेक्टर-स्टीयर्ड पॉलिसी ऑप्टिमाइज़ेशन (VSPO) को प्रस्तुत करता है, जो एक नवीन विधि है जो रोलआउट सैंपलिंग के दौरान व्यवहारिक तीव्रता को नियंत्रित करने के लिए स्टीयरिंग वेक्टर्स का उपयोग करने हेतु GRPO को संशोधित करती है, जिससे स्पार्स रिवॉर्ड बॉटलनैक्स (sparse reward bottlenecks) कम होते हैं और कई रीजनिंग बेंचमार्क पर बेहतर व्यवहारिक नियंत्रण और कार्य सटीकता प्राप्त करने के लिए पॉलिसी ऑप्टिमाइज़ेशन को प्रमाणित रूप से त्वरित किया जाता है।

मूल लेखक: Xuechen Zhang, Zijian Huang, Kai Yang, Weijia Zhang, Jiasi Chen, Samet Oymak

प्रकाशित 2026-05-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xuechen Zhang, Zijian Huang, Kai Yang, Weijia Zhang, Jiasi Chen, Samet Oymak

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन थोड़ी जिद्दी छात्र है (AI मॉडल)। आप चाहते हैं कि वह गणित की समस्या को सही ढंग से हल करे (प्राथमिक लक्ष्य), लेकिन आप यह भी चाहते हैं कि वह उत्तर को एक बहुत ही विशिष्ट तरीके से समझाए—जैसे कि एक धैर्यवान प्राथमिक विद्यालय के शिक्षक की तरह, या एक उच्च स्तरीय विश्वविद्यालय के प्रोफेसर की तरह।

समस्या यह है कि वह छात्र स्वयं से उन विशिष्ट शैलियों में बहुत कम समझाता है। यदि आप केवल उन्हें कहेंगे, "एक प्रोफेसर की तरह बनो," तो वे भ्रमित हो सकते हैं या आपकी बात को अनदेखा कर सकते हैं। यदि आप उन्हें किसी प्रसिद्ध प्रोफेसर (एक "शिक्षक") द्वारा लिखे गए उदाहरण दिखाकर सिखाने की कोशिश करते हैं, तो वे वास्तव में उस तरह से सोचना सीखने के बजाय केवल उन उदाहरणों को रट सकते हैं।

यह पेपर VSPO (वेक्टर-स्टीयर्ड पॉलिसी ऑप्टिमाइज़ेशन) नामक एक नई प्रशिक्षण विधि पेश करता है जो इसे हल करने के लिए है। यह यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करके:

1. समस्या: "स्पार्स रिवॉर्ड" (Sparse Reward) की बाधा

कल्पना कीजिए कि आप छात्र को अधिक "आत्मविश्वासी" बनना सिखाने की कोशिश कर रहे हैं। आप उनसे 10 समस्याएं हल करने के लिए कहते हैं।

  • पुराना तरीका (रिवॉर्ड शेपिंग): आप उनके उत्तर देने का इंतज़ार करते हैं। यदि वे संयोग से आत्मविश्वास से भरे हुए लगते हैं, तो आप उन्हें एक स्टार देते हैं। यदि वे अनिश्चित लगते हैं (जो 10 में से 9 बार होता है), तो आप उन्हें कोई स्टार नहीं देते।
  • समस्या: क्योंकि आत्मविश्वासी उत्तर बहुत दुर्लभ हैं, छात्र को बहुत कम स्टार मिलते हैं। उन्हें पैटर्न सीखने के लिए पर्याप्त अभ्यास नहीं मिल पाता। यह जुगलबंदी (juggling) सीखने की कोशिश करने जैसा है, जहाँ आप सप्ताह में एक बार गलती से गेंद को अपने हाथों में गिरने का इंतज़ार करते हैं।

2. समाधान: "स्टीयरिंग वेक्टर" (The Invisible Nudge - अदृश्य संकेत)

शोधकर्ताओं ने पाया कि AI के "मस्तिष्क" (इसके आंतरिक सक्रियण स्थान/internal activation space) में विशिष्ट दिशाएँ होती हैं, जैसे कि अदृश्य सड़कें, जो विशिष्ट व्यवहारों की ओर ले जाती हैं।

  • उपमा: AI के मन को एक विशाल मानचित्र की तरह समझें। वहाँ एक विशिष्ट "प्रोफेसर रोड" है और एक "प्राइमरी टीचर रोड" है।
  • वे सड़क कैसे पाते हैं: वे एक सुपर-स्मार्ट "टीचर AI" का उपयोग करते हैं जो उत्तर के दो संस्करण लिखता है: एक बहुत ही विशेषज्ञ और एक बहुत ही सरल। वे AI के मस्तिष्क में इन दोनों उत्तरों के बीच के अंतर को मापते हैं ताकि एक "मैप कोऑर्डिनेट" (स्टीering Vector) बना सकें जो सीधे "प्रोफेसर रोड" की ओर इशारा करता है।

3. जादू का मंत्र: "ऑन-पॉलिसी सेल्फ-डिस्टिलेशन" (On-Policy Self-Distillation)

यही VSPO का मूल है। छात्र के "प्रोफेसर रोड" तक गलती से पहुँचने का इंतज़ार करने के बजाय, शोधकर्ता समस्या हल करते समय छात्र की सोचने की प्रक्रिया को धीरे से नज (nudge) करते हैं यानी दिशा देते हैं।

  • उपमा: कल्पना कीजिए कि छात्र एक धुंधले जंगल में चल रहा है।

    • सामान्य AI: वे बेतरतीब ढंग से भटकते हैं।
    • VSPO: शोधकर्ता छात्र को एक दिशा-सूचक यंत्र (compass) देते हैं जो थोड़ा सा "प्रोफेसर रोड" की ओर इशारा करता है। वे छात्र को 5 अलग-अलग पथों पर चलने के लिए कहते हैं:
      1. एक पथ जो मजबूती से प्रोफेसर शैली की ओर निर्देशित है।
      2. एक पथ जो कमजोर रूप से उसकी ओर निर्देशित है।
      3. एक पथ जिसमें कोई निर्देश नहीं है (सामान्य)।
      4. एक पथ जो विपरीत (प्राइमरी) शैली की ओर निर्देशित है।
      5. एक अन्य कमजोर निर्देश वाला पथ।
  • परिणाम: अब, धुंध में भटकने के बजाय, छात्र उत्तरों का एक पूरा परिवार उत्पन्न करता है, जो "बहुत सरल" से लेकर "बहुत विशेषज्ञ" तक विस्तृत है। भले ही छात्र आमतौर पर सरल उत्तर लिखता हो, यह 'नज' उसे अभी विशेषज्ञ उत्तर लिखने की कोशिश करने के लिए मजबूर करता है।

4. अपने स्वयं के "स्टीयर्ड" स्वरूप से सीखना

एक बार जब छात्र इन 5 अलग-अलग संस्करणों को उत्पन्न कर लेता है, तो सिस्टम जाँचता है:

  1. क्या उत्तर गणित को सही ढंग से हल करता है?
  2. क्या यह उस शैली में था जो हम चाहते थे?

सिस्टम फिर सबसे अच्छे "स्टीयर्ड" संस्करण को चुनता है (वह जो सही भी था और एक प्रोफेसर की तरह भी लग रहा था) और कहता है, "हे, याद रखो कि जब हमने तुम्हें दिशा दी थी तब तुम कैसे लग रहे थे? तुम इसके सक्षम हो! चलो इसे तुम्हारा नया सामान्य व्यवहार बनाते हैं।"

महत्वपूर्ण बात यह है कि छात्र अपने स्वयं के उत्पन्न किए गए प्रयासों से सीख रहा है, न कि बाहरी "टीचर AI" से। यह छात्र के सामने आईने के सामने भाषण का अभ्यास करने, अपनी टोन को समायोजित करने और फिर यह तय करने जैसा है, "ठीक है, मैं इस तरह बात कर सकता हूँ," बजाय इसके कि वह किसी और की रिकॉर्डिंग को केवल रटे।

यह पुराने तरीकों से बेहतर क्यों है?

  • केवल पूछने से बेहतर (टेक्स्टुअल गाइडेंस): प्रॉम्प्ट में AI को "प्रोफेसर बनो" कहना दूर से निर्देश चिल्लाने जैसा है। VSPO उनकी लिखने की प्रक्रिया को शारीरिक रूप से निर्देशित करने जैसा है। यह अधिक सटीक है और हर बार चिल्लाने वाले निर्देशों की आवश्यकता नहीं होती।
  • शिक्षक की नकल करने से बेहतर (डिस्टिलेशन): शिक्षक के काम की नकल करना "ऑफ-पॉलिसी" (किसी और से सीखना) है। VSPO "ऑन-पॉलिसी" (अपने स्वयं के सुधरे हुए प्रयासों से सीखना) है। यह सीखने की प्रक्रिया को अधिक स्थायी और स्थिर बनाता है।
  • "दुर्लभ व्यवहार" की समस्या को हल करता है: प्रशिक्षण के दौरान व्यवहारों की एक विस्तृत श्रृंखला (सरल से विशेषज्ञ तक) बनाकर, VSPO यह सुनिश्चित करता है कि AI वांछित शैली के कई उदाहरण देखे, न कि केवल उन दुर्लभ उदाहरणों को जो उसे संयोग से मिलते हैं।

निष्कर्ष (The Bottom Line)

VSPO एक ऐसी प्रशिक्षण तकनीक है जो एक अदृश्य "नज" (स्टीयरिंग वेक्टर) का उपयोग करती है ताकि AI को विभिन्न "व्यक्तित्वों" (जैसे आत्मविश्वासी, विशेषज्ञ, या संक्षिप्त) के साथ उत्तरों की एक विस्तृत विविधता उत्पन्न करने के लिए मजबूर किया जा सके। इसके बाद यह AI को उन विशिष्ट व्यक्तित्वों के भीतर सही उत्तर खोजने के लिए पुरस्कृत करता है और AI को उस शैली को स्थायी रूप से अपनाने के लिए सिखाता है।

परिणामस्वरूप, एक ऐसा AI मिलता है जो कठिन गणित की समस्याओं को हल कर सकता है और उन्हें ठीक उसी शैली में समझा सकता है जैसा आप चाहते हैं (विशेषज्ञ, सरल, आत्मविश्वासी, आदि), बिना अपनी सटीकता खोए, और यह सब केवल किसी शिक्षक की नकल करने के बजाय अपने स्वयं के अभ्यास से सीखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →