← नवीनतम पेपर
🤖 machine learning

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

यह शोध पत्र अनबाउंडेड पॉजिटिव एसिमेट्रिक ऑप्टिमाइज़ेशन (UP) को प्रस्तुत करता है, जो एक सार्वभौमिक प्लग-एंड-प्ले ऑब्जेक्टिव है जो सकारात्मक लाभों के लिए अनक्लिप्ड, स्थिर ग्रेडिएंट्स सक्षम करके और नकारात्मक लाभों के लिए क्लिपिंग सुरक्षा उपायों को बनाए रखते हुए लार्ज लैंग्वेज मॉडल्स के लिए सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) में अन्वेषण-स्थिरता द्वंद्व को हल करता है, जिससे विविध एल्गोरिदम और आर्किटेक्चर में तर्क संबंधी सटीकता को महत्वपूर्ण रूप से बढ़ाया जा सकता है।

मूल लेखक: Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin

प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यंत बुद्धिमान लेकिन सतर्क छात्र (AI) को अविश्वसनीय रूप से कठिन गणितीय पहेलियों को हल करना सिखा रहे हैं। छात्र के पास एक पाठ्यपुस्तक ("पुरानी नीति") है जिससे उसने सीखा है, लेकिन पहेलियाँ इतनी नई और जटिल हैं कि पाठ्यपुस्तक में उनके उत्तर नहीं हैं। आपको छात्र को सोचने के नए, रचनात्मक तरीके आज़माने के लिए प्रेरित करने की आवश्यकता है।

यह Large Language Models (LLMs) के लिए Reinforcement Learning (RL) की मूल चुनौती है: आप AI को बिना उसके नियंत्रण से बाहर हुए नए, साहसी विचारों को खोजने के लिए कैसे प्रोत्साहित कर सकते हैं?

समस्या: "टाइटरोप" (दोहरी तलवार) की दुविधा

यह शोध पत्र एक निराशाजनक खींचतान की पहचान करता है जिसे Exploration-Stability Dilemma कहा जाता है।

  1. अनियंत्रित होने का खतरा (अस्थिरता/Instability): यदि आप AI को बिना किसी सीमा के कोई भी नया रास्ता आज़माने देते हैं, तो वह शायद एक दुर्लभ, सही समाधान खोज ले। लेकिन ऐसा करने में, वह गलती से किसी गलत अनुमान को बहुत अधिक महत्व (weight) दे सकता है। इससे प्रशिक्षण अनियंत्रित होकर फट सकता है, जैसे कोई कार नियंत्रण से बाहर होकर तेज़ गति से भाग रही हो।
  2. बहुत अधिक सुरक्षित होने का खतरा (सीमित अन्वेषण/Stifled Exploration): विस्फोट को रोकने के लिए, वर्तमान विधियाँ एक "क्लिपिंग" (clipping) तंत्र का उपयोग करती हैं। इसे एक "सुरक्षा पट्टे" (safety leash) के रूप में समझें। यदि AI अपनी पुरानी पाठ्यपुस्तक से बहुत अधिक बदलने की कोशिश करता है, तो यह पट्टा उसे वापस खींच लेता है।
    • दोष: शोध पत्र का तर्क है कि यह पट्टा बहुत कसकर बंधा हुआ है। भले ही AI एक सही लेकिन बहुत कम संभावित रास्ता (एक "कम-आत्मविश्वास" वाला जीनियस विचार) खोज ले, तो भी यह पट्टा रिवॉर्ड (पुरस्कार) को पूरी तरह सीखने से पहले ही काट देता है। यह एक शिक्षक की तरह है जो कहता है, "अच्छा प्रयास, लेकिन तुम 80% से अधिक ग्रेड नहीं पा सकते क्योंकि यह नियम है," भले ही छात्र ने वास्तव में समस्या को पूरी तरह से हल कर दिया हो।

लेखक इस सीमा को "प्रोबेबिलिटी कैपेसिटी" (Probability Capacity - Cap) कहते हैं। वे दिखाते हैं कि वर्तमान विधियाँ AI की बढ़ने की क्षमता को सीमित कर देती हैं, जिससे प्रभावी रूप से उसकी दुर्लभ, शानदार समाधान खोजने की क्षमता खत्म हो जाती है।

समाधान: UP (Unbounded Positive Asymmetric Optimization)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे UP कहा जाता है। UP को एक स्मार्ट, दो-तरफा ट्रैफिक सिस्टम के रूप में समझें जो "अच्छे" और "बुरे" अनुमानों के साथ बहुत अलग व्यवहार करता है।

1. अच्छे विचारों के लिए "ग्रीन लाइट" (Unbounded Positive)

जब AI एक ऐसा कदम उठाता है जो एक सही समाधान की ओर ले जाता है (एक सकारात्मक लाभ/positive advantage), तो UP सुरक्षा पट्टे को पूरी तरह से हटा देता है।

  • उपमा: कल्पना कीजिए कि AI एक सर्फर है। यदि वह एक आदर्श लहर पकड़ता है (एक सही तर्क पथ), तो UP उसे बिना किसी गति सीमा के उस लहर पर किनारे तक जाने देता है।
  • यह कैसे काम करता है: पुरानी पाठ्यपुस्तक से तुलना करने के बजाय (जिससे अस्थिरता आती है), UP तुलना को AI की वर्तमान स्थिति से जोड़ता है। यह AI को अपने सबसे अच्छे विचारों को आक्रामक रूप से सुदृढ़ करने की अनुमति देता है, चाहे वे शुरू में कितने भी असंभव क्यों न लगे हों, बिना प्रशिक्षण को क्रैश किए।

2. बुरे विचारों के लिए "रेड लाइट" (Asymmetric Safety)

जब AI एक ऐसा कदम उठाता है जो एक गलत समाधान की ओर ले जाता है (एक नकारात्मक लाभ/negative advantage), तो UP सुरक्षा पट्टे को मजबूती से थामे रखता है।

  • उपमा: यदि सर्फर एक ऐसा स्टंट करने की कोशिश करता है जिससे उसके गिरने की संभावना हो, तो सुरक्षा जाल (क्लिपिंग तंत्र) उसे तुरंत पकड़ लेता है।
  • क्यों: यह AI को अपनी गलतियों से आक्रामक रूप से सीखकर अपने ज्ञान के आधार को नष्ट करने से रोकता है। यह सुनिश्चित करता है कि प्रशिक्षण स्थिर बना रहे।

यह एक बड़ी बात क्यों है

शोध पत्र का दावा है कि "अच्छे के लिए अनबाउंडेड" और "बुरे के लिए क्लिप्ड" के नियमों को अलग करके, उन्होंने इस दुविधा को हल कर दिया है।

  • यह प्लग-एंड-प्ले है: आपको पूरा कार बदलने की ज़रूरत नहीं है; आप बस इंजन बदल सकते हैं। लेखकों ने विभिन्न प्रकार के AI "इंजनों" (GRPO, DAPO, और GSPO जैसे एल्गोरिदम) और विभिन्न "चेसिस" (Dense, MoE, और Vision-Language मॉडल) पर इसका परीक्षण किया।
  • यह हर जगह काम करता है: चाहे AI शुद्ध गणितीय समस्याओं को हल कर रहा हो, दृश्य ज्यामिति (visual geometry) की पहेलियों को, या मल्टीमॉडल कार्यों को, UP ने लगातार AI को बेहतर समाधान खोजने में मदद की।
  • परिणाम: उनके प्रयोगों में, UP का उपयोग करने वाला AI न केवल तेज़ी से सीख रहा था; इसने अधिक सही उत्तर (उच्च सटीकता) और अधिक रचनात्मक पथ (उच्च एंट्रॉपी) खोजे, बिना प्रशिक्षण प्रक्रिया को बाधित किए।

संक्षेप में

वर्तमान AI प्रशिक्षण एक ऐसी कार चलाने जैसा है जिसमें हैंडब्रेक आंशिक रूप से लगा हुआ है: आप नए रास्तों को खोजने के लिए पर्याप्त तेज़ नहीं चल सकते, लेकिन यदि आप इसे छोड़ देते हैं, तो आप दुर्घटनाग्रस्त हो सकते हैं।

UP एक स्मार्ट क्रूज कंट्रोल स्थापित करने जैसा है:

  • यदि आप एक सुरक्षित, सही पथ पर चल रहे हैं, तो यह हैंडब्रेक को पूरी तरह से हटा देता है ताकि आप अपनी पूरी क्षमता तक पहुँच सकें।
  • यदि आप खाई (गलत पथ) की ओर बढ़ने लगते हैं, तो यह आपको सुरक्षित रखने के लिए तुरंत ब्रेक लगा देता है।

यह AI को जीनियस समाधानों की खोज में साहसी होने और साथ ही सीखने के लिए पर्याप्त स्थिर होने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →