← नवीनतम पेपर
📊 statistics

Proximal Policy Optimization for Amortized Discrete Sampling

यह शोध पत्र GFlowNets और एंट्रॉपी-रेगुलराइज्ड सुदृढीकरण शिक्षण (reinforcement learning) के बीच सैद्धांतिक संबंध स्थापित करता है ताकि विभिन्न बेंचमार्क पर संरचित असतत वितरणों (structured discrete distributions) से नमूने लेने के लिए स्टोकेस्टिक नीतियों को प्रशिक्षित करने हेतु प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन (PPO) की बेहतर अभिसरण (convergence) और डेटा दक्षता को व्युत्पन्न और प्रदर्शित किया जा सके।

मूल लेखक: Anna Zykova-Myzina, Timofei Gritsaev, Daniil Tiapkin, Nikita Morozov

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anna Zykova-Myzina, Timofei Gritsaev, Daniil Tiapkin, Nikita Morozov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक विशिष्ट, जटिल रेसिपी को फिर से बनाने की कोशिश कर रहे हैं ताकि वह व्यंजन बिल्कुल उस प्रसिद्ध, पुरस्कार विजेता भोजन जैसा स्वाद दे सके। हालाँकि, आपके पास रेसिपी कार्ड नहीं है। आपके पास केवल सामग्रियों की एक सूची (इनाम/रिवॉर्ड) है जो आपको बताती है कि यदि आप इसे सही ढंग से बनाते हैं तो व्यंजन का स्वाद कितना अच्छा होगा, लेकिन आपको यह नहीं पता कि ब्रह्मांड में कुल कितने संभावित व्यंजन हो सकते हैं या पूर्णता प्राप्त करने के लिए आवश्यक सटीक अनुपात क्या है।

यह वह समस्या है जिसे यह पेपर हल करता है: कंप्यूटर को यादृच्छिक रूप से आइटम (जैसे अणु या डीएनए अनुक्रम) बनाने के लिए कैसे सिखाया जाए ताकि वे एक विशिष्ट, वांछित पैटर्न का पालन करें, न कि केवल एक "सर्वश्रेष्ठ" आइटम खोजने के लिए?

यहाँ उनके समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है।

1. समस्या: "सर्वश्रेष्ठ" का जाल बनाम "सही मिश्रण"

कई कंप्यूटर कार्यों में, एल्गोरिदम को एक एकल सबसे अच्छे समाधान को खोजने के लिए प्रशिक्षित किया जाता है (जैसे पहाड़ पर सबसे ऊँची चोटी खोजना)। लेकिन रसायन विज्ञान या जीव विज्ञान जैसे क्षेत्रों में, आपको अक्सर समाधानों की एक पूरी विविधता की आवश्यकता होती जो एक विशिष्ट वितरण (distribution) का पालन करती हो। आप केवल उच्चतम ऊर्जा वाला एक अणु नहीं चाहते; आप विविध अणुओं का एक समूह चाहते हैं जो एक विशिष्ट प्रायिकता वक्र (probability curve) से मेल खाता हो।

लेखक GFlowNets (जेनरेटिव फ्लो नेटवर्क्स) नामक एक ढांचे का उपयोग करते हैं। एक GFlowNet को एक फैक्ट्री असेंबली लाइन के रूप में सोचें। मशीन एक वस्तु को चरण-दर-चरण बनाती है (एक समय में एक लेगो ब्रिक जोड़ते हुए)। लक्ष्य मशीन को इस तरह ट्यून करना है कि यदि आप इसे दस लाख बार चलाते हैं, तो तैयार उत्पादों का अंतिम ढेर ठीक उसी लक्षित वितरण के समान दिखे जो आप चाहते हैं।

2. पुराना तरीका: "मैपमेकर" का संघर्ष

पहले, इन फैक्ट्रियों को प्रशिक्षित करने के लिए "वैल्यू-बेस्ड" (मूल्य-आधारित) तरीकों पर भरोसा किया जाता था।

  • उपमा: कल्पना करें कि आप हर एक पथ का सटीक मानचित्र बनाने और हर पाइप के माध्यम से पानी के सटीक "प्रवाह" की गणना करने के लिए एक भूलभुलैया (maze) में नेविगेट करने की कोशिश कर रहे हैं।
  • समस्या: इस मानचित्र को बनाने के लिए, आपको भूलभुलैया के कुल आकार (एक संख्या जिसे "नॉर्मलाइजिंग कांस्टेंट" या ZZ कहा जाता है) को जानना आवश्यक है। जटिल समस्याओं में, इस संख्या की गणना करना अत्यंत कठिन है, जैसे रेत के वजन को जानने के लिए समुद्र तट पर रेत के प्रत्येक कण को गिनने की कोशिश करना। यदि आपका मानचित्र थोड़ा भी गलत है, तो पूरी प्रशिक्षण प्रक्रिया अटक जाएगी या बहुत अक्षम हो जाएगी।

3. नया तरीका: "ट्रायल-एंड-एरर" कोच (PPO)

लेखकों ने सुदृढीकरण शिक्षण (Reinforcement Learning - RL) में उपयोग किए जाने वाले एक अलग दृष्टिकोण को आज़माया, विशेष रूप से एक एल्गोरिदम जिसे PPO (प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है।

  • उपमा: एक मानचित्र बनाने के बजाय, कल्पना करें कि एक कोच फैक्ट्री मशीन के बगल में खड़ा है। कोच मशीन को कुछ आइटम बनाते हुए देखता है, देखता है कि वे कितने अच्छे हैं, और कहता है, "हे, जब आपने वह नीला ब्रिक जोड़ा, तो आप थोड़े अधिक आक्रामक थे। अगली बार, थोड़ा और कोमल रहें।"
  • लाभ: कोच को समुद्र तट के कुल आकार को जानने या एक आदर्श मानचित्र बनाने की आवश्यकता नहीं है। उन्हें बस तत्काल परिणामों को देखने और मशीन को सही दिशा में धकेलने की आवश्यकता है। यह बहुत अधिक डेटा-कुशल (data-efficient) है।

4. ट्विस्ट: मानक PPO क्यों विफल हुआ

लेखकों ने मानक PPO का उपयोग करने की कोशिश की, लेकिन वह विफल रहा।

  • विफलता: मानक PPO एक एकल सर्वश्रेष्ठ परिणाम (सबसे ऊँची चोटी) खोजने के लिए डिज़ाइन किया गया है। यदि आप केवल फैक्ट्री को "सबसे स्वादिष्ट व्यंजन बनाएं" कहते हैं, तो वह विविधता बनाना बंद कर देगी और केवल वही एक व्यंजन बनाती रहेगी जो सबसे अच्छा स्वाद देता है। यह एक ही मोड (mode) में सिमट जाता है।
  • लापता सामग्रियां: लेखकों ने महसूस किया कि विविधता के लिए (सैंपलिंग के लिए) PPO को काम करने के लिए दो विशिष्ट चीजों की कमी थी:
    1. "बैकवर्ड" सुराग: आपको मशीन को न केवल अंत में मिलने वाले इनाम के बारे में बताना होगा, बल्कि इस बारे में भी कि वह वहां तक कैसे पहुंची (इतिहास)। यह शेफ को बताने जैसा है, "न केवल केक अच्छा है, बल्कि जिस तरह से आपने अंडे फेंटे थे वह भी महत्वपूर्ण था।"
    2. "एन्ट्रॉपी" बोनस: आपको मशीन को स्पष्ट रूप से अनिश्चित होने या अन्वेषण (exploration) करने के लिए पुरस्कृत करना चाहिए। यदि मशीन बहुत अधिक आत्मविश्वासी है, तो आप उसे दंडित करते हैं। यह उसे विभिन्न पथों का पता लगाने के लिए मजबूर करता है बजाय इसके कि वह एक ही पथ पर टिक जाए।

5. समाधान: "Ent-PPO"

पेपर में Ent-PPO (एन्ट्रोपिक प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन) पेश किया गया है। यह कोच का एक कस्टम-ट्यून किया गया संस्करण है।

  • यह कैसे काम करता है: यह मानक PPO के "क्लिपिंग" तंत्र (जो कोच को बहुत अधिक उग्र और अस्थिर सलाह देने से रोकता है) को एक नए गणितीय "ट्रस्ट रीजन" के साथ जोड़ता है जो एन्ट्रॉपी बोनस से प्राप्त होता है।
  • परिणाम: यह नया कोच सफलतापूर्वक फैक्ट्री को उच्च-गुणवत्ता वाले विविध आइटमों का मिश्रण बनाने के लिए सिखाता है जो आपके लक्षित वितरण से पूरी तरह मेल खाता है।

6. परिणाम: तेज़ और बेहतर

लेखकों ने कई "प्लेग्राउंड्स" पर इसका परीक्षण किया:

  • सिंथेटिक ग्रिड्स: सरल डिजिटल भूलभुलैया।
  • डीएनए अनुक्रम: डीएनए के ऐसे स्ट्रिंग्स बनाना जो विशिष्ट प्रोटीनों से जुड़ते हैं।
  • अणु (Molecules): रासायनिक संरचनाएं उत्पन्न करना।

निष्कर्ष:

  • गति: Ent-PPO पुराने "मैपमेकर" तरीकों (जैसे Trajectory Balance या Detailed Balance) की तुलना में बहुत तेजी से सीखा।
  • दक्षता: इसे काम पूरा करने के लिए बहुत कम प्रयासों (samples) की आवश्यकता पड़ी।
  • स्थिरता: पुराने तरीके अक्सर अटक जाते थे या खराब परिणाम देते थे यदि गणित एकदम सटीक नहीं होता। Ent-PPO मजबूत और स्थिर था, भले ही समस्याएँ बहुत बड़ी और जटिल (जैसे पूर्ण आणविक ग्राफ उत्पन्न करना) हो गईं।

सारांश

यह पेपर अनिवार्य रूप से कह रहा है: "हमने बड़े भाषा मॉडल (LLMs) के लिए उपयोग किए जाने वाले एक शक्तिशाली प्रशिक्षण उपकरण (PPO) को लिया, दो विशिष्ट बग्स को ठीक किया जो इसे 'सैंपलिंग' कार्यों में विफल बना रहे थे, और यह साबित किया कि यह अब अणुओं और डीएनए जैसे विविध, जटिल संरचनाओं को उत्पन्न करने के लिए सबसे अच्छा तरीका है, जो पिछले अत्याधुनिक (state-of-the-art) तरीकों को भी पीछे छोड़ देता है।"

उन्होंने केवल इसे करने का एक नया तरीका नहीं खोजा; उन्होंने एक ऐसा तरीका खोजा जो तेज़ है, कम डेटा का उपयोग करता है, और अधिक स्थिर है, जिससे यह जटिल डिस्क्रीट डेटा उत्पन्न करने वाले किसी भी व्यक्ति के लिए एक महत्वपूर्ण अपग्रेड बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →