← नवीनतम पेपर
🤖 machine learning

PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

यह शोध पत्र PS-PPO का प्रस्ताव करता है, जो एक कंप्यूट-कुशल क्रिटिक-मुक्त (critic-free) RLHF विधि है जो केवल यादृच्छिक रूप से नमूना लिए गए प्रक्षेपवक्र उपसर्गों (trajectory prefixes) के माध्यम से बैकप्रोपैगेट करके और एक निष्पक्ष ग्रेडिएंट एस्टिमेटर बनाए रखने के लिए महत्व भारण (importance weighting) का उपयोग करके प्रशिक्षण लागत और मेमोरी उपयोग को कम करता है।

मूल लेखक: Doo Hwan Hwang, Kee-Eung Kim

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Doo Hwan Hwang, Kee-Eung Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत बुद्धिमान छात्र (एक AI) को जटिल गणितीय समस्याओं को हल करना सिखा रहे हैं। छात्र अपने सोचने की पूरी प्रक्रिया, चरण-दर-चरण, कागज के एक टुकड़े पर लिखता है। बिल्कुल अंत में, आप अंतिम उत्तर की जाँच करते हैं। यदि वह सही है, तो आप उसे एक गोल्ड स्टार देते हैं; यदि वह गलत है, तो आप एक रेड 'X' देते हैं।

समस्या: "पूरा कागज" वाला दंड (The "Whole Paper" Penalty)
वर्तमान तरीकों में (जिन्हें शोध पत्र "क्रिटिक-फ्री" बेसलाइन कहता है), जब छात्र को गोल्ड स्टार या रेड 'X' मिलता है, तो शिक्षक पूरे कागज को समान रूप से महत्वपूर्ण मानता है। वे फिर से हर एक शब्द को पहले वाक्य से लेकर अंतिम वाक्य तक दोबारा पढ़ते हैं, ताकि अगली बार सुधार करने के लिए वे क्या बदल सकते हैं, यह समझ सकें।

यह तरीका समय की बर्बादी है। अक्सर, जब तक छात्र समाधान का मध्य भाग लिख चुका होता है, तब तक यह स्पष्ट हो जाता है कि वह सही होने जा रहा है या गलत। अंतिम कुछ वाक्य केवल "फिलर" या दोहराव होते हैं। फिर भी, शिक्षक हर बार उन अंतिम कुछ वाक्यों के लिए कंप्यूटर को गणित की पुनर्गणना करने के लिए मजबूर करता है। यह उस किताब के आखिरी पन्ने को दोबारा पढ़ने जैसा है जिसे आप पहले ही जान चुके हैं कि उसका अंत क्या है, सिर्फ यह तय करने के लिए कि आपको कहानी पसंद आई या नहीं। यह बहुत अधिक ऊर्जा (कंप्यूटिंग पावर) और मेमोरी लेता है।

समाधान: PS-PPO (द "स्मार्ट स्निप")
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे PS-PPO (प्रिफिक्स-सैंपलिंग प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। इसे "स्मार्ट स्निप" (Smart Snip) रणनीति के रूप में सोचें।

पूरे कागज को हर बार दोबारा पढ़ने के बजाय, शिक्षक एक विशेष नियम का उपयोग करता है यह तय करने के लिए कि: "मुझे सीखने के लिए इस कागज के कितने हिस्से को वास्तव में दोबारा पढ़ने की आवश्यकता है?"

  1. "अनिश्चितता" का मीटर: शिक्षक छात्र के काम को लिखे जाने के दौरान देखता है। यदि छात्र एक ठोस योजना के साथ शुरुआत करता है, तो शिक्षक जानता है कि परिणाम पहले ही तय हो चुका है। शिक्षक कहता है, "ठीक है, मुझे आगे पढ़ने की आवश्यकता नहीं है।"
  2. रैंडम कट (Random Cut): शिक्षक रुकने के लिए एक स्थान (कटऑफ) बेतरतीब ढंग से चुनता है। शायद वे कागज के 30% के बाद रुकते हैं, या 70% के बाद।
  3. निष्पक्षता का तरीका (जादुई सूत्र): यह सबसे चतुर हिस्सा है। यदि शिक्षक केवल पहले 30% को पढ़ता है, तो हो सकता है कि वह बाद में हुई किसी महत्वपूर्ण चीज़ को मिस कर दे। इसे ठीक करने के लिए, शिक्षक एक गणितीय "निष्पक्षता समायोजन" (fairness adjustment) का उपयोग करता है।
    • यदि वे जल्दी रुक जाते हैं, तो वे पहले 30% शब्दों को उनके लेसन प्लान में अधिक महत्व (weight) देते हैं।
    • यदि वे देर से रुकते हैं, तो वे उन शब्दों को कम महत्व देते हैं।
    • परिणाम: भले ही वे कागज का केवल एक हिस्सा पढ़ते हैं, लेकिन कई, कई उदाहरणों के माध्यम से वे जो औसत सबक सीखते हैं, वह बिल्कुल वैसा ही होता है जैसा कि यदि उन्होंने हर बार पूरा कागज पढ़ा होता।

यह क्यों मायने रखता है
शोध पत्र ने कठिन गणितीय समस्याओं (जैसे हाई स्कूल प्रतियोगिताओं में पाई जाने वाली) पर इसका परीक्षण किया। यहाँ उन्होंने क्या पाया:

  • गति (Speed): क्योंकि कंप्यूटर वाक्य के अंत की गणना करना बंद कर देता है, इसलिए यह बहुत तेजी से प्रशिक्षित होता है। उन्होंने देखा कि प्रशिक्षण समय में लगभग 33% से 45% की कमी आई।
  • मेमोरी (Memory): यह कम कंप्यूटर मेमोरी (RAM) का उपयोग करता है, जो ऐसा है जैसे काम करने के लिए आपको एक छोटी डेस्क की आवश्यकता हो।
  • प्रदर्शन (Performance): कम पढ़ने के बावजूद, AI उतना ही अच्छा सीखता है जितना कि वे तरीके जो सब कुछ पढ़ते हैं। उसे भी उतने ही गोल्ड स्टार मिलते हैं।

"बजट" का उदाहरण
कल्पना कीजिए कि आपके पास अपने छात्र को सुधारने के लिए प्रतिदिन 100 "सोचने वाले टोकन" (thinking tokens) का बजट है।

  • पुराना तरीका: आप हर एक कागज पर सभी 100 टोकन खर्च करते हैं, भले ही पहले 20 टोकनों में ही गलती स्पष्ट हो गई हो। आप जल्दी ही ऊर्जा समाप्त कर देते हैं।
  • PS-PPO तरीका: आप अपने 100 टोकन बुद्धिमानी से खर्च करते हैं। आसान कागजों पर, आप 20 टोकन खर्च करते हैं। कठिन कागजों पर जहाँ गलती गहराई में छिपी होती है, आप 80 टोकन खर्च करते हैं। लेकिन क्योंकि आपके पास एक "निष्पक्षता समायोजन" है, आप अभी भी सही सबक सीखते हैं। आप उसी समय में अधिक कागजों को बिना गुणवत्ता खोए पूरा कर लेते हैं।

संक्षेप में
PS-PPO AI मॉडल को अधिक कुशल बनाने का एक तरीका है। यह महसूस करता है कि लंबे, जटिल तर्क कार्यों के लिए, कहानी का अंत अक्सर नई जानकारी नहीं जोड़ता है। कहानी के अंत को "स्निप" (काट) कर और मुआवजे के लिए गणितीय रूप से समायोजन करके, AI उतना ही अच्छा सीखता है लेकिन बहुत कम कंप्यूटर पावर और समय का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →