← नवीनतम पेपर
🤖 machine learning

HPO: Hysteretic Policy Optimization for Stable and Efficient Training under Sparse-Reward Regime

यह शोधपत्र हिस्टेरेटिक पॉलिसी ऑप्टिमाइज़ेशन (HPO) और इसके अनुकूली संस्करण (A-HPO) को पेश करता है ताकि स्पार्स रिवॉर्ड्स के तहत GRPO-शैली के सुदृढीकरण शिक्षण (reinforcement learning) में शुरुआती प्रशिक्षण अस्थिरता को संबोधित किया जा सके, जो नकारात्मक-एडवांटेज अपडेट को कम भार देने और प्रति-रिस्पॉन्स लंबाई सामान्यीकरण को माध्य-लंबाई सामान्यीकरण से बदलने के माध्यम से विभिन्न बेंचमार्क और मॉडल स्केल्स में बेहतर प्रदर्शन और स्थिरता प्रदान करता है।

मूल लेखक: Mohamed Sana, Nicola Piovesan, Antonio De Domenico, Fadhel Ayed, Haozhe Zhang

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohamed Sana, Nicola Piovesan, Antonio De Domenico, Fadhel Ayed, Haozhe Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक कठिन पहेली हल करना सिखा रहे हैं, जैसे कि कोई जटिल गणित की समस्या या नेटवर्क ट्रबलशूटिंग का कार्य। आप रोबोट को एक प्रॉम्प्ट देते हैं, और वह उत्तर देने का प्रयास करता है। कभी-कभी वह सही उत्तर देता है; लेकिन ज्यादातर समय, विशेष रूप से शुरुआत में, वह गलत होता है।

यह शोध पत्र इन रोबोट्स को प्रशिक्षित करने का एक नया तरीका पेश करता है, जिसे हिस्टेरेटिक पॉलिसी ऑप्टिमाइज़ेशन (Hysteresis Policy Optimization - HPO) कहा जाता है। यह एक मौजूदा विधि (GRPO) में किया गया एक सुधार है जो सीखने की प्रक्रिया को बहुत तेज़ और स्थिर बनाता है जब रोबोट सही उत्तर खोजने के लिए संघर्ष कर रहा हो।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

समस्या: "शोर भरा क्लासरूम" (The Noisy Classroom)

वर्तमान प्रशिक्षण पद्धति (GRPO) में, शिक्षक (एल्गोरिदम) रोबोट द्वारा किए गए 8 प्रयासों के एक बैच को देखता है।

  1. "दुर्लभ सफलता" की समस्या (The "Rare Success" Problem): कठिन कार्यों में, रोबत 8 में से केवल 1 या 2 उत्तर ही सही दे पाता है। बाकी 6 गलत होते हैं।
  2. "वॉल्यूम" की समस्या (The "Volume" Problem): वर्तमान विधि हर गलत उत्तर को उतने ही गंभीर रूप से लेती है जितना कि एक सही उत्तर को। चूंकि गलत उत्तर बहुत अधिक हैं, इसलिए शिक्षक 1 बार "अच्छा काम किया!" कहने के बजाय 6 बार चिल्लाकर "ऐसा मत करो!" कहता है।
  3. "लंबाई" की समस्या (The "Length" Problem): वर्तमान विधि उत्तरों को उनकी लंबाई के आधार पर भी आंकती है।
    • यदि रोबोट एक छोटा सही उत्तर देता है, तो उसे एक बहुत बड़ा "अच्छा काम किया!" का प्रोत्साहन मिलता है।
    • यदि रोबोट एक लंबा, बड़बड़ाता हुआ गलत उत्तर देता है, तो "ऐसा मत करो!" की सजा इतने सारे शब्दों में बंट जाती है कि उसका प्रभाव कम हो जाता है।

परिणाम: रोबोट भ्रमित हो जाता है। वह गलत उत्तरों के शोर से अभिभूत हो जाता है और गलत उत्तरों की लंबी, भारी सजाओं से बचने के लिए बहुत छोटे, रैंडम उत्तर देने लगता है। यह एक ऐसे छात्र की तरह है जो, कई छोटी गलतियों के लिए 100 बार डांट खाने के बाद, पूरे वाक्य लिखना छोड़ देता है और बस "हाँ" या "नहीं" लिख देता है ताकि मामला जल्दी खत्म हो जाए।

समाधान: HPO (एक "स्मार्ट कोच")

लेखक प्रस्तावित करते हैं कि HPO एक स्मार्ट कोच की तरह काम करता है जो जानता है कि संघर्ष कर रहे छात्र को कैसे संभालना है। इसके पास दो मुख्य तरकीबें हैं:

1. "वॉल्यूम नॉब" (Hysteretic Weighting)

हर गलत उत्तर के साथ समान व्यवहार करने के बजाय, कोच नकारात्मक फीडबैक की आवाज़ (volume) को कम कर देता है।

  • उपमा: कल्पना कीजिए कि रोबोट एक कमरे में है जहाँ 6 लोग चिल्ला रहे हैं "गलत!" और 1 व्यक्ति फुसफुसा रहा है "सही!"
  • पुरानी विधि: कोच उन सभी 7 लोगों को समान रूप से सुनता है। "गलत!" वाला समूह "सही!" की फुसफुसाहट को दबा देता है।
  • HPO विधि: कोच "गलत!" वाले समूह पर "म्यूट बटन" लगा देता है। वे अभी भी उन्हें सुनते हैं, लेकिन वे आवाज़ को काफी कम कर देते हैं। इससे यह सुनिश्चित होता है कि दुर्लभ "सही!" की फुसफुसाहट वास्तव में सुनी जा सके और उससे सीखा जा सके।
  • अनुकूली संस्करण (A-HPO): यह सबसे स्मार्ट संस्करण है। कोच एक निश्चित म्यूट बटन का उपयोग नहीं करता है। इसके बजाय, वे वास्तविक समय में गिनते हैं कि कितने लोग "गलत!" बनाम "सही!" चिल्ला रहे हैं। यदि "गलत!" वाला समूह बहुत बड़ा है, तो वे उन्हें भारी रूप से म्यूट करते हैं। जैसे-जैसे रोबोट बेहतर होता है और "सही!" वाला समूह बढ़ता है, कोच धीरे-धीरे "गलत!" वाले समूह की आवाज़ को वापस बढ़ाता है ताकि रोबोट अपनी गलतियों से सीख सके।

2. "फेयर एवरेज" (Mean-Length Normalization)

कोच उत्तरों को उनके व्यक्तिगत लंबाई के आधार पर आंकना बंद कर देता है और उनके बजाय पूरे समूह की औसत लंबाई के आधार पर उन्हें आंकना शुरू करता है।

  • उपमा: पुरानी विधि में, एक छोटे, सही उत्तर को गोल्ड स्टार मिलता था, लेकिन एक लंबे, गलत उत्तर को एक छोटा, लगभग अदृश्य लाल 'X' मिलता था। इसने रोबोट को आलसी और संक्षिप्त होने के लिए प्रोत्साहित किया।
  • HPO विधि: कोच कहता है, "हम सभी को समूह के औसत प्रयास के आधार पर आंकेंगे।" यह रोबोट को केवल शब्दों की संख्या के आधार पर सिस्टम को चकमा देने की कोशिश करने से रोकता है। यह रोबोट को समस्या पर पूरी तरह से विचार करने के लिए प्रोत्साहित करता है, चाहे उसमें कितने भी शब्द क्यों न लगें।

प्रयोगों में क्या हुआ?

शोधकर्ताओं ने इसे दो कार्यों पर परखा:

  1. TeleLogs: जटिल 5G नेटवर्क त्रुटियों को ठीक करना (जैसे किसी रहस्य को सुलझाने वाला जासूस)।
  2. Countdown: एक गणित का खेल जहाँ आप लक्ष्य तक पहुँचने के लिए संख्याओं को जोड़ते हैं।

परिणाम:

  • तेज़ सीखना: नए तरीके (A-HPO) का उपयोग करने वाला रोबोट बहुत तेज़ी से सीखा, विशेष रूप से शुरुआत में जब वह बहुत अधिक विफल हो रहा था।
  • बेहतर स्कोर: नेटवर्क कार्य पर, नए तरीके ने 0.84 का स्कोर प्राप्त किया, जो पुराने तरीके (0.73) और अन्य प्रतिस्पर्धियों को महत्वपूर्ण अंतर से पीछे छोड़ देता है।
  • कोई "शॉर्ट-सर्किटिंग" नहीं: पुरानी विधि के विपरीत, जो कभी-कभी रोबोट को हार मानने और बहुत छोटे, बेकार उत्तर लिखने के लिए मजबूर करती थी, नया तरीका उत्तरों को लंबा और विचारशील बनाए रखता है जबकि सटीकता में भी सुधार करता है।

मुख्य निष्कर्ष (The Bottom Line)

जब आप AI को कोई कठिन कार्य सिखा रहे हों जहाँ वह अक्सर विफल होता है, तो आपको हर विफलता को हर सफलता के समान महत्वपूर्ण नहीं मानना चाहिए। यदि आप ऐसा करते हैं, तो AI अभिभूत हो जाता है और प्रयास करना छोड़ देता है।

HPO एक सरल समाधान है जो कहता है: "विफलताओं को सुनें, लेकिन उन्हें दुर्लभ सफलताओं को दबाने न दें। साथ ही, उत्तर की लंबाई को स्कोरिंग सिस्टम को धोखा देने न दें।" फीडबैक को संतुलित करके, AI अधिक कुशलता से सीखता है और कठिन समस्याओं को हल करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →