← नवीनतम पेपर
🤖 machine learning

A Harmonic Mean Formulation of Average Reward Reinforcement Learning in SMDPs

यह योगदान गैर-स्थिर (non-stationary) सेमी-मार्कोव निर्णय प्रक्रियाओं में औसत पुरस्कार दरों की सही गणना करने के लिए एक नवीन संशोधित हार्मोनिक माध्य ऑपरेटर प्रस्तुत करता है, जिससे मौजूदा अनुपात-आधारित दृष्टिकोणों की सीमाओं को दूर करते हुए सुदृढ़ मॉडल-मुक्त सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम सक्षम होते हैं।

मूल लेखक: Erel Shtossel, Alicia Vidler, Uri Shaham, Gal A. Kaminka

प्रकाशित 2026-05-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Erel Shtossel, Alicia Vidler, Uri Shaham, Gal A. Kaminka

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा में और रोज़मर्रा के उदाहरणों के साथ शोध पत्र (paper) का स्पष्टीकरण दिया गया है।

मुख्य विचार: "स्पीडोमीटर" की समस्या

कल्पना कीजिए कि आप एक डिलीवरी ड्राइवर हैं और यह पता लगाने की कोशिश कर रहे हैं कि कौन सा रास्ता सबसे तेज़ है। आपके पास दो विकल्प हैं:

  • मार्ग A: आप 10 मिनट में 10 मील चलते हैं।
  • मार्ग B: आप 20 मिनट में 20 मील चलते हैं।

दोनों ही समान समय प्रति मील (1 मिनट प्रति मील) लेते हुए प्रतीत होते हैं। लेकिन क्या होगा अगर ट्रैफ़िक बदल जाए? क्या होगा अगर मार्ग A सोमवार को तेज़ हो लेकिन मंगलवार को 2 घंटे के ट्रैफिक जाम में फंस जाए, जबकि मार्ग B स्थिर रहता है?

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, विशेष रूप से रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) में, एजेंटों (जैसे रोबोट या ट्रेडिंग बॉट्स) को एक लंबी, अंतहीन यात्रा के दौरान अपनी सबसे अच्छी "औसत गति" (रिवॉर्ड रेट) सीखनी होती है। यह शोध पत्र तर्क देता है कि AI द्वारा इस औसत गति की गणना करने के लिए उपयोग किए जाने वाले वर्तमान उपकरण तब टूट जाते हैं जब यात्रा अप्रत्याशित होती है।

पुराना तरीका: "औसत का औसत" वाली गलती

यह शोध पत्र दो मौजूदा तरीकों (जिन्हें SMART और Relaxed-SMART कहा जाता है) की जांच करता है जो सर्वोत्तम औसत गति की गणना करने का प्रयास करते हैं।

  • दोष: ये तरीके औसत गति की गणना कुल तय की गई दूरी को कुल खर्च किए गए समय से विभाजित करके करते हैं।
    • उदाहरण: कल्पना कीजिए कि आपने 10 घंटे में 100 मील की यात्रा की। आप कहते हैं: "ठीक है, आपकी औसत गति 10 मील प्रति घंटा है।"
    • समस्या: यह तब अच्छा काम करता है जब आपकी गति स्थिर हो। लेकिन यदि आपकी गति बहुत अधिक बदलती है (कभी आप घंटों तक ट्रैफिक में फंसे रहते हैं, तो कभी आप हाईवे पर तेज़ दौड़ते हैं), तो कुल दूरी को कुल समय से विभाजित करने का सरल तरीका भ्रामक संख्या दे सकता है। यह 10 मिनट की यात्रा और 10 घंटे की यात्रा को केवल "दो यात्राओं" के रूप में मानता है, बिना यह पहचाने कि रिवॉर्ड (इनाम) का समय कितना महत्वपूर्ण है।

लेखक दिखाते हैं कि पुराने तरीके तब गणितीय रूप से गलत गणना करते हैं जब आपके रिवॉर्ड (कमाई गई राशि) और आपका समय (एक कार्य में कितना समय लगता है) एक-दूसरे से जुड़े होते हैं (जैसे, आपको बड़ा रिवॉर्ड तभी मिलता है जब आप लंबे समय तक प्रतीक्षा करते हैं)। वे यह मान लेते हैं कि इन दोनों का आपस में कोई संबंध नहीं है, जैसे सेब और संतरे को मिलाना, जबकि वास्तव में वे अक्सर जुड़े होते हैं।

नया समाधान: "हार्मोनिक मीन" (Harmonic Mean)

लेखक हार्मोनिक मीन नामक एक गणितीय उपकरण का उपयोग करके औसत निकालने का एक नया तरीका प्रस्तावित करते हैं।

  • उदाहरण: एक गंतव्य तक जाने और वापस आने की यात्रा के बारे में सोचें।
    • आप 20 मील प्रति घंटा की गति से जाते हैं।
    • आप 40 मील प्रति घंटा की गति से वापस आते हैं।
    • गलत गणित (अरिथमेटिक मीन): (20+40)/2=30(20 + 40) / 2 = 30 मील प्रति घंटा।
    • सही गणित (हार्मोनिक मीन): चूंकि आपने धीमी गति (20 मील प्रति घंटा) पर अधिक समय बिताया, इसलिए आपकी पूरी यात्रा की वास्तविक औसत गति 40 के बजाय 20 के करीब है। सही उत्तर लगभग 26.7 मील प्रति घंटा है।

दरों (जैसे गति या प्रति मिनट लाभ) का औसत निकालने के लिए हार्मोनिक मीन सही तरीका है। हालाँकि, एक समस्या है: मानक हार्मोनिक मीन तब विफल हो जाता है जब आपकी गति शून्य हो (आप शून्य से विभाजित नहीं कर सकते) या यदि आपकी गति नकारात्मक हो (पीछे की ओर चलना)। वास्तविक जीवन में, AI एजेंट अक्सर शून्य रिवॉर्ड प्राप्त करते हैं या नुकसान (नकारात्मक रिवॉर्ड) झेलते हैं।

नवाचार: "संशोधित हार्मोनिक मीन" (Modified Harmonic Mean)

इस टूटी हुई गणित को ठीक करने के लिए, लेखकों ने एक संशोधित हार्मोनिक मीन का आविष्कार किया है।

  • यह कैसे काम करता है: कल्पना कीजिए कि एक स्मार्ट कैलकुलेटर आपकी यात्राओं को तीन ढेरों में छाँटता है:
    1. सकारात्मक यात्राएं (आपने पैसा कमाया)।
    2. नकारात्मक यात्राएं (आपने पैसा गंवाया)।
    3. शून्य यात्राएं (आप बराबर रहे/नो प्रॉफिट-नो लॉस)।
  • यह सकारात्मक और नकारात्मक यात्राओं के लिए अलग-अलग "हार्मोनिक औसत" की गणना करता है। फिर यह उन्हें आपस में मिलाता है और "शून्य" यात्राओं को तटस्थ (neutral) मानता है।
  • परिणाम: यह नया कैलकुलेटर वास्तविक दुनिया के जटिल डेटा को संभाल सकता है जहाँ आप कभी पैसा हारते हैं, कभी कमाते हैं, और कभी बस खाली बैठे रहते हैं। यह आपके रिवॉर्ड की वास्तविक "गति" को सही ढंग से निर्धारित करता है, भले ही वातावरण अराजक क्यों न हो।

नया एल्गोरिदम: "हार्मोनिक R-लर्निंग" (Harmonic R-Learning)

इस नए गणित का उपयोग करके, लेखकों ने एक नया AI लर्निंग एल्गोरिदम बनाया है जिसे Harmonic R-Learning कहा जाता है।

  • यह क्या करता है: यह उन स्थितियों में निर्णय लेना सीखता है जहाँ कार्यों में अलग-अलग समय लगता है (जैसे स्टॉक की कीमत बढ़ने का इंतज़ार करना बनाम तुरंत बेचना)।
  • यह बेहतर क्यों है: यह तब भ्रमित नहीं होता जब "रिवॉर्ड" और "समय" आपस में जुड़े होते हैं। यह एक क्रिया के वास्तविक मूल्य को पहचानता है, जबकि पुराने एल्गोरिदम किसी धीमी लेकिन जोखिम भरी क्रिया को केवल इसलिए महान मान सकते हैं क्योंकि उसका कुल रिवॉर्ड अधिक था।

प्रमाण: दो परीक्षण

लेखकों ने अपने नए एल्गोरिदम का पुराने एल्गोरिदम के विरुद्ध दो परिदृश्यों में परीक्षण किया:

  1. "नकली" ट्रैफिक टेस्ट: उन्होंने एक सरल कंप्यूटर सिमुलेशन बनाया जहाँ एक रास्ता पहली नज़र में अच्छा लग रहा था लेकिन वास्तव में वह एक जाल था, और दूसरा रास्ता जो धीमा लग रहा था लेकिन लंबे समय में विजेता था।

    • परिणाम: पुराने एल्गोरिदम भ्रमित हो गए और गलत रास्ता चुन लिया। नया Harmonic R-Learning इस चाल को समझ गया और सही रास्ता चुना।
  2. बिटकॉइन ट्रेडिंग टेस्ट: उन्होंने बिटकॉइन ट्रेडिंग के वास्तविक डेटा का उपयोग किया। बिटकॉइन बहुत उतार-चढ़ाव वाला है; कीमतें ऊपर-नीचे होती रहती हैं, और कभी-कभी आप एक स्थिति को लंबे समय तक बनाए रखते हैं, तो कभी एक सेकंड के लिए।

    • परिणाम: जब समय बिताने और कमाए गए पैसे के बीच संबंध था (जो कि एक सामान्य वास्तविक दुनिया का परिदृश्य है), तो नए एल्गोरिदम ने पुराने एल्गोरिदम की तुलना में अधिक लाभ कमाया। जब वे आपस में जुड़े नहीं थे, तब भी नए एल्गोरिदम ने उतना ही अच्छा प्रदर्शन किया, जिससे सिद्ध होता है कि इसे उपयोग करने में कोई नुकसान नहीं है।

सारांश

यह शोध पत्र कहता है: "AI में औसत रिवॉर्ड की गणना करने का पुराना तरीका ऐसा है जैसे गति पर विचार किए बिना औसत गति निकालना। यह विफल हो जाता है जब दुनिया अव्यवस्थित होती है। हमने एक नया 'संशोधित हार्मोनिक मीन' कैलकुलेटर बनाया है जो जटिल डेटा (शून्य और नकारात्मक) को संभाल सकता है और AI को सही औसत गति प्रदान करता है, जिससे इसे जटिल और परिवर्तनशील वातावरण में बेहतर निर्णय लेने में मदद मिलती है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →