← नवीनतम पेपर
🤖 machine learning

SAVGO: Learning State-Action Value Geometry with Cosine Similarity for Continuous Control

SAVGO एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो एक संयुक्त अवस्था-क्रिया एम्बेडिंग स्पेस (state-action embedding space) को सीखकर प्रतिनिधित्व शिक्षण (representation learning), मूल्य अनुमान (value estimation) और नीति अनुकूलन (policy optimization) को एकीकृत करता है, जहाँ कोसाइन समानता (cosine similarity) क्रिया-मूल्य अनुमानों (action-value estimates) को दर्शाती है, जिससे निरंतर नियंत्रण कार्यों (continuous control tasks) में नीति अपडेट को उच्च-मूल्य वाले क्षेत्रों की ओर निर्देशित किया जा सके।

मूल लेखक: Stavros Orfanoudakis, Pedro P. Vergara

प्रकाशित 2026-05-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Stavros Orfanoudakis, Pedro P. Vergara

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कुत्ते को चलना सिखा रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) कहा जाता है। रोबोट अलग-अलग तरह की हरकतें करता है, अच्छा करने पर उसे एक "स्कोर" (इनाम) मिलता है, और वह अपनी गलतियों से सीखने की कोशिश करता है।

वर्तमान के अधिकांश तरीके एक ऐसे छात्र की तरह हैं जो केवल अगले कदम को देखता है। यदि रोबक एक कदम आगे बढ़ता है और उसे अच्छा स्कोर मिलता है, तो वह उस विशिष्ट कदम को दोहराना सीख जाता है। यदि वह एक कदम लेता है और उसे बुरा स्कोर मिलता है, तो वह उस विशिष्ट कदम से बचना सीख जाता है। यह बहुत ही स्थानीय (local), बहुत ही सतर्क है, और कभी-कभी छोटे, अक्षम आंदोलनों के चक्र में फंस जाता है।

यह पेपर एक नई विधि पेश करता है जिसे SAVGO (स्टेट-एक्शन वैल्यू ज्योमेट्री ऑप्टिमाइज़ेशन) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "मानसिक मानचित्र" (ज्यामिति/Geometry)

कल्पना कीजिए कि रोबोट के दिमाग में एक विशाल, अदृश्य 3D मानचित्र है। इस मानचित्र पर, रोबोट द्वारा की जा सकने वाली हर संभावित हरकत एक बिंदु (dot) है।

  • पुराना तरीका: रोबोट केवल एक-एक करके बिंदुओं को देखता है। "बिंदु A ने मुझे इनाम दिया। बिंदु B ने मुझे झटका दिया।"
  • SAVGO का तरीका: रोबोट यह सीखता है कि समान स्कोर वाले बिंदुओं को मानचित्र पर एक-दूसरे के करीब होना चाहिए, और बहुत अलग स्कोर वाले बिंदुओं को एक-दूसरे से दूर होना चाहिए।

SAVGO रोबोट को इन बिंदुओं को उनकी "अच्छाई" के आधार पर व्यवस्थित करना सिखाता है। यदि दो अलग-अलग पैर की हरकतें एक शानदार चाल का परिणाम देती हैं, तो रोबोट अपने मानसिक मानचित्र में उन्हें एक-दूसरे के बिल्कुल बगल में रखना सीख जाता है। यदि एक हरकत शानदार है और दूसरी बहुत खराब है, तो वह उन्हें मानचित्र के विपरीत दिशाओं में धकेल देता है।

2. "समूह मतदान" (पॉलिसी अपडेट)

यह सबसे महत्वपूर्ण हिस्सा है। जब रोबोट को यह तय करने की आवश्यकता होती है कि आगे क्या करना है, तो वह केवल एक एकल गतिविधि को नहीं चुनता और उसमें थोड़ा सुधार करने की कोशिश नहीं करता।

इसके बजाय, यह "समूह मतदान" (Group Voting) का खेल खेलता है:

  1. यह एक "उम्मीदवार" (candidate) हरकत चुनता है (एक रैंडम अनुमान)।
  2. यह अपने मानसिक मानचित्र से पूछता है: "इस उम्मीदवार के पास और कौन खड़ा है?"
  3. यह समान हरकतों का एक समूह (पड़ोसी) इकट्ठा करता है और उन सभी से पूछता है, "हम कितने अच्छे हैं?"
  4. यह इस पूरे समूह का एक भारित औसत (weighted average) निकालता है।

उपमा:
कल्पना कीजिए कि आप एक शहर में सबसे अच्छा रेस्टोरेंट खोजने की कोशिश कर रहे हैं।

  • पुराना तरीका: आप एक रेस्टोरेंट चुनते हैं, खाने का स्वाद लेते हैं, और यदि वह अच्छा है, तो अगली बार वहीं जाते हैं। यदि वह खराब है, तो आप फिर कभी वहां नहीं जाते।
  • SAVGO का तरीका: आप एक रेस्टोरेंट चुनते हैं, लेकिन फिर आप उसके आसपास के इलाके को देखते हैं। आप पूछते हैं, "क्या आस-पास और भी रेस्टोरेंट हैं जो उच्च रेटिंग वाले हैं?" यदि पूरा इलाका 5-स्टार जगहों से भरा है, तो आप जानते हैं कि आप एक "अच्छे क्षेत्र" में हैं। फिर आप अपने निर्णय को केवल उस एक स्थान की ओर नहीं, बल्कि उस पूरे क्षेत्र की ओर मोड़ देते हैं।

3. यह क्यों महत्वपूर्ण है

इस पेपर ने बहुत कठिन कार्यों पर परीक्षण किया, जैसे कि एक डिजिटल मानव को चलना सिखाना (जिसे "ह्यूमनॉइड" कहा जाता है) या एक डिजिटल चींटी को चलाना। ये किसी रस्सी पर संतुलन बनाने और साथ ही करतब दिखाने (juggling) जैसा है; इसमें विफल होने के हजारों सूक्ष्म तरीके हैं।

  • परिणाम: क्योंकि SAVGO अच्छी हरकतों के "आकार" (ज्यामिति) को देखता है और समान उम्मीदवारों के पूरे समूह से सीखता है, इसलिए यह पुराने तरीकों की तुलना में तेजी से और अधिक स्थिरता के साथ सीखता है।
  • चुनौती: इस "समूह मतदान" को करने के लिए थोड़े अधिक कंप्यूटर पावर की आवश्यकता होती है क्योंकि इसे एक साथ कई उम्मीदवारों की जांच करनी पड़ती है। हालांकि, पेपर दिखाता है कि सबसे कठिन कार्यों के लिए, यह अतिरिक्त प्रयास सार्थक है क्योंकि रोबोट इससे बहुत बेहतर सीखता है।

सारांश

SAVGO रोबोट की सीखने की शैली को "विशिष्ट उत्तरों को याद करने" से बदलकर "अच्छे उत्तरों के परिदृश्य (landscape) को समझने" में अपग्रेड करने जैसा है। केवल सही दिशा में एक छोटा कदम उठाने के बजाय, यह अच्छी संभावनाओं की पूरी पहाड़ी को देखता है और अधिक आत्मविश्वास के साथ उसके शिखर की ओर बढ़ता है।

यह पेपर क्या दावा नहीं करता है:

  • यह दावा नहीं करता कि यह अभी वीडियो गेम (जैसे अटरी/Atari) के लिए काम करता है; यह चलने या दौड़ने जैसी निरंतर गतिविधियों पर केंद्रित है।
  • यह दावा नहीं करता कि यह रोबोट की सभी समस्याओं को ठीक कर देता है; यह विशेष रूप से तब मदद करता है जब रोबोट के पास हिलने-डुलने के कई अलग-अलग तरीके हों (high-dimensional tasks)।
  • यह चिकित्सा या नैदानिक उपयोगों का उल्लेख नहीं करता है; यह पूरी तरह से कंप्यूटर सिमुलेशन में रोबोट को प्रशिक्षित करने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →