← नवीनतम पेपर
🤖 machine learning

CayleyPy RL: Pathfinding and Reinforcement Learning on Cayley Graphs

यह शोध पत्र CayleyPy परियोजना प्रस्तुत करता है, जो विशाल Cayley ग्राफ पर पाथफाइंडिंग को कुशलतापूर्वक हल करने के लिए डिफ्यूजन डिस्टेंस विधियों के साथ सुदृढीकरण लर्निंग (reinforcement learning) को जोड़ता है, जो GAP जैसे शास्त्रीय उपकरणों से सफलतापूर्वक पार पाकर, सिमेट्रिक ग्रुप के व्यास (diameter) के संबंध में OEIS-A186783 अनुमान के लिए पुख्ता प्रमाण प्रदान करता है, और नए सैद्धांतिक बंध स्थापित करते हुए Kaggle चुनौतियों के माध्यम से सामुदायिक भागीदारी को आमंत्रित करता है।

मूल लेखक: A. Chervov, M. Obozov, A. Soibelman, S. Lytkin, I. Kiselev, S. Fironov, A. Lukyanenko, A. Dolgorukova, A. Ogurtsov, F. Petrov, S. Krymskii, M. Evseev, L. Grunvald, D. Gorodkov, G. Antiufeev, G. Verbii
प्रकाशित 2026-05-19
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: A. Chervov, M. Obozov, A. Soibelman, S. Lytkin, I. Kiselev, S. Fironov, A. Lukyanenko, A. Dolgorukova, A. Ogurtsov, F. Petrov, S. Krymskii, M. Evseev, L. Grunvald, D. Gorodkov, G. Antiufeev, G. Verbii, V. Zamkovoy, L. Cheldieva, I. Koltsov, A. Sychev, A. Eliseev, S. Nikolenko, N. Narynbaev, R. Turtayev, N. Rokotyan, S. Kovalev, A. Rozanov, V. Nelin, S. Ermilov, L. Shishina, D. Mamayeva, A. Korolkova, K. Khoruzhii, A. Romanov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: दर्पणों के भूलभुलैया में घर पहुँचने का सबसे छोटा रास्ता

कल्पना कीजिए कि आप एक विशाल, अनंत भूलभुलैया में हैं। लेकिन यह सामान्य दीवारों वाली भूलभुलैया नहीं है; यह नियमों से बनी एक भूलभुलैया है। हर बार जब आप एक कदम उठाते हैं, तो आप एक विशिष्ट नियम का पालन करते हैं जो आपकी स्थिति को बदल देता है। गणित में, इसे केली ग्राफ (Cayley graph) कहा जाता है।

इस शोध पत्र का लक्ष्य एक विशिष्ट प्रकार की भूलभुलैया को हल करना है: LRX भूलभुलैया। यह भूलभुलैया ताश की गड्डी (या संख्याओं के क्रम) को शफल करने के नियमों का उपयोग करके बनाई गई है।

  • नियम L: सब कुछ एक स्थान बाईं ओर खिसका दें।
  • नियम R: सब कुछ एक स्थान दाईं ओर खिसका दें।
  • नियम X: पहले दो आइटम्स को आपस में बदल दें।

चुनौती यह है: यदि आप ताश की गड्डी को एक अस्त-व्यस्त क्रम में शुरू करते हैं, तो उन्हें वापस सही क्रम में लाने के लिए 'Left', 'Right' और 'Swap' (बदलने) के मूव्स का सबसे छोटा क्रम क्या होगा?

समस्या: भूलभुलैया इंसानों (और पुराने कंप्यूटरों) के लिए बहुत बड़ी है

ताश की छोटी गड्डी के लिए, एक इंसान या एक मानक कंप्यूटर प्रोग्राम (जैसे प्रसिद्ध गणित सॉफ्टवेयर GAP) समाधान निकाल सकता है। लेकिन जैसे-जैसे कार्डों की संख्या (nn) बढ़ती है, संभावित व्यवस्थाओं की संख्या विस्फोट की तरह बढ़ती जाती है।

  • n=20n=20 के लिए, भूलभुलैया बहुत बड़ी है।
  • n=100n=100 के लिए, भूलभुलैया इतनी बड़ी है कि इसमें ब्रह्मांड के परमाणुओं से भी अधिक रास्ते हैं।

पुराने कंप्यूटर प्रोग्राम अटक जाते हैं। वे हर एक रास्ते का नक्शा बनाने की कोशिश करते हैं, मेमोरी खत्म हो जाती है और वे हार मान लेते हैं। लेखक यह देखना चाहते थे कि क्या आर्टिफिशियल इंटेलिजेंस (AI) एक स्मार्ट खोजकर्ता की तरह काम कर सकता है ताकि वह हर इंच का नक्शा बनाए बिना इन विशाल भूलभुलभैयाओं के माध्यम से रास्ता खोज सके।

समाधान: AI को "अनुमान" लगाना सिखाना

लेखकों ने CayleyPy RL नामक एक सिस्टम बनाया। इसे एक रोबोट को भूलभुलैया में रास्ता दिखाना सिखाने की तरह समझें। उन्होंने रीइन्फोर्समेंट लर्निंग (RL) नामक एक विधि का उपयोग किया।

उन्होंने रोबोट को कैसे प्रशिक्षित किया, इसके लिए एक सरल उपमा यहाँ दी गई है:

1. "वॉर्म-अप" (डिफ्यूजन डिस्टेंस)
कल्पना कीजिए कि आप पानी के गिलास में स्याही की एक बूंद गिराते हैं। स्याही बेतरतीब ढंग से फैल जाती है। यदि आप जानना चाहते हैं कि कोई विशिष्ट बिंदु केंद्र से कितनी दूर है, तो आप देख सकते हैं कि स्याही वहां तक पहुँचने में कितना समय लेती है।

  • AI ने सबसे पहले लाखों "रैंडम वॉक" (जैसे स्याही का फैलना) को देखकर सीखा। उसे सबसे छोटा रास्ता नहीं पता था, लेकिन उसने दूरी का एक "एहसास" विकसित कर लिया। वह जानता था, "अगर मैं यहाँ हूँ, तो आमतौरकर घर पहुँचने में लगभग 50 रैंडम स्टेप्स लगेंगे।"
  • इसने AI को एक मोटा नक्शा तो दिया, लेकिन यह एकदम सटीक नहीं था।

2. "स्मार्ट ट्रेनिंग" (रीइन्फोर्समेंट लर्निंग)
इसके बाद, उन्होंने AI को अधिक स्मार्ट बनाया। केवल रैंडम वॉक के आधार पर अनुमान लगाने के बजाय, उन्होंने डीप Q-लर्निंग (Deep Q-Learning) नामक तकनीक का उपयोग किया।

  • कल्पना कीजिए कि AI एक ऐसा खेल खेल रहा है जहाँ उसे हर कदम के लिए "पेनल्टी" (जुर्माना) मिलती है। वह कम से कम पेनल्टी के साथ फिनिश लाइन तक पहुँचना चाहता है।
  • AI ने अलग-अलग मूव्स आजमाए, देखा कि कौन से मूव्स उसे करीब ले जाते हैं, और अपने दिमाग (न्यूरल नेटवर्क) को बेहतर अनुमान लगाने के लिए समायोजित किया।
  • नवाचार: उन्होंने "स्याही के फैलने" वाले अंतर्ज्ञान को "खेल खेलने" वाले तर्क के साथ जोड़ा। इससे AI को उन "डेड एंड्स" (बंद रास्तों) में फंसने से बचने में मदद मिली जो आमतौर पर सरल एल्गोरिदम को फंसा देते हैं।

3. "बीम सर्च" (खोजकर्ताओं की एक टीम)
यह सबसे महत्वपूर्ण हिस्सा है। कल्पना कीजिए कि आप भूलभुलैया में एक खोजकर्ता भेज रहे हैं। यदि वह गलत मोड़ लेता है, तो आप हार जाते हैं।

  • इसके बजाय, लेखकों ने खोजकर्ताओं की एक टीम (एक "बीम") भेजी।
  • हर चौराहे पर, टीम विभाजित होती है। वे शीर्ष 10,000 सबसे आशाजनक रास्तों को रखते हैं और खराब रास्तों को हटा देते हैं।
  • इतने बड़े दल (कुछ मामलों में लाखों रास्ते) को बनाए रखकर, AI यह सुनिश्चित करता है कि भले ही अधिकांश खोजकर्ता भटक जाएं, कम से कम एक को सबसे छोटा और सटीक रास्ता मिल जाए।

"जादुई ट्रिक" (X-ट्रिक)

लेखकों को एक छोटी सी शॉर्टकट ट्रिक मिली। उनके कोड में, उन्होंने एक सिंगल लॉजिक जोड़ा:

  • यदि पहले दो कार्ड पहले से ही सही क्रम में हैं, तो उन्हें बदलें नहीं।

यह एक इंसान के लिए बहुत स्पष्ट लगता है, लेकिन कंप्यूटर के लिए यह गेम-चेंजर साबित हुआ। इस छोटी सी नियम, जिसे उन्होंने "X-ट्रिक" कहा, ने उनके AI को 100 कार्डों (n=100n=100) वाली भूलभुलैया को हल करने में सक्षम बनाया।

  • ट्रिक के बिना: AI केवल लगभग 40 कार्डों को संभाल सकता था।
  • ट्रिक के साथ: इसने 100+ कार्डों को संभाला, जो पुराने कंप्यूटर सॉफ्टवेयर (GAP) को पछाड़ दिया जो 20 कार्डों के आसपास क्रैश हो जाता था।

उन्होंने क्या सिद्ध किया? (गणित का हिस्सा)

केवल एक तेज़ सॉल्वर बनाने के अलावा, उन्होंने इन भूलभुलैयाओं के बारे में गणितीय खोज करने के लिए अपने AI का उपयोग किया:

  1. "गॉड्स नंबर" (God's Number) का अनुमान: गणित में एक प्रसिद्ध अनुमान है कि nn कार्डों के सबसे कठिन शफल के लिए ठीक n(n1)/2n(n-1)/2 मूव्स की आवश्यकता होती है। AI ने बहुत बड़ी संख्याओं के लिए इसका परीक्षण किया और कभी भी ऐसा शफल नहीं पाया जो इससे अधिक कठिन हो। यह इस विचार का पुरजोर समर्थन करता है कि यह फॉर्मूला पूर्ण सीमा है।
  2. "सबसे लंबा" शफल: उन्होंने सबसे अराजक संभव शफल (लॉन्गेस्ट एलिमेंट) की पहचान की और यह सिद्ध किया कि इसे मूव्स में कैसे तोड़ा जाए।
  3. नई सीमाएँ (New Bounds): उन्होंने गणितीय रूप से सिद्ध किया कि भूलभुलैया एक निश्चित आकार से छोटी नहीं हो सकती और दूसरे आकार से बड़ी नहीं हो सकती, जिससे उत्तर काफी सीमित हो गया।
  4. भूलभुलैया का आकार: उन्होंने पाया कि यदि आप शुरुआत से प्रत्येक दूरी पर कितने शफल मौजूद हैं, तो गिनती एक परफेक्ट बेल कर्व (सामान्य वितरण) का पालन नहीं करती है। इसके बजाय, वे एक अजीब, टेढ़े-मेढ़े आकार का पालन करते हैं जिसे गमबेल डिस्ट्रीब्यूशन (Gumbel distribution) कहा जाता है।

परिणाम: AI बनाम पुराना गार्ड

यह पेपर उनके नए AI मेथड की तुलना मानक कंप्यूटर अलजेब्रा सिस्टम GAP से करता है:

  • GAP: लगभग ~20 कार्डों तक हल कर सकता है। इसमें घंटों या दिन लग जाते हैं। इसके द्वारा खोजे गए रास्ते अक्सर लंबे और अक्षम होते हैं।
  • CayleyPy RL (AI): लगभग ~100 कार्डों तक हल कर सकता है। यह बहुत तेज़ है। यह ऐसे रास्ते खोजता है जो सैद्धांतिक रूप से सबसे छोटे संभव पथ के बहुत करीब होते हैं।

सारांश

लेखकों ने एक स्मार्ट AI सिस्टम बनाया है जो जटिल गणितीय समस्याओं को एक विशाल भूलभुलैया की तरह देखता है। रैंडम अनुमान लगाने को स्मार्ट लर्निंग के साथ जोड़कर और वर्चुअल खोजकर्ताओं की एक विशाल "टीम" भेजकर, वे उन भूलभुलैयाओं में रास्ता खोज सकते हैं जो पारंपरिक कंप्यूटरों के लिए बहुत बड़ी हैं। उन्होंने एक छोटा सा "चीट कोड" (X-ट्रिक) भी खोजा जो उन्हें पहले की तुलना में 5 गुना बड़ी समस्याओं को हल करने में सक्षम बनाता है, और साथ ही यह भी सिद्ध करता है कि इन भूलभुलैयाओं की संरचना कैसी है।

उन्होंने अपना कोड और चुनौतियाँ Kaggle नामक प्लेटफॉर्म पर भी रखी हैं, जहाँ वे अन्य लोगों को अपने रिकॉर्ड तोड़ने और इन पहेलियों के और भी कठिन संस्करणों को हल करने के लिए आमंत्रित कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →