← नवीनतम पेपर
🤖 AI

Learning to Communicate Locally for Large-Scale Multi-Agent Pathfinding

यह शोध पत्र LC-MAPF प्रस्तुत करता है, जो एक सामान्यीकरण योग्य प्री-ट्रेंड मॉडल है जो कुशल फीचर शेयरिंग के लिए एक स्केलेबल, सीखने योग्य मल्टी-राउंड कम्युनिकेशन मॉड्यूल को शामिल करके विकेंद्रीकृत मल्टी-एजेंट पाथफाइंडिंग को बढ़ाता है, जो स्केलेबिलिटी से समझौता किए बिना विविध परिदृश्यों में मौजूदा लर्निंग-आधारित सॉल्वर्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Valeriy Vyaltsev, Alsu Sagirova, Anton Andreychuk, Yuri Kuratov, Konstantin Yakovlev, Aleksandr Panov, Alexey Skrynnik

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Valeriy Vyaltsev, Alsu Sagirova, Anton Andreychuk, Yuri Kuratov, Konstantin Yakovlev, Aleksandr Panov, Alexey Skrynnik

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक विशाल, व्यस्त गोदाम सैकड़ों एक जैसे रोबोटों से भरा हुआ है। उनका काम सरल है: एक जगह से पैकेज उठाना और उसे दूसरी जगह छोड़ देना। लेकिन यहाँ एक पेच है: उन सभी को एक ही समय में चलना होगा, और यदि दो रोबोट आपस में टकरा जाते हैं, तो पूरा ऑपरेशन रुक जाएगा।

यह मल्टी-एजेंट पाथफाइंडिंग (MAPF) की समस्या है। यह हजारों चींटियों को एक भीड़भाड़ वाले फुटपाथ को पार करने के लिए समझाने जैसा है बिना एक-दूसरे पर पैर रखे, लेकिन उन सभी के गंतव्य अलग-अलग हैं।

"मौन" रोबोटों की समस्या

अतीत में, शोधकर्ताओं ने इन रोबोटों को इमिटेशन लर्निंग (Imitation Learning) का उपयोग करके सिखाने की कोशिश की। इसे ऐसे समझें कि आपने एक विशेषज्ञ को भूलभुलैया सुलझाते हुए दिखाया और रोबोट से कहा, "बिल्कुल वैसा ही करो जैसा विशेषज्ञ ने किया।"

एक हालिया विधि, जिसे MAPF-GPT कहा जाता है, इस मामले में बहुत अच्छी थी। इसने विशेषज्ञ वीडियो के एक विशाल पुस्तकालय से सीखा। हालाँकि, इसमें एक बड़ी खामी थी: इसने रोबोटों को चुप रहना सिखाया। रोबोटों ने अच्छी तरह से चलना तो सीख लिया, लेकिन उन्होंने आपस में बात करना नहीं सीखा। वे एक ऐसे गायक दल की तरह थे जो पूरी तरह से सुर में गा रहे हैं लेकिन समय को समायोजित करने के लिए एक-दूसरे को देखने की कभी नहीं करते। यदि स्थिति बहुत अधिक भीड़भाड़ वाली हो जाती, तो वे समन्वय करने के लिए जाम को ठीक करने में असमर्थ होते क्योंकि वे केवल अकेले देखकर अनुमान लगा रहे थे।

अन्य विधियों ने उन्हें बात करने की अनुमति देकर इसे ठीक करने की कोशिश की, लेकिन उनकी बातचीत उथली थी। वे शायद चिल्लाते थे, "मैं यहाँ हूँ!" या "मैं बाईं ओर जा रहा हूँ!" लेकिन वे वास्तव में मोलभाव (negotiate) या मिलकर योजना नहीं बनाते थे। यह उन लोगों के समूह जैसा था जो एक पहेली को हल करने की कोशिश कर रहे हैं लेकिन उन्हें केवल एक शब्द बोलने की अनुमति है।

समाधान: LC-MAPF ("राउंड-टेबल" दृष्टिकोण)

लेखकों ने एक नई प्रणाली पेश की जिसे LC-MAPF कहा गया। केवल एक विशेषज्ञ को देखने के बजाय, उन्होंने रोबोटों को एक कदम उठाने से पहले बहु-चरणीय बातचीत (multi-round conversation) करने के लिए प्रशिक्षित किया।

यह कैसे काम करता है, इसके लिए एक सरल उपमा यहाँ दी गई है:

  1. सेटअप: कल्पना कीजिए कि रोबोट एक मेज के चारों ओर बैठे हैं। वे केवल अपने बगल में बैठे लोगों (अपने स्थानीय पड़ोसियों) को देख सकते हैं।
  2. राउंड 1: हर कोई अपने पड़ोसियों को अपनी वर्तमान योजना फुसफुसाकर बताता है। "मैं आगे बढ़ने जा रहा हूँ।"
  3. राउंड 2: अब, हर कोई अपने पड़ोसियों को सुनता है। यदि एक पड़ोसी कहता है, "मैं भी आगे जा रहा हूँ," तो आपको एहसास होता है, "ओह, हम टकरा जाएंगे!" इसलिए, आप एक नई योजना फुसफुसाते हैं: "ठीक है, मैं एक सेकंड रुक जाता हूँ।"
  4. राउंड 3 और 4: वे इन फुसफुसाहटों को बार-बार आगे बढ़ाते रहते हैं। हर राउंड के साथ, वे अपनी योजना को परिष्कृत करते हैं, संघर्षों को सुलझाते हैं और एक सुचारू प्रवाह पर सहमत होते हैं।
  5. मूव (कदम): चार राउंड की बातचीत के बाद, वे एक साथ चलते हैं, पूरी तरह से समन्वित होकर।

LC-MAPF का जादू यह है कि रोबोटों ने खुद बात करना सीख लिया। शोधकर्ताओं ने उन्हें कोई विशिष्ट भाषा नहीं सिखाई या यह नहीं बताया कि क्या कहना है। उन्होंने बस उन्हें लक्ष्य दिया (टकराना नहीं, गंतव्य तक पहुँचना) और AI को यह समझने दिया कि "बात करना" इस पहेली को हल करने का सबसे अच्छा तरीका है। उनके द्वारा साझा किए गए संदेश मानव शब्द नहीं हैं; वे गणितीय संकेत हैं जो पहेली को हल करने के लिए पर्याप्त जानकारी ले जाते हैं।

यह एक बड़ी बात क्यों है

यह पेपर तीन मुख्य विजयों पर प्रकाश डालता है:

  • यह स्मार्ट है: परीक्षणों में, LC-MAPF ने किसी भी अन्य लर्निंग-आधारित विधि, जिसमें प्रसिद्ध MAPF-GPT भी शामिल है, की तुलना में अधिक भूलभुलैया परिदृश्यों को सफलतापूर्वक हल किया। इसने भीड़भाड़ वाले कमरों को बेहतर ढंग से संभाला क्योंकि यह वास्तव में अपने पड़ोसियों के साथ "मोलभाव" कर सकता था।
  • यह स्केल (Scale) करता है: आमतौर पर, जब आप एक बात करने वाली प्रणाली में अधिक रोबोट जोड़ते हैं, तो बहुत अधिक बातचीत के कारण सिस्टम धीमा हो जाता है और क्रैश हो जाता है। LC-MAPF अलग है। हजारों रोबोटों के साथ भी, यह तेज़ बना रहता है। यह एक सुव्यवस्थित भीड़ की तरह है जहाँ हर कोई केवल उन लोगों से बात करता है जो उनके ठीक बगल में हैं, न कि पूरे स्टेडियम में चिल्लाता है।
  • यह वास्तविक दुनिया में काम करता है: शोधकर्ताओं ने इसे केवल कंप्यूटर पर नहीं चलाया। उन्होंने वास्तविक रोबोटों (जो एक छोटे AI किट 'Jetbot' पर आधारित हैं) के साथ एक भौतिक भूलभुलैया बनाई। उन्होंने LC-MAPF मस्तिष्क को वास्तविक रोबोटों में डाला, और रोबोटों ने बिना टकराए भौतिक भूलभुलैया में सफलतापूर्वक रास्ता बनाया, जिससे साबित हुआ कि "फुसफुसाहट" वास्तविक जीवन में काम करती है।

निचोड़ (Bottom Line)

यह पेपर रोबोटों को एक साथ काम करना सिखाने का एक नया तरीका प्रस्तुत करता है। केवल शांत एकल कलाकार या उथले वक्ता होने के बजाय, ये रोबोट अब सहयोगात्मक वार्ताकार (collaborative conversationalists) हैं। वे एक योजना पर सहमत होने के लिए अपने पड़ोसियों के साथ संक्षिप्त, कुशल बैठकें करते हैं, जिससे उन्हें जटिल, भीड़भाड़ वाले वातावरण में सुचारू रूप से और सुरक्षित रूप से आगे बढ़ने की अनुमति मिलती है। यह प्रणाली तेज़ है, स्केलेबल है, और इसे पहले ही वास्तविक हार्डवेयर के साथ सिद्ध किया जा चुका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →