← नवीनतम पेपर
🤖 AI

SyncPlan: Long-Horizon LLM Coordination with Explicit Synchronization and Adaptive Correction

SyncPlan एक प्लान-एग्जीक्यूट-करेक्ट फ्रेमवर्क है जो सिंगल-शॉट सेंट्रलाइज्ड प्लानिंग, डिपेंडेंसी मैनेजमेंट के लिए एक्सप्लिसिट सिंक्रोनाइज़ेशन प्रिमिटिव्स और स्टेलेनेस डिटेक्टर द्वारा ट्रिगर होने वाले एडेप्टिव रिप्लानिंग को जोड़कर न्यूनतम लेटेंसी के साथ स्टेट-ऑफ-द-आर्ट लॉन्ग-होराइजन मल्टी-एजेंट कोऑर्डिनेशन प्राप्त करता है।

मूल लेखक: Shen You, Xiaoming Zhu, Weining Weng, Hefei Mei, Weixuan Wang, Zhongshen Li, Zeji LI, Ye-Wen Wang, Zijun Liao, Juchao Zhuo, Yang Wei, Fuhao Qiu, Siqin Li, Zhenjie Lian, Danei Gong, Junkai Ji, Xiangtao
प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shen You, Xiaoming Zhu, Weining Weng, Hefei Mei, Weixuan Wang, Zhongshen Li, Zeji LI, Ye-Wen Wang, Zijun Liao, Juchao Zhuo, Yang Wei, Fuhao Qiu, Siqin Li, Zhenjie Lian, Danei Gong, Junkai Ji, Xiangtao Li, Qiuzhen Lin, Liang Wang, Ka-Chun Wong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि दोस्तों का एक समूह एक वीडियो गेम में एक विशाल, अराजक पहेली को मिलकर सुलझाने की कोशिश कर रहा है। उनका एक साझा लक्ष्य है, जैसे किसी बॉस को हराना या कोई जटिल भोजन बनाना, लेकिन गेम की दुनिया अप्रत्याशित है: दुश्मन अचानक प्रकट हो जाते हैं, चीजें गायब हो जाती हैं, और साथी टीम के सदस्य फंस सकते हैं। सफल होने के लिए, उन्हें पूरी तरह से समन्वय करने की आवश्यकता है। यह मल्टी-एजेंट कोऑर्डिनेशन (Multi-Agent Coordination) की दुनिया है, जहाँ कंप्यूटर वैज्ञानिक आर्टिफिशियल इंटेलिजेंस (AI) एजेंटों को एक टीम के रूप में काम करना सिखाते हैं।

परंपरागत रूप से, ये टीमें दो मुख्य रणनीतियों पर निर्भर करती हैं। पहली रणनीति रीइन्फोर्समेंट लर्निंग (RL) है, जहाँ एजेंट परीक्षण और त्रुटि (trial and error) के माध्यम से सीखते हैं, जैसे कि एक कुत्ता इनाम के लालच में करतब सीखता है। यह तेज़ और कुशल है लेकिन इसके लिए केवल एक ही गेम के लिए भारी मात्रा में विशिष्ट प्रशिक्षण की आवश्यकता होती है, जिससे इसे नई स्थितियों के अनुकूल बनाना कठिन हो जाता है। दूसरी रणनीति लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग करती है, जो वही "बुद्धिमान" AI है जो कविताएँ लिख सकता है या आपसे चैट कर सकता है। ये मॉडल जटिल निर्देशों और योजना बनाने में माहिर हैं, लेकिन ये धीमे हैं। एक अत्यंत बुद्धिमान AI से हर एक चाल के बारे में सोचने के लिए कहना, एक जीनियस शेफ से चाकू चलाने के हर एक कट के लिए एक नई रेसिपी लिखने के लिए कहने जैसा है—इसमें बहुत समय लगता है, और जब तक रेसिपी लिखी जाती है, तब तक सामग्री जल चुकी होती है।

बड़ा सवाल जो शोधकर्ता हल करने की कोशिश कर रहे हैं वह यह है: हम भाषा मॉडल की स्मार्ट, लचीली योजना बनाने की क्षमता को उस धीमे, बोझिल गति के बिना कैसे प्राप्त कर सकते हैं जो तेज़-तर्रार खेलों में इसे बेकार बना देती है?

यहाँ SyncPlan आता है, एक नया फ्रेमवर्क जिसे सिटी यूनिवर्सिटी ऑफ हांगकांग, टेनसेंट और अन्य के शोधकर्ताओं द्वारा प्रस्तावित किया गया है। SyncPlan को एक "प्लान-एग्जीक्यूट-करेक्ट" (योजना बनाएं-निष्पादित करें-सुधारें) प्रणाली के रूप में समझें जिसे AI एजेंटों के लिए परम टीम कप्तान बनाने के लिए डिज़ाइन किया गया है। AI को लगातार सोचने के लिए कहने के बजाय, SyncPlan इसे पूरी टीम के लिए एक विस्तृत स्क्रिप्ट (एक "संयुक्त योजना") एक ही बार में लिखने के लिए कहता है। यह स्क्रिप्ट प्रत्येक एजेंट को बताती है कि उसे क्या करना है, कब हिलना है, और सबसे महत्वपूर्ण बात, कब रुकना है

यहीं पर यह बहुत चतुर है। अतीत में, यदि एक AI टीम ने "एक साथ बॉस पर हमला करने" की योजना बनाई, तो एक एजेंट हमला कर सकता था जबकि दूसरा अभी चल ही रहा होता था, जिससे आपदा आ सकती थी। SyncPlan इसे एक्सप्लिसिट सिंक्रोनाइज़ेशन (Explicit Synchronization) के साथ हल करता है। यह विशेष "वेट" (प्रतीक्षा करें) कमांड का उपयोग करता है, जो ट्रैफिक लाइट की तरह काम करते हैं, जो एक एजेंट को तब तक रुकने के लिए मजबूर करते हैं जब तक कि उसका साथी वहाँ न पहुँच जाए या दुश्मन सही स्थिति में न आ जाए। यह "मिलकर काम करें" जैसे अस्पष्ट विचारों को सख्त, मशीन-पठनीय नियमों में बदल देता है जो टीम को एक-दूसरे से टकराने से रोकते हैं।

लेकिन क्या होगा यदि गेम बदल जाए? क्या होगा यदि बॉस अचानक भाग जाए? यदि टीम पुराने स्क्रिप्ट का आँख मूंदकर पालन करती है, तो वे विफल हो जाएंगे। SyncPlan के पास एक गुप्त हथियार है: एक हल्का प्लान स्टेलेनेस डिटेक्टर (PSD - Plan Staleness Detector)। कल्पना कीजिए कि एक सतर्क निरीक्षक किनारे पर खड़ा है। यह निरीक्षक वर्तमान योजना के विरुद्ध गेम की स्थिति की लगातार जाँच करता है। यदि निरीक्षक देखता है कि योजना अब मान्य नहीं है (जैसे, बॉस चला गया है), तो वह तुरंत "कप्तान" (LLM) को एक नया स्क्रिप्ट लिखने का संकेत देता है। यदि योजना अभी भी सही है, तो निरीक्षक चुप रहता है, और टीम बिना किसी बाधा के चलती रहती है। इसका मतलब है कि सिस्टम केवल तभी धीमे, सोचने वाले AI को बुलाता है जब इसकी वास्तव में आवश्यकता होती है, जिससे बहुत सारा समय बचता है।

शोधकर्ताओं ने इस प्रणाली का परीक्षण दो बहुत अलग दुनियाओं में किया: ओवरकुक्ड (Overcooked), एक अराजक कुकिंग गेम जहाँ दो एजेंटों को सूप तैयार करना होता है, और हॉनर ऑफ किंग्स (Honor of Kings), एक जटिल 5-बनाम-5 बैटल एरिना गेम। परिणाम प्रभावशाली थे। कुकिंग गेम में, SyncPlan ने पिछले तरीकों की तुलना में अधिक बार कार्यों में सफलता प्राप्त की, जबकि इसने उन तरीकों द्वारा लिए गए समय के 0.05% से भी कम समय का उपयोग किया। बैटल एरिना में, इसने 86.3% सफलता दर हासिल की, जो अगले सर्वश्रेष्ठ तरीके से काफी आगे है और यह 26 गुना तेज़ चला।

यह पेपर सुझाव देता है कि यह दृष्टिकोण इसलिए काम करता है क्योंकि यह भारी सोच (योजना बनाना) को तेज़ क्रिया (निष्पादन) से अलग करता है। इन संरचित स्क्रिप्टों को लिखना सिखाने के लिए सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) का उपयोग करने और वास्तविक गेम फीडबैक के आधार पर उन्हें परिष्कृत करने के लिए रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करने से, यह प्रणाली स्मार्ट और तेज़ दोनों होने का हुनर सीख लेती है। लेखकों ने पाया कि "स्पॉटर" (PSD) के बिना, टीम अक्सर फंस जाती थी या गलत योजनाओं का पालन करती थी, और "वेट" कमांड के बिना, वे आपस में टकरा जाती थीं और विफल हो जाती थीं।

संक्षेप में, SyncPlan AI को तेज़ सोचने के लिए नहीं कहता; यह इसे पहले से योजना बनाकर, सही क्षण की प्रतीक्षा करके और केवल तभी दोबारा सोचने के लिए कहता है जब दुनिया बदल जाती है, इसे स्मार्ट बनाता है। यह "मुझे क्या करना चाहिए?" के बजाय "यहाँ योजना है, और यहाँ ठीक वह समय है जब इसे बदलना है," में एक बदलाव है, जो धीमे, विचारशील लोगों के समूह को एक तेज़, सिंक्रोनाइज़्ड टीम में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →