← नवीनतम पेपर
🤖 AI

When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning

यह शोध पत्र PACT को प्रस्तुत करता है, जो एक हाइब्रिड आर्किटेक्चर है जो सुरक्षित एक्शन प्लान बनाने और उन्हें मान्य करने के लिए एक एसिंक्रोनस (asynchronous) रूप से एकीकृत विचारशील (deliberative) स्मॉल लैंग्वेज मॉडल द्वारा रिएक्टिव रिइन्फोर्समेंट लर्निंग पॉलिसियों को बढ़ाता है, जिससे बिना पॉलिसी रिट्रेनिंग की आवश्यकता के चुनौतीपूर्ण वातावरण में बेसलाइन विधियों से बेहतर प्रदर्शन होता है।

मूल लेखक: Nathan Gavenski, Juarez Monteiro, Francisco Galuppo, Adriano Veloso, Odinaldo Rodrigues

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nathan Gavenski, Juarez Monteiro, Francisco Galuppo, Adriano Veloso, Odinaldo Rodrigues

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कार चला रहे हैं। अधिकांश समय, आप "ऑटोपायलट" पर गाड़ी चलाते हैं। आप एक स्टॉप साइन देखते हैं, और ब्रेक लगा देते हैं। आप एक हरी बत्ती देखते हैं, और आगे बढ़ जाते हैं। यह तेज़, स्वचालित है और इसमें बहुत कम सोचने की आवश्यकता होती है। AI की दुनिया में, इसे रीइन्फोर्समेंट लर्निंग (RL) कहा जाता है। यह तब बहुत अच्छा होता है जब आप एक परिचित सड़क पर हों, लेकिन यदि आप अचानक खुद को एक पूरी तरह से नए शहर में पाते हैं जहाँ यातायात के नियम अजीब हैं, तो आपका ऑटोपायलट दुर्घटनाग्रस्त हो सकता है क्योंकि उसने ऐसी स्थिति पहले कभी नहीं देखी है।

दूसरी ओर, कल्पना कीजिए कि बगल वाली सीट पर एक बहुत ही बुद्धिमान, धीरे सोचने वाला नेविगेटर बैठा है। इस नेविगेटर ने दुनिया के हर नक्शे को पढ़ा है और वह एक जटिल यात्रा के लिए मार्ग की योजना बना सकता है। हालाँकि, यह नेविगेटर बोलने में धीमा है, इसे सोचने में लंबा समय लगता है, और कभी-कभी इसका ध्यान भटक भी जाता है। शोध पत्र में, इसे स्मॉल लैंग्वेज मॉडल (SLM) कहा गया है।

यह शोध पत्र PACT (प्लान, अलाइन, कमिट, थिंक) नामक एक नई प्रणाली पेश करता है जो इन दोनों ड्राइवरों को एक आदर्श टीम में जोड़ता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग करते हैं:

समस्या: "परिचित सड़क" का जाल

मानक AI एजेंट ऑटोपायलट ड्राइवर की तरह होते हैं। वे उन चीजों पर प्रतिक्रिया देने में उत्कृष्ट हैं जिनका उन्होंने अभ्यास किया है। लेकिन यदि वे किसी नई चीज़ (जैसे फिसलन भरी सड़क या एक विशाल भूलभुलभैया) का सामना करते हैं, तो वे घबरा जाते हैं और गलतियाँ करते हैं। उनमें "आगे की सोचने" की क्षमता की कमी होती है।

समाधान: PACT टीम

PACT दो अलग-अलग भूमिकाओं वाली एक हाइब्रिड टीम बनाता है:

  1. तेज़ ड्राइवर (द RL पॉलिसी): यह ऑटोपायलट है। यह 90% ड्राइविंग संभालता है। यह तेज़, कुशल है और स्थानीय नियमों को जानता है।
  2. धीमा नेविगेटर (द SLM): यह प्लानर है। यह कार नहीं चलाता। इसके बजाय, यह पीछे बैठता है और केवल तभी बोलता है जब तेज़ ड्राइवर भ्रमित होता है।

PACT कैसे काम करता है: "संदेह" का ट्रिगर

इस प्रणाली का एक सरल नियम है: "जब संदेह हो, तो योजना बनाएं।"

  • ट्रिगर: तेज़ ड्राइवर लगातार अपने स्वयं के आत्मविश्वास की जाँच करता रहता है। यदि वह कुछ परिचित देखता है, तो वह गाड़ी चलाना जारी रखता है। लेकिन यदि उसे "अनिश्चितता" महसूस होती है (जैसे कि कोई फिसलन भरा हिस्सा या एक विशाल भूलभुलभैया जिसे उसने पहले नहीं देखा है), तो वह ब्रेक लगा देता है और कहता है, "मुझे नहीं पता कि आगे क्या करना है।"
  • योजना चरण (Planning Phase): जब तेज़ ड्राइवर रुकता है, तो धीमा नेविगेटर जाग जाता है। वह केवल यह नहीं कहता कि "बाएँ मुड़ें।" वह अगले कुछ कदमों के लिए एक पूर्ण रोडमैप (एक योजना) तैयार करता है।
  • सुरक्षा जाँच (सिमुलेशन): नेविगेटर की योजना का उपयोग करने से पहले, सिस्टम एक "मानसिक सिमुलेशन" चलाता है। यह पूछता है: यदि हम इस योजना का पालन करते हैं, तो क्या हम दुर्घटनाग्रस्त हो जाएंगे? क्या यह सुरक्षित है? क्या यह वास्तव में हमें लक्ष्य तक पहुँचाएगा? यदि योजना जोखिम भरी है, तो नेविगेटर तब तक प्रयास करता रहता है जब तक कि वह एक सुरक्षित मार्ग न खोज ले।
  • प्रतिबद्धता (Commitment): एक बार जब एक सुरक्षित योजना सत्यापित हो जाती है, तो तेज़ ड्राइवर इसके प्रति कमिट (वचनबद्ध) हो जाता है। सिस्टम कुछ समय के लिए ऑटोपायलट को अनदेखा कर देता है और नेविगेटर के रोडमैप का चरण-दर-चरण पालन करता है। भले ही सड़क थोड़ी ऊबड़-खाबड़ हो जाए (स्टोकेस्टिसिटी), टीम योजना पर टिकी रहती है और हर सेकंड दिशा बदलने के बजाय उस योजना का पालन करती है।
  • संरेखण (Alignment): यदि कार थोड़ा रास्ते से भटक जाती है (शायद सड़क फिसलन भरी थी और कार फिसल गई), तो नेविगेटर रास्ते को वापस सही करने के लिए जल्दी से समायोजन करता है, न कि शून्य से शुरुआत करता है।

परिणाम: यह क्यों जीतता है

शोधकर्ताओं ने इस टीम का परीक्षण तीन अलग-अलग "ड्राइविंग परिदृश्यों" (जिन्हें फ्रोजनलेक एनवायरनमेंट कहा जाता है) में किया:

  1. आसान सड़क (6x6 मैप): तेज़ ड्राइवर अच्छा था, लेकिन PACT टीम उससे भी बेहतर थी।
  2. फिसलन भरी सड़क (बर्फ के साथ 6x6): यह वह जगह है जहाँ अन्य टीमें विफल रहीं। तेज़ ड्राइवर फिसला और दुर्घटनाग्रस्त हो गया। अन्य AI सिस्टम जो हर एक कदम पर नेविगेटर से सलाह मांगते थे, वे भ्रमित हो गए और भटक गए। लेकिन PACT, क्योंकि इसने एक सत्यापित योजना के प्रति प्रतिबद्धता दिखाई, स्थिर रहा। वह केवल थोड़ा फिसला और उबर गया।
  3. विशाल भूलभुलभैया (8x8 मैप): यह एक लंबी, जटिल यात्रा थी। तेज़ ड्राइवर रास्ता भटक गया। नेविगेटर अकेला बहुत धीमा था और बिना किसी दिशा के भटकता रहा। लेकिन PACT ने उन्हें मिला दिया: नेविगेटर ने एक स्पष्ट पथ बनाया, और तेज़ ड्राइवर ने उसे पूरी तरह से निष्पादित किया। PACT ने बिना किसी गलती के परफेक्ट स्कोर प्राप्त किया, जबकि बाकी सभी संघर्ष कर रहे थे।

मुख्य निष्कर्ष

शोध पत्र का तर्क है कि कठिन समस्याओं को हल करने के लिए आपको सुपर-कंप्यूटर (एक विशाल AI मॉडल) की आवश्यकता नहीं है। आपको बस सही टीमवर्क की आवश्यकता है।

  • नेविगेटर से हर मोड़ के लिए न पूछें: वह बहुत धीमा और भ्रमित करने वाला है।
  • ड्राइवर को अंधेरे में अनुमान लगाने न दें: इससे दुर्घटनाएं होती हैं।
  • ऐसा करें: ड्राइवर को आसान चीजें संभालने दें। जब चीजें अजीब हों, तो रुकें, नेविगेगर को एक सुरक्षित, सत्यापित मानचित्र बनाने दें, और फिर उस मानचित्र पर डटे रहें जब तक कि काम पूरा न हो जाए।

संक्षेप में, PACT साबित करता है कि एक छोटा, स्मार्ट प्लानर जो एक तेज़, प्रतिक्रियाशील ड्राइवर के साथ मिलकर काम करता है, वह अकेले काम करने वाले किसी भी एक से कहीं अधिक शक्तिशाली है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →