Efficient Agentic Reasoning Through Self-Regulated Simulative Planning
यह शोध पत्र SRAM का प्रस्ताव करता है, जो एक ऐसा ढांचा है जो निर्णय लेने को सिमुलेटिव प्लानिंग (simulative planning), रिएक्टिव एक्जीक्यूशन (reactive execution) और एक सीखे हुए सेल्फ-रेगुलेशन मैकेनिज्म (self-regulation mechanism) में विभाजित करके एजेंटिक रीजनिंग की दक्षता को बढ़ाता है, जो यह गतिशील रूप से निर्धारित करता है कि कब और कितनी गहराई से योजना बनानी है, जिससे बड़े मॉडलों की तुलना में काफी कम रीजनिंग टोकन के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही कठिन पहेली सुलझाने की कोशिश कर रहे हैं, जैसे इंटरनेट पर कोई विशिष्ट तथ्य खोजना या किसी जटिल गणित की समस्या को हल करना। आपके पास मदद के लिए एक बहुत ही स्मार्ट सहायक (एक AI एजेंट) है।
लंबे समय से, इन सहायकों को बनाने का मानक तरीका यह था कि उन्हें निर्देश दिया जाता था: "जब तक तुम्हें उत्तर न मिल जाए, तब तक पूरी ताकत लगाकर सोचते रहो।"
यह एक छात्र को यह बताने जैसा है कि, "जब तक तुम इसे समझ न लो, तब तक अपनी नोटबुक में लिखते रहो।" समस्या यह है कि छात्र बिना सोचे-समझे पन्नों और पन्नों तक विचार लिख सकता है, जिससे समय और ऊर्जा बर्बाद होती है, और फिर भी वह सही उत्तर तक नहीं पहुँच पाता। उसे यह नहीं पता होता कि कब सोचना बंद करके काम करना है, या कब काम करना बंद करके सोचना शुरू करना है। वे बस चलते रहते हैं, इस उम्मीद में कि उत्तर जादू से मिल जाएगा।
इस शोध पत्र के लेखक, SR2AM, कहते हैं: "नहीं, यह अक्षम है। हमें AI को तीन विशिष्ट कौशल सिखाने चाहिए और उन्हें एक अच्छी तरह से संगठित टीम की तरह मिलकर काम करने देना चाहिए।"
यहाँ वे इसे एक सरल उपमा का उपयोग करके समझाते हैं: जासूस (The Detective), रणनीतिकार (The Strategist), और प्रबंधक (The Manager)।
तीन-टीम प्रणाली
सब कुछ एक साथ करने के लिए एक ही मस्तिष्क का उपयोग करने के बजाय, यह शोध पत्र काम को तीन विशिष्ट भूमिकाओं में विभाजित करने का प्रस्ताव देता है:
1. जासूस (System I: Reactive Execution - प्रतिक्रियाशील निष्पादन)
- वे क्या करते हैं: यह "हाथों-हाथ" काम करने वाला कार्यकर्ता है। वे वास्तव में खोज करते हैं, वेब पेज पढ़ते हैं, कोड लिखते हैं, या अंतिम उत्तर टाइप करते हैं।
- उपमा: उन्हें एक अपराध स्थल पर घूमते हुए, उंगलियों के निशान इकट्ठा करते हुए और गवाहों से बात करते हुए एक जासूस के रूप में सोचें। वे तेज़ होते हैं और तात्कालिक विवरणों में कुशल होते हैं।
2. रणनीतिकार (System II: Simulative Planning - सिमुलेटिव प्लानिंग)
- वे क्या करते हैं: यह "क्या होगा अगर" वाला विचारक है। जासूस द्वारा कोई कदम उठाने से पहले, रणनीतिकार भविष्य की कल्पना करता है। वे कहते हैं, "यदि हम इस विशिष्ट शब्द के लिए खोज करते हैं, तो हमें संभवतः वह पेज मिलेगा। यदि हम उस लिंक पर क्लिक करते हैं, तो हमें उत्तर मिल सकता है।" वे भविष्य का एक मानसिक मानचित्र बनाते हैं।
- उपमा: यह एक शतरंज खिलाड़ी की तरह है जो तीन चालें आगे देख रहा है। वे अभी मोहरा नहीं हिलाते; वे अपने दिमाग में खेल का सिमुलेशन करते हैं ताकि यह देख सकें कि क्या वह चाल सही है। यह जासूस को गलत रास्तों पर जाने से रोकता है।
3. प्रबंधक (System III: Self-Regulation - स्व-नियमन)
- वे क्या करते हैं: यह वह बॉस है जो तय करता है कि रणनीतिकार का उपयोग कब करना है। प्रबंधक वर्तमान स्थिति को देखता है और पूछता है: "क्या हमें आगे की योजना बनाने की आवश्यकता है, या हम बस जो कर रहे हैं उसे जारी रख सकते हैं?"
- उपमा: कल्पना कीजिए कि आप गाड़ी चला रहे हैं।
- यदि आप एक सीधे, खाली राजमार्ग पर हैं, तो प्रबंधक कहता है, "बस गाड़ी चलाते रहो" (योजना की आवश्यकता नहीं है)।
- यदि आप एक जटिल चौराहे या तूफान आते देखते हैं, तो प्रबंधक कहता है, "रुको! नक्शा निकालो और मार्ग की योजना बनाओ" (रणनीतिकार को सक्रिय करें)।
- प्रबंधक के बिना, कार हर मोड़ पर नक्शा निकालने की कोशिश कर सकती है, जिससे समय बर्बाद होता है, या जब तूफान आता है तो वह कभी नक्शा नहीं निकाल पाती।
उन्होंने इसे कैसे बनाया (द "SR2AM" मॉडल)
शोधकर्ताओं ने एक AI बनाया जिसे SR2AM कहा जाता है, जो इस तीन-सदस्यीय टीम की तरह काम करना सीखता है। उन्होंने केवल AI को "ज़ोर से सोचने" के लिए नहीं कहा। उन्होंने इसे सिखाया:
- निर्णय लेना: "क्या मुझे अभी योजना बनाने की आवश्यकता है?" (प्रबंधक)।
- योजना बनाना: "यदि आवश्यक हो, तो आइए अगले कुछ चरणों का सिमुलेशन करें और भविष्यवाणी करें कि क्या होगा।" (रणनीतिकार)।
- कार्य करना: "ठीक है, चलिए पहला कदम उठाते हैं।" (जासूस)।
उन्होंने इस AI को दो विधियों का उपयोग करके प्रशिक्षित किया:
- v0.1: उन्होंने इन भूमिकाओं को निभाने के लिए कई अलग-अलग AI टूल्स का उपयोग किया और परिणामों को रिकॉर्ड किया।
- v1.0: उन्होंने मौजूदा स्मार्ट AI मॉडल्स को लिया, देखा कि वे समस्याओं को कैसे हल करते हैं, और उनके विचारों को इन स्पष्ट नियोजन चरणों (planning steps) के साथ "पुनर्लिखित" किया।
उन्होंने क्या पाया (परिणाम)
शोध पत्र का दावा है कि यह "तीन-टीम" दृष्टिकोण पुराने "बस ज़ोर से सोचो" वाले दृष्टिकोण की तुलना में बहुत बेहतर है।
- स्मार्ट, न कि शोर मचाने वाला: पुराने AI मॉडल एक समस्या को हल करने के लिए भारी मात्रा में टेक्स्ट (टोकन) लिखते थे, और अक्सर अपने ही विचारों में खो जाते थे। नए SR2M मॉडल उसी समस्या को हल करने के लिए 25% से 95% कम शब्दों का उपयोग करते हैं।
- बेहतर सटीकता: कम शब्दों का उपयोग करने के बावजूद, वे उतने ही या उससे भी बेहतर परिणाम देते हैं जितने कि बहुत बड़े AI मॉडल (कुछ जिनमें 10 से 100 गुना अधिक कंप्यूटिंग शक्ति है) देते हैं।
- बेहतर योजना, न कि अधिक योजना: जब उन्होंने सुदृढीकरण शिक्षण (Reinforcement Learning - एक प्रशिक्षण विधि जहाँ AI पुरस्कारों से सीखता है) का उपयोग किया, तो AI ने अधिक योजना बनाना शुरू नहीं किया। इसके बजाय, इसने और आगे की योजना बनाना सीखा। इसने महसूस किया कि जब यह योजना बनाने का निर्णय लेता है, तो इसे गलतियों से बचने के लिए भविष्य में और दूर तक देखना चाहिए।
मुख्य निष्कर्ष
यह शोध पत्र तर्क देता है कि वर्तमान AI मॉडल इतने महंगे और धीमे क्यों होते जा रहे हैं क्योंकि वे सब कुछ विचारों के एक बड़े, अस्त-व्यस्त ढेर में करने की कोशिश कर रहे हैं। यह तय करने, भविष्य की योजना बनाने और काम करने को अलग करने से, AI बहुत अधिक कुशल हो जाता है।
यह एक ऐसे छात्र के बीच का अंतर है जो एक घंटे तक बेतरतीब ढंग से नोट्स लिखता रहता है (अक्षम) और उस छात्र के बीच का अंतर जो एक त्वरित रूपरेखा बनाता है, अपना नक्शा चेक करता है, और फिर निबंध लिखता है (कुशल)। शोध पत्र दिखाता है कि AI को दूसरे छात्र की तरह बनना सिखाना चमत्कारिक परिणाम देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।