← नवीनतम पेपर
🤖 AI

CEDAR: Agent-Orchestrated Tree Search for Goal-Directed Optimization of Complex Systems

CEDAR एक स्वायत्त ढांचा है जो जटिल सिस्टम संरचनाओं को स्वचालित रूप से खोजने और अनुकूलित करने के लिए मोंटे कार्लो ट्री सर्च प्रक्रिया के भीतर लार्ज लैंग्वेज मॉडल एजेंटों का लाभ उठाता है, जिससे पारंपरिक मॉडलिंग वर्कफ़्लो में आमतौर पर आवश्यक होने वाले मैनुअल प्रयास को कम करते हुए उभरते व्यवहारों के लक्ष्य-निर्देशित डिज़ाइन को सक्षम बनाया जा सके।

मूल लेखक: Yingtao Tian

प्रकाशित 2026-08-10
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yingtao Tian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक आदर्श केक बनाने की कोशिश कर रहे हैं, लेकिन आपके पास कोई रेसिपी नहीं है। आपके पास केवल एक धुंधला सा विचार है: "इसे स्पंजी, मीठा और बहुत भारी नहीं होना चाहिए।" वास्तविक दुनिया में, कई चीजें—जैसे कि एक शहर कैसे बढ़ता है, एक वायरस कैसे फैलता है, या एक अर्थव्यवस्था नई नीति पर कैसे प्रतिक्रिया देती है—उस केक की तरह ही हैं। वे "जटिल प्रणालियाँ" (complex systems) हैं, जिसका अर्थ है कि वे कई ऐसे हिस्सों से बनी हैं जो लूप्स (loops) में एक-दूसरे से संवाद करते हैं। यदि आप एक चीज़ बदलते हैं, तो वह पूरे सिस्टम में आश्चर्यजनक तरीकों से लहरें पैदा करती है। वैज्ञानिक दशकों से इन प्रणालियों के डिजिटल मॉडल बनाने की कोशिश कर रहे हैं ताकि भविष्य की भविष्यवाणी की जा सके, लेकिन यह एक बुरा सपना रहा है। आमतौर पर, इसके लिए एक मानव विशेषज्ञ को बहुत विशिष्ट, कठिन कोड लिखने की आवश्यकता होती है, और फिर भी, वांछित परिणाम प्राप्त करने के लिए मॉडल को कैसे ट्यून किया जाए, यह तय करना वैसा ही है जैसे यह अनुमान लगाने की कोशिश करना कि हवा किस दिशा में बह रही है और उसके आधार पर जहाज को मोड़ना।

अब, CEDAR नामक एक नई विधि के बारे में सोचें। इसे एक टीम के रूप में समझें जिसमें सुपर-स्मार्ट, अथक रोबोट शेफ मिलकर शून्य से उस आदर्श केक की रेसिपी बनाने के लिए काम कर रहे हैं। इंसान द्वारा कोड लिखने के बजाय, CEDAR एक विशेष प्रकार के आर्टिफिशियल इंटेलिजेंस (एक LLM) का उपयोग करता है जो एक "जज" (Judge) और एक "एडिटर" (Editor) के रूप में कार्य करता है। एडिटर रेसिपी (कंप्यूटर कोड) को बेहतर बनाने के लिए उसे फिर से लिखने की कोशिश करता है, जबकि जज परिणाम का स्वाद लेता है और उसे एक स्कोर देता है। लेकिन यहाँ असली जादू है: वे केवल बेतरतीब ढंग से अनुमान नहीं लगाते। वे "मोंटे कार्लो ट्री सर्च" (Monte Carlo Tree Search) नामक रणनीति का उपयोग करते हैं, जो एक जासूस की तरह है जो एक विशाल, शाखाओं वाले भूलभुलैया की खोज कर रहा है। हर मोड़ पर, जासूस पूछता है, "यदि मैं इस रास्ते से जाता हूँ, तो क्या मुझे एक बेहतर केक मिलेगा?" यह सिस्टम को रेसिपी के हजारों अलग-अलग संस्करणों को एक्सप्लोर करने, अपनी गलतियों से सीखने और उन रास्तों को खोजने की अनुमति देता है जिन्हें एक इंसान शायद कभी नहीं सोच पाएगा। पेपर दिखाता है कि यह रोबोट टीम एक अस्त-व्यस्त, मौजूदा मॉडल को स्वचालित रूप से सुधार सकती है ताकि लक्ष्यों को पूरा किया जा सके, जैसे कि "जनसंख्या बढ़ाएं लेकिन प्रदूषण कम रखें," और यह पारंपरिक तरीकों की तुलना में अधिक तेज़ी से और अधिक रचनात्मक रूप से ऐसा करती है।

रोबोट शेफ और संभावनाओं की भूलभुलैया

इस पेपर का मूल विचार यह है कि हम जटिल प्रणालियों (जैसे पारिस्थितिकी तंत्र, अर्थव्यवस्था या जनसंख्या के मॉडल) को स्वचालित रूप से डिजाइन और बेहतर बनाने के लिए AI का उपयोग कर सकते हैं। ये प्रणालियाँ पेचीदा हैं क्योंकि ये फीडबैक लूप्स से भरी होती हैं—जहाँ एक भाग का आउटपुट दूसरे भाग के लिए इनपुट बन जाता है, जिससे कारण और प्रभाव का एक ऐसा जाल बनता है जिसे समझना कठिन होता है। पारंपरिक रूप से, इन मॉडलों को बनाना विशेषज्ञों द्वारा विशेष, पुराने सॉफ़्टवेयर का उपयोग करके किया जाने वाला एक धीमा, मैनुअल काम रहा है। यदि आप मॉडल को बदलना चाहते थे कि एक नया नियम जोड़ने से क्या होगा, तो आपको स्वयं कोड फिर से लिखना पड़ता था।

CEDAR इस प्रक्रिया को एक स्वायत्त, सेल्फ-ड्राइविंग प्रक्रिया में बदलकर खेल बदल देता है। यह एक सिस्टम मॉडल के निर्माण को अन्वेषण के खेल की तरह मानता है। सिस्टम को पायथन कोड (एक सामान्य प्रोग्रामिंग भाषा) के रूप में दर्शाया जाता है जो यह सिम्युलेट करता है कि सिस्टम समय के साथ कैसे बदलता है। लक्ष्य इस कोड का एक ऐसा संस्करण खोजना है जो उस तरह व्यवहार करे जैसा एक इंसान चाहता है, जैसे कि "प्रदूषण को न्यूनतम रखते हुए जनसंख्या वृद्धि को अधिकतम करना।"

इसे करने के लिए, CEDAR दो AI एजेंटों का उपयोग करता है जो एक लूप में काम करते हैं:

  1. एडिटर (The Editor): यह AI वर्तमान कोड और सिमुलेशन के परिणामों को देखता है। फिर यह कोड में बदलाव का प्रस्ताव देता है। यह एक संख्या को बदल सकता है, वेरिएबल्स के बीच एक नया संबंध जोड़ सकता है, या किसी फॉर्मूला के काम करने के तरीके को बदल सकता है। यह एक रचनात्मक शेफ की तरह कार्य करता है जो एक नया घटक आज़मा रहा है।
  2. जज (The Judge): यह AI नए कोड को चलाता है, सिमुलेशन को चलते हुए देखता है, और फिर लक्ष्य के विरुद्ध इसका मूल्यांकन करता है। यह नए संस्करण को एक स्कोर देता है और एक विस्तृत रिपोर्ट लिखता है कि इसने अच्छा या बुरा प्रदर्शन क्यों किया। यह एक फूड क्रिटिक की तरह कार्य करता है जो केक का स्वाद चख रहा है।

लेकिन केवल रैंडम बदलावों को आज़माना पर्याप्त नहीं है। यहीं पर मोंटे कार्लो ट्री सर्च (MCTS) काम आता है। एक पेड़ की कल्पना करें जहाँ तना आपका शुरुआती मॉडल है। हर बार जब एडिटर कोई बदलाव करता है, तो यह एक नई शाखा उगाता है। MCTS एल्गोरिदम यह तय करता है कि अगली कौन सी शाखाओं की खोज करनी है। यह केवल उस एक को नहीं चुनता जो अभी सबसे अच्छा दिख रहा है; यह नए, अजीब विचारों को खोजने (छिपे हुए रत्नों को खोजने के लिए) और सबसे आशाजनक रास्तों में गहराई तक जाने के बीच संतुलन बनाता है। यह सिस्टम को एक स्थानीय "काफी अच्छे" समाधान में फंसने से रोकता है और इसे वास्तव में अद्भुत परिणाम खोजने में मदद करता है।

प्रयोग: विश्व गतिशीलता से जनसंख्या वृद्धि तक

लेखक ने यह देखने के लिए कि क्या यह वास्तव में काम कर सकता है, CEDAR का दो मुख्य चुनौतियों पर परीक्षण किया।

चुनौती 1: "वर्ल्ड डायनेमिक्स" केक
पहला परीक्षण एक प्रसिद्ध, जटिल मॉडल का उपयोग करता था जिसे "वर्ल्ड डायनेमिक्स" कहा जाता है, जो मानव जनसंख्या, प्राकृतिक संसाधनों और प्रदूषण के सह-विकास का अनुकरण करता है। मूल मॉडल, जिसे 1970 के दशक में एक मानव विशेषज्ञ द्वारा बनाया गया था, ने दिखाया कि यदि आप चीजों को बस चलने देते हैं, तो जनसंख्या बढ़ती है, संसाधन खत्म होते हैं, और प्रदूषण विस्फोट करता है। CEDAR के लिए लक्ष्य इस मॉडल को ट्यून करना था ताकि एक ऐसा "स्वीट स्पॉट" पाया जा सके जहाँ जनसंख्या बढ़ सके, लेकिन संसाधन खत्म न हों, और प्रदूषण कम रहे।

परिणाम प्रभावशाली थे। CEDAR ने न केवल एक छोटा सुधार खोजा; बल्कि इसने सिस्टम को संतुलित करने के पूरी तरह से नए तरीके खोज निकाले। एक रन में, इसने 200 वर्षों में जनसंख्या को 6.4 गुना (1.65 बिलियन से 10.57 बिलियन तक) बढ़ाने में सफलता प्राप्त की, जबकि प्राकृतिक संसाधनों का केवल 19.9% ही उपयोग हुआ और प्रदूषण का संचय अत्यंत कम रहा। यह मूल मॉडल की तुलना में एक बड़ा सुधार है, जिसमें भारी संसाधन ह्रास और प्रदूषण स्पाइक्स देखे गए थे। पेपर नोट करता है कि विभिन्न AI "दिमाग" (जैसे क्लॉड और GPT-5.1) ने अलग-अलग समाधान खोजे, जो दर्शाता है कि CEDAR समस्याओं को हल करने के विविध वैध तरीके खोज सकता है, न कि केवल एक एकल उत्तर।

चुनौती 2: केक से रेसिपी का अनुमान लगाना
दूसरा चैलेंज और भी कठिन था। टीम ने CEDAR को एक "ग्राउंड ट्रुथ" सिस्टम दिया—एक जटिल जनसंख्या मॉडल जिसमें रैंडम, अप्रत्याशित तत्व (जैसे कि हर स्टेप पर रैंडमली बदलने वाली मृत्यु दर) थे। उन्होंने CEDAR को इस सिस्टम का फॉर्मूला नहीं बताया। इसके बजाय, उन्होंने इसे समय के साथ जनसंख्या के आंकड़ों का एक रिकॉर्ड दिया और इसे उस रिकॉर्ड को दोबारा बनाने के लिए कहा।

इसे निष्पक्ष परीक्षण बनाने के लिए, उन्होंने CEDAR की तुलना एक मानक ऑप्टिमाइज़ेशन टूल, Optuna से की। उन्होंने Optuna को तीन अलग-अलग स्तरों की सहायता दी:

  • कोई फॉर्मूला नहीं: केवल दो सरल संख्याएँ (जन्म और मृत्यु दर)।
  • सरल फॉर्मूला: एक बुनियादी फीडबैक लूप।
  • पूर्ण फॉर्मूला: वास्तविक सिस्टम का सटीक गणितीय ढांचा (ज्ञात संरचना)।

भले ही CEDAR ने बिना किसी फॉर्मूला के शुरुआत की थी (उसे खुद संरचना का आविष्कार करना था), फिर भी इसने Optuna को पीछे छोड़ दिया, जिसे पूर्ण फॉर्मूला (ज्ञात संरचना) दिया गया था। सिमुलेशन में, CEDAR ने Optuna (पूर्ण फॉर्मूला के साथ) की तुलना में कम एरर रेट (L1 डिस्टेंस 2.22) हासिल किया (Optuna का L1 डिस्टेंस 3.71 था)। यह सुझाव देता है कि CEDAR संभावनाओं के स्थान को एक्सप्लोर करने में इतना कुशल है कि वह डेटा को देखकर ही किसी सिस्टम के अंतर्निहित नियमों को समझ सकता है, बिना किसी इंसान द्वारा उसे समीकरण बताए।

यह क्यों महत्वपूर्ण है (और यह क्या नहीं करता है)

पेपर सुझाव देता है कि यह दृष्टिकोण जटिल सिस्टम मॉडलिंग को बहुत अधिक सुलभ बना सकता है। कोड लिखने के लिए सिस्टम डायनेमिक्स में पीएचडी की आवश्यकता होने के बजाय, एक उपयोगकर्ता बस साधारण अंग्रेजी में एक लक्ष्य का वर्णन कर सकता है, और CEDAR सारा भारी काम करेगा। यह "व्याख्यात्मकता" (interpretability) भी प्रदान करता है, जिसका अर्थ है कि AI समझाता है कि उसने बदलाव क्यों किए। उदाहरण के लिए, वर्ल्ड डायनेमिक्स प्रयोग में, AI ने समझाया कि बेहतर संतुलन प्राप्त करने के लिए उसने संसाधन उपयोग को 25-40% और प्रदूषण उत्पादन को 30-40% कम कर दिया। ये स्पष्टीकरण मनुष्यों को समझने में मदद करते हैं कि AI किन समझौतों (trade-offs) को कर रहा है।

हालाँकि, लेखक अपने दावों के बारे में सावधान है। वे कहते हैं कि हालांकि इन सिमुलेशन में परिणाम मजबूत हैं, लेकिन विधि के सैद्धांतिक गारंटी (यह गणितीय प्रमाण कि यह हमेशा सबसे अच्छा उत्तर खोज लेगा) अभी भी एक खुला प्रश्न है। वे यह भी नोट करते हैं कि "जज" और "एडिटर" दोनों बड़े लैंग्वेज मॉडल हैं, जिसका अर्थ है कि एक छोटा जोखिम है कि वे एक-दूसरे की गलतियों को पुख्ता कर सकते हैं, हालांकि ट्री सर्च संरचना इसे रोकने में मदद करती है। पेपर यह दावा नहीं करता है कि यह सभी वास्तविक दुनिया के परिदृश्यों के लिए एक हल की गई समस्या है, बल्कि यह एक शक्तिशाली नया उपकरण है जो बताता है कि हम जटिल सिस्टम व्यवहारों की खोज को स्वचालित कर सकते हैं जो पहले असंभव था।

संक्षेप में, CED_AR एक टीम को एक विशाल, अज्ञात जंगल (सभी संभावित सिस्टम मॉडलों का स्थान) के मानचित्र और एक दिशा-सूचक यंत्र (लक्ष्य) देने जैसा है। बिना किसी उद्देश्य के भटकने के बजाय, वे सबसे सुंदर, उपयोगी स्थानों को खोजने के लिए एक स्मार्ट रणनीति का उपयोग करते हैं, अक्सर ऐसे रास्ते खोजते हैं जिन्हें एक मानव हाइकर ने कभी खोजने के बारे में नहीं सोचा होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →