← नवीनतम पेपर
💬 NLP

On Time, Within Budget: Constraint-Driven Online Resource Allocation for Agentic Workflows

यह शोध पत्र मोंटे कार्लो पोर्टफोलियो प्लानिंग (MCPP) को प्रस्तुत करता है, जो एक हल्का क्लोज्ड-लूप प्लानर है जो सिम्युलेटेड परिणामों के आधार पर मॉडल्स और समानांतर सैंपल्स को गतिशील रूप से आवंटित करके स्पष्ट बजट और समय सीमा की बाधाओं के भीतर एजेंटिक वर्कफ्लो को पूरा करने की संभावना को अनुकूलित करता है।

मूल लेखक: Xinglin Wang, Zishen Liu, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinglin Wang, Zishen Liu, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक निर्माण दल (construction crew) के प्रबंधक हैं जिसे एक जटिल घर बनाने का काम सौंपा गया है (एजेंटिक वर्कफ़्लो - Agentic Workflow)। आपके पास एक सख्त नियम है: घर शुक्रवार शाम 5 बजे तक पूरा हो जाना चाहिए (डेडलाइन) और आप $10,000 से अधिक खर्च नहीं कर सकते (बजट)।

आपका दल विभिन्न विशेषज्ञों से बना है (मॉडेल्स): कुछ तेज़ लेकिन महंगे हैं, कुछ धीमे लेकिन सस्ते हैं, और कुछ अनिश्चित (hit-or-miss) हैं। आपकी निर्माण योजना एक मानचित्र की तरह है जो दिखाती है कि कौन से कमरे अन्य कमरों से पहले बनाए जाने चाहिए (डिपेंडेंसीज़)।

पुराना तरीका: "औसत का अनुकूलन" (Optimizing the Average)

पहले, शोधकर्ता हर काम के लिए एक "परफेक्ट" विशेषज्ञ खोजने की कोशिश करते थे जो औसत पर आधारित हो। वे पूछते थे: "कौन सा कार्यकर्ता गति, लागत और गुणवत्ता का सबसे अच्छा संतुलन देता है?"

समस्या: यह एक कर्मचारी को उसके बायोडाटा (resume) के आधार पर काम पर रखने जैसा है, और फिर उसे बिना किसी योजना के साइट पर भेज देना कि अगर बारिश हो गई या कोई कर्मचारी काम छोड़ गया तो क्या होगा। भले ही आप "सर्वश्रेष्ठ औसत" श्रमिकों को काम पर रख लें, फिर भी आप बुधवार तक पैसा खत्म कर सकते हैं या शुक्रवार की डेडलाइन मिस कर सकते हैं क्योंकि आपने इस विशिष्ट कार्य की विशिष्ट अराजकता (chaos) को ध्यान में नहीं रखा।

नया तरीका: "कन्स्ट्रेंट-ड्रिवन ऑनलाइन एलोकेशन" (Constraint-Driven Online Allocation)

यह पेपर MCPP (मोंटे कार्लो पोर्टफोलियो प्लानिंग) नामक एक नया दृष्टिकोण पेश करता है। केवल "सबसे अच्छे" कार्यकर्ता को चुनने के बजाय, MCPP एक सुपर-स्मार्ट, रियल-टाइम प्रोजेक्ट मैनेजर की तरह काम करता है जो लगातार योजना बदलता रहता है।

MCPP कैसे काम करता है, इसे सरल उपमाओं (analogies) के माध्यम से यहाँ समझाया गया है:

1. "क्या होगा अगर" सिम्युलेटर (मोंटे कार्लो)

निर्णय लेने से पहले, MCPP केवल अनुमान नहीं लगाता। यह अपने दिमाग में शेष निर्माण परियोजना के हजारों सिम्युलेटेड मूवी (Simulated Movies) चलाता है।

  • परिदृश्य A: "यदि मैं किचन के लिए महंगे और तेज़ कार्यकर्ता को काम पर रखता हूँ, तो क्या मेरे पास छत को समय पर पूरा करने के लिए पर्याप्त पैसा बचेगा?"
  • परिदृश्य B: "यदि मैं किचन के लिए सस्ते और धीमे कार्यकर्ता को काम पर रखता हूँ, तो क्या हम डेडलाइन मिस कर देंगे?"

यह इन परिणामों को बार-बार सिम्युलेट करता है ताकि उस पथ (path) को देखा जा सके जिसमें $10,000 और शुक्रवार की डेडलाइन के भीतर पूरा घर बनाने की उच्चतम संभावना हो।

2. रणनीतियों का "पोर्टफोलियो" (The "Portfolio" of Strategies)

MCPP केवल एक तरीके को नहीं देखता। यह कई अलग-अलग रणनीतियों का एक पोर्टफोलियो तैयार रखता है:

  • रूढ़िवादी रणनीति (Conservative Strategy): "सस्ते कार्यकर्ता का उपयोग करें और बेहतर की उम्मीद करें।"
  • आक्रामक रणनीति (Aggressive Strategy): "गति सुनिश्चित करने के लिए अभी बड़ा पैसा खर्च करें।"
  • हाइब्रिड रणनीति (Hybrid Strategy): "कठिन हिस्सों के लिए तेज़ कार्यकर्ता का उपयोग करें और आसान हिस्सों के लिए सस्ते कार्यकर्ता का।"

यह इन सभी रणनीतियों के हर संभावित संयोजन का शेष समय और बजट के विरुद्ध परीक्षण करता है।

3. "री-प्लान" लूप (क्लोज्ड-लूप)

यह सबसे महत्वपूर्ण हिस्सा है। MCPP शुरुआत में एक योजना नहीं बनाता और उस पर टिका नहीं रहता।

  • चरण 1: यह सिमुलेशन के आधार पर अभी के लिए सबसे अच्छा एक्शन चुनता है।
  • चरण 2: यह वास्तविक दुनिया में उस एक्शन को निष्पादित (execute) करता है।
  • चरण 3: यह देखता है कि क्या हुआ। क्या कार्यकर्ता सफल रहा? क्या इसमें उम्मीद से अधिक समय लगा? क्या इसकी लागत बढ़ गई?
  • चरण 4: यह तुरंत सिमुलेशन को फिर से चलाता है और नई वास्तविकता के आधार पर अगले चरण के लिए नया सबसे अच्छा एक्शन चुनता है।

यह एक GPS की तरह है जो आपको केवल एक बार रूट नहीं बताता, बल्कि हर बार जब आप ट्रैफिक जाम या मोड़ पर फंसते हैं, तो पूरे रास्ते की फिर से गणना करता है, जिससे यह सुनिश्चित होता है कि आप अभी भी आपके पास मौजूद पैसे के साथ शाम 5 बजे तक पहुँच जाएँ।

यह क्यों महत्वपूर्ण है?

इस पेपर का परीक्षण दो प्रकार के "निर्माण प्रोजेक्ट्स" पर किया गया:

  1. CodeFlow: कंप्यूटर कोड लिखना जहाँ एक चरण दूसरे पर निर्भर करता है।
  2. ProofFlow: जटिल गणितीय प्रमाण (math proofs) हल करना जहाँ चरण एक तार्किक श्रृंखला का पालन करते हैं।

परिणाम:
जब बजट और समय बहुत कम था ("कठिन" बाधाएं/constraints), तो MCPP पुराने तरीकों की तुलना में काम पूरा करने में बहुत बेहतर था।

  • पुराने तरीके अक्सर पैसे या समय की कमी के कारण विफल हो गए क्योंकि वे विशिष्ट स्थिति के अनुसार खुद को ढाल नहीं पाए।
  • MCPP ने कठिन कार्यों (घर के सबसे कठिन हिस्सों) के लिए पैसा बचाकर और आसान हिस्सों पर कम खर्च करके इन कठिन बाधाओं को सफलतापूर्वक पार किया।

मुख्य निष्कर्ष (The Bottom Line)

यह पेपर तर्क देता है कि वास्तविक दुनिया में, हमें केवल एक ऐसा एजेंट नहीं चाहिए जो "सामान्य रूप से कुशल" हो। हमें एक ऐसा एजेंट चाहिए जो एक विशिष्ट परिणाम की गारंटी दे सके: "क्या आप यह विशिष्ट काम शुक्रवार तक $100 से कम में पूरा कर सकते हैं?"

MCPP भविष्य को लगातार सिम्युलेट करके, वास्तविकता के अनुकूल होकर और हर कदम पर गति, लागत और जोखिम के बीच स्मार्ट ट्रेड-ऑफ (समझौता) करके, पिछले तरीकों की तुलना में "हाँ" अधिक बार कहता है। यह एक कठोर योजना को एक लचीली, जीवित रणनीति में बदल देता है जो वास्तविक दुनिया के निष्पादन की अराजकता में भी जीवित रहती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →