← नवीनतम पेपर
💬 NLP

Global Optimization and Inference-Time Region Grafting for Agentic Workflows

यह शोध पत्र GRAFT को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free) विधि है जो एजेंटिक वर्कफ़्लो को लेबल-मुक्त गुणवत्ता संकेतों का उपयोग करके विफल निष्पादन क्षेत्रों को बेहतर विकल्पों के साथ अनुकूल रूप से बदलने में सक्षम बनाती है, जिससे पूरे-वर्कफ़्लो के महंगे पुन: अनुकूलन (re-optimization) की आवश्यकता के बिना इंस्टेंस-वार अनुकूलन और विविध कार्यों में बेहतर प्रदर्शन प्राप्त होता है।

मूल लेखक: Donghyeok Koh, Gyuwan Kim, Jinyeong Bak, Seung-Hoon Na, Tao Yang, Haneol Jang, Cheoneum Park

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Donghyeok Koh, Gyuwan Kim, Jinyeong Bak, Seung-Hoon Na, Tao Yang, Haneol Jang, Cheoneum Park

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल पहेली को सुलझाने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन पहेलियों को "एजेंटिक वर्कफ्लो" (agentic workflows) कहा जाता है। केवल एक स्मार्ट कंप्यूटर से यह पूछने के बजाय कि "इसे हल करो," हम उसे एक विशिष्ट रेसिपी देते हैं—एक चरण-दर-चरण योजना जिसमें तथ्यों की खोज करने, आगे की योजना बनाने, अपने काम की जांच करने और उत्तर को परिष्कृत करने जैसे विभिन्न उपकरण शामिल होते हैं। इसे एक रसोईघर की तरह समझें जहाँ एक मुख्य शेफ (AI) केवल खाना नहीं बनाता; उनके पास काटने के लिए एक सहायक शेफ है, स्वाद परखने के लिए एक टेस्टर है, और मेनू व्यवस्थित करने के लिए एक प्लानर है।

लंबे समय से, वैज्ञानिक हर प्रकार की पहेली के लिए एक परफेक्ट रेसिपी खोजने की कोशिश कर रहे हैं। वे चरणों के सर्वोत्तम क्रम का पता लगाने के लिए हजारों परीक्षण ऑफलाइन करते हैं। लेकिन समस्या यह है कि हर तरह की पहेली एक जैसी नहीं होती। एक साधारण गणित की समस्या के लिए केवल एक त्वरित 'काटने' की आवश्यकता हो सकती है, जबकि एक कठिन ऐतिहासिक प्रश्न के लिए गहरी खोज और दोबारा जांच की आवश्यकता हो सकती है। यदि आप हर पहेली के लिए एक ही कठोर रेसिपी का उपयोग करते हैं, तो आप फंस सकते हैं या मूर्खतापूर्ण गलती कर सकते हैं क्योंकि योजना उस विशिष्ट क्षण के लिए पर्याप्त लचीली नहीं थी। बड़ा सवाल यह है: क्या हम एक बेहतरीन, पूर्व-नियोजित रेसिपी को बनाए रख सकते हैं और फिर भी उस विशिष्ट व्यंजन के लिए जो हम अभी बना रहे हैं, चरणों में बदलाव कर सकते हैं, बिना सब कुछ फिर से शुरू किए?

यह बिल्कुल वही है जिसे पेपर "ग्लोबल ऑप्टिमाइजेशन एंड इंफरेंस-टाइम रीजन ग्राफ्टिंग इन एजेंटिक वर्कफ्फ़्लो" (Global Optimization and Inference-Time Region Grafting for Agentic Workflows) संबोधित करता है। लेखक एक नया सिस्टम पेश करते हैं जिसे GRAFT कहा जाता है। एक निश्चित योजना पर टिके रहने या हर सवाल के लिए पूरे पहिए का पुनर्जन्म करने के बजाय, GRAFT एक ऐसे मास्टर शेफ की तरह कार्य करता है जिसके पास किसी विशिष्ट भोजन के लिए एक "गोल्डन रेसिपी" है, लेकिन यदि स्वाद परीक्षण कहता है कि उन्हें एक या दो सामग्रियों को बदलने की आवश्यकता है, तो वह उन्हें बदलने के लिए तैयार है।

वास्तविक दुनिया में यह कैसे काम करता है, यहाँ बताया गया है: सबसे पहले, सिस्टम गणित या कोडिंग जैसे कार्यों की एक पूरी श्रेणी के लिए एक वैश्विक रूप से अनुकूलित वर्कफ्फ़्लो ( "गोल्डन रेसिपी") पाता है। यह AI द्वारा प्रश्न पूछना शुरू करने से पहले होता है। फिर, जब कोई विशिष्ट प्रश्न आता है, तो GRAF केवल रेसिपी को आँख मूंदकर नहीं चलाता है। यह रेसिपी को छोटे, आत्मनिर्भर खंडों में तोड़ देता है जिन्हें "रीजन" (regions) कहा जाता है। जैसे-जैसे AI समस्या पर काम करता है, वह प्रत्येक क्षेत्र की जांच करता है। यदि कोई क्षेत्र (जैसे "तर्क" वाला चरण) संघर्ष कर रहा है या कमजोर परिणाम दे रहा है, तो GRAFT उस विशिष्ट खंड को चलते समय एक बेहतर संस्करण के साथ बदल देता है।

महत्वपूर्ण रूप से, यह बदलाव बिना यह जाने किए जाता है कि सही उत्तर क्या है (जो वास्तविक समय के उपयोग के दौरान लगभग असंभव होता है)। इसके बजाय, सिस्टम गुणवत्ता का निर्णय लेने के लिए चतुर "लेबल-फ्री" (label-free) संकेतों का उपयोग करता है। उदाहरण के लिए, गणित में, यह एक ही समस्या को पांच अलग-अलग तरीकों से चला सकता है और देख सकता है कि क्या वे सभी सहमत हैं (एक तकनीक जिसे सेल्फ-कंसिस्टेंसी कहा जाता है)। कोडिंग में, यह कोड चलाकर देख सकता है कि क्या वह परीक्षणों को पास करता है। यदि किसी चरण का नया संस्करण बेहतर दिखता है और अगले चरण के साथ संबंध को नहीं तोड़ता है, तो GRAFT उसे "ग्राफ्ट" (जोड़) देता है। यदि नहीं, तो यह मूल को बनाए रखता है। यह हर इनपुट के लिए तुरंत होता है।

पेपर पाता है कि यह दृष्टिकोण एक गेम-चेंजर है। गणित की समस्याओं (जैसे GSM8K और MATH) से लेकर कोडिंग कार्यों (HumanEval) और जटिल प्रश्नों (HotpotQA) तक पांच अलग-अलग बेंचमार्क पर परीक्षण किए जाने पर, GRAF ने पिछले सर्वश्रेष्ठ तरीके, जिसे MaAS कहा जाता है, से औसतन 3.85 अंक अधिक प्राप्त किए। AI बेंचमार्क की दुनिया में, यह एक बड़ी छलांग है। उदाहरण के लिए, GSM8K गणित डेटासेट पर, GRAF ने 95.04 स्कोर किया, जो अगले सर्वश्रेष्ठ तरीके को पछाड़ दिया जिसने 92.30 स्कोर किया था।

लेखकों ने "रेसिपी" के बारे में भी एक दिलचस्प बात खोजी। उन्होंने पाया कि एक अनुकूलित वर्कफ्फ़्लो केवल निर्देशों का एक स्थिर सेट नहीं है; यह एक लचीवी पॉलिसी है। भले ही उन्होंने वर्कफ्फ़्लो को बदले बिना "शेफ" (अंतर्निहित AI मॉडल) को एक मजबूत मॉडल से बदल दिया हो, प्रदर्शन बढ़ गया। यह सुझाव देता है कि एक अच्छा वर्कफ्फ़्लो अनुकूलन योग्य है; यह काम करने के लिए एक स्मार्ट टूल का उपयोग करके बेहतर हो सकता है, बिना पुन: डिज़ाइन किए।

हालाँकि, पेपर इस बात पर ध्यान देने में सावधानी बरतता है कि यह जादू कहाँ काम करता है और कहाँ इसकी सीमा आती है। गुणवत्तापूर्ण कार्य को मापने के लिए उपयोग किए जाने वाले "लेबल-फ्री" संकेत गणित और कोडिंग के लिए बहुत अच्छी तरह काम करते हैं, जहाँ उत्तर या तो सही होता है या गलत। लेकिन जटिल ज्ञान संबंधी प्रश्नों (जैसे इतिहास या विज्ञान के बारे में) के लिए, संकेत कम विश्वसनीय हैं, और सिस्टम उतना सुधार नहीं करता है। लेखक सुझाव देते हैं कि हालांकि GRAF वर्कफ्फ़्लो को वास्तविक समय में अनुकूलित करने का एक शक्तिशाली तरीका है, यह अंतिम उत्तर जाने बिना किसी चरण की गुणवत्ता को सत्यापित करने की क्षमता पर बहुत अधिक निर्भर करता है।

संक्षेप में, GRAF साबित करता है कि आपको एक कठोर, पूर्व-नियोजित रणनीति और एक अराजक, मनमाने ढंग से काम करने वाले दृष्टिकोण के बीच चयन करने की आवश्यकता नहीं है। एक ठोस आधार पर छोटे, स्मार्ट समायोजन को ग्राफ्ट करके, AI एजेंट अधिक मजबूत, कुशल और सटीक बन सकते हैं, और उन समस्याओं को हल कर सकते हैं जो पहले एक ही आकार के प्लान के लिए बहुत कठिन थीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →