Coupled Hierarchical Search over Topology and Execution for Agentic Workflow Synthesis
HierFlow एक प्रशिक्षण-मुक्त (training-free), टेस्ट-टाइम आर्किटेक्चर है जो एक युग्मित पदानुक्रमित खोज प्रतिमान (coupled hierarchical search paradigm) को नियोजित करके एजेंटिक वर्कफ़्लो संश्लेषण को स्वचालित करता है, जो विविध बेंचमार्क पर बेहतर प्रदर्शन और दक्षता प्राप्त करने के लिए टोपोलॉजी समायोजन को निष्पादन-स्तर के अनुकूलन के साथ गतिशील रूप से एकीकृत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को एक बहुत ही कठिन पहेली हल करना सिखाने की कोशिश कर रहे हैं, जैसे कि कोई जटिल गणित की समस्या या कोई पेचीदा कोडिंग चुनौती। आप रोबोट को सिर्फ यह नहीं कह सकते कि "इसे सुलझा लो" और उम्मीद नहीं कर सकते कि वह खुद कर लेगा; उसे एक योजना की आवश्यकता है, एक चरण-दर-चरण रेसिपी की कि पहले क्या करना है, दूसरा क्या, और तीसरा क्या। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इन योजनाओं को वर्कफ्लो (workflows) कहा जाता है। एक वर्कफ्लो को एक खजाने की खोज के मानचित्र की तरह समझें: यह रोबोट को बताता है कि कहाँ खुदाई करनी है, सुराग कब ढूँढना है, और औजारों का उपयोग कैसे करना है ताकि खजाना मिल सके।
लंबे समय तक, इंसानों को ये मानचित्र हाथ से बनाने पड़ते थे। यदि पहेली बदल जाती थी, तो मानचित्र अक्सर बेकार हो जाता था, और इंसानों को फिर से शुरुआत करनी पड़ती थी। हाल ही में, वैज्ञानिकों ने यह पता लगाया कि रोब образом अपना स्वयं का मानचित्र कैसे बनाया जाए। लेकिन यहाँ एक पेंच है: संभावित मानचित्रों की संख्या इतनी विशाल है कि यह दुनिया के हर समुद्र तट पर एक विशिष्ट रेत के कण को खोजने जैसा है। यदि रोबोट हर एक मानचित्र की जाँच करने की कोशिश करता है, तो इसमें बहुत समय लगता है और उसका दिमाग (या उसका कंप्यूटर बजट) खत्म हो जाता है। इसलिए, बड़ा सवाल वैज्ञानिकों के लिए यह है: हम रोबोट को यह कैसे सिखा सकते हैं कि बिना किसी खराब मानचित्र पर समय बर्बाद किए और बिना पहले से कुछ नया सीखने के लिए स्कूल वापस जाए, किसी विशिष्ट पहेली के लिए सबसे अच्छा मानचित्र जल्दी से कैसे खोजा जाए?
यहीं पर HierFlow नामक एक नया विचार आता है। इस शोधपत्र के पीछे के शोधकर्ताओं ने, डोंग ली और उनके सहयोगियों के नेतृत्व में, यह महसूस किया कि एक बार में पूर्ण मानचित्र खोजने के बजाय, आपको इसे परतों में बनाना चाहिए, जैसे कि एक निर्माण दल (construction crew)। वे दो-चरणीय नृत्य का सुझाव देते हैं: पहले योजना की एक कच्ची रूपरेखा तैयार करें (टोपोलॉजी), और फिर, केवल यदि आवश्यक हो, तो प्रत्येक चरण के विशिष्ट विवरणों को ठीक करने के लिए ज़ूम इन करें (एक्जीक्यूशन)।
यह उनका जादू कैसे काम करता है, यहाँ देखें। कल्पना कीजिए कि आप एक बड़े स्कूल नाटक का आयोजन कर रहे हैं। टॉप लेवल (Top Level) निर्देशक है। निर्देशक इस बात की चिंता नहीं करता कि वेशभूषा कैसे सीली जाए या सेट कैसे पेंट किया जाए; वे बस बड़ी तस्वीर तय करते हैं: "पहले, हम मंच बनाते हैं। फिर, हम कलाकारों का चयन करते हैं। अंत में, हम रिहर्सल करते हैं।" यह टोपोलॉजी सर्च (Topology Search) है। निर्देशक इन बड़े चरणों का एक सरल फ्लोचार्ट बनाता है।
लेकिन क्या होगा यदि निर्देशक की योजना में कोई दोष हो? शायद कलाकारों के चयन से पहले मंच नहीं बनाया जा सकता क्योंकि कलाकारों को मंच डिजाइन करने में मदद करने के लिए अपनी लाइनों को जानने की आवश्यकता होती है। निर्देशक को यह अभी पता नहीं चल सकता। यहाँ लोअर लेवल (Lower Level) आता है। इसे विशेष रूप से प्रशिक्षित स्टेजहैंड्स (stagehands) की एक टीम के रूप में सोचें। जब निर्देशक कहता है, "मंच बनाओ," तो स्टेजहैंड्स केवल बिना सोचे-समझे हथौड़ा चलाना शुरू नहीं करते हैं। वे एक त्वरित, स्मार्ट परीक्षण चलाते हैं (एक विधि का उपयोग करके जो मोंटे कार्लो ट्री सर्च (Monte Carlo Tree Search) नामक एक खेल से प्रेरित है, जो यह देखने के लिए कि कौन जीतता है, आपके दिमाग में संभावित भविष्य के कुछ दृश्यों को खेलने जैसा है)। वे मंच बनाने के कुछ अलग तरीके आजमाते हैं। यदि वे किसी बाधा से टकराते हैं या महसूस करते हैं कि योजना असंभव है, तो वे निर्देशक को एक संकेत भेजते हैं: "हे, यह क्रम काम नहीं करता! चलिए चरणों को बदलते हैं।"
HierFlow का सबसे शानदार हिस्सा इसकी एडेप्टिव गेटिंग (Adaptive Gating) है। अतीत में, रोबोट योजना के हर एक चरण को ठीक करने की कोशिश करते थे, भले ही वह चरण पहले से ही एकदम सही हो। यह एक शेफ द्वारा सूप के हर एक नमक के दाने को चखने जैसा है, भले ही सूप पहले से ही स्वादिष्ट हो। HierFlow अधिक स्मार्ट है। इसमें एक "गेटकीपर" है जो पूछता है, "क्या यह चरण वास्तव में टूटा हुआ या भ्रमित करने वाला है?" यदि उत्तर "नहीं" है, तो गेट बंद रहता है, और रोबोट अपनी ऊर्जा बचाता है। यदि उत्तर "हाँ" है, तो गेट खुल जाता है, और स्टेजहैंड्स विवरणों को ठीक करने के लिए ज़ूम इन करते हैं। यह बहुत सारा समय और कंप्यूटर पावर बचाता है।
शोधपत्र दिखाता है कि यह तरीका अविश्वसनीय रूप से अच्छा काम करता है। जब उन्होंने कठिन चुनौतियों जैसे कि पेचीदा सवालों के जवाब देने, गणित की समस्याओं को हल करने और कोड लिखने पर HierFlow का परीक्षण किया, तो इसने उन लगभग सभी अन्य तरीकों को पछाड़ दिया जिनसे इसकी तुलना की गई थी। इसने न केवल बेहतर उत्तर दिए; बल्कि उन्हें तेज़ और सस्ते तरीके से प्राप्त किया। शोधकर्ताओं ने पाया कि "निर्देशक" और "स्टेजहैंड्स" को एक-दूसरे से बात करने देने से, रोबोट बिना किसी अतिरिक्त प्रशिक्षण के चलते-चलते अपनी गलतियों को सुधार सकता था। यह एक आत्म-सुधार करने वाले कंपास देने जैसा है जो रास्ता कितना भी घुमावदार क्यों न हो, उसे समाधान की ओर सीधा रखता है।
संक्षेप में, HierFlow सुझाव देता है कि हमें रोबोटों को हर संभावित समाधान को रटने के लिए मजबूर करने की आवश्यकता नहीं है। इसके बजाय, हम उन्हें एक योजना का खाका खींचना, यह जांचना कि क्या वह समझ में आता है, और केवल तभी विवरणों में गहराई से उतरना सिखा सकते हैं जब उन्हें वास्तव में आवश्यकता हो। यह AI को स्मार्ट, तेज़ और अधिक लचीला बनाने का एक तरीका है, जो एक आदर्श योजना की अराजक खोज को एक सुव्यवस्थित, संगठित निर्माण परियोजना में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।