← नवीनतम पेपर
🤖 machine learning

From Search to Synthesis: Training LLMs as Zero-Shot Workflow Generators

यह शोध पत्र MetaFlow को प्रस्तुत करता है, जो एक दो-चरणीय प्रशिक्षण ढांचा है जो सुपरवाइज्ड फाइन-ट्यूनिंग को सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) के साथ जोड़ता है ताकि बड़े भाषा मॉडलों को बिना किसी मैनुअल डिज़ाइन की आवश्यकता के विविध कार्यों के लिए मजबूत, पुन: प्रयोज्य और सामान्यीकरण योग्य ज़ीरो-शॉट वर्कफ़्लो उत्पन्न करने में सक्षम बनाया जा सके।

मूल लेखक: Gan Luo, Zihan Qin, Bin Dong, Wotao Yin

प्रकाशित 2026-07-01
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gan Luo, Zihan Qin, Bin Dong, Wotao Yin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ पेपर "From Search to Synthesis: Training LLMs as Zero-Shot Workflow Generators" (MetaFlow) की व्याख्या सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके दी गई है।

बड़ी समस्या: "वन-ऑफ" (एक बार का) बनाम "मास्टर ब्लूप्रिंट"

कल्पना कीजिए कि आप एक शेफ (रसोइया) हैं।

  • वर्तमान AI (द "वन-ऑफ" शेफ): यदि आप एक मानक लार्ज लैंग्वेज मॉडल (LLM) से कोई भोजन बनाने के लिए कहते हैं, तो वह हर बार आपके विशिष्ट ऑर्डर को देखता है और शून्य से एक नई रेसिपी बनाता है। यदि आप आज एक बर्गर मांगते हैं और कल भी एक बर्गर मांगते हैं, तो वह दो पूरी तरह से अलग रेसिपी लिख सकता है। यह काम करता है, लेकिन यह असंगत है, इसे डीबग करना कठिन है, और यदि आप 1,000 लोगों के लिए खाना बनाना चाहते हैं, तो शेफ को 1,000 अलग-अलग रेसिपी लिखनी पड़ती हैं।
  • इसे ठीक करने का पुराना तरीका (द "सर्च" शेफ): कुछ शोधकर्ताओं ने इस समस्या को हल करने के लिए शेफ को किसी विशेष प्रकार के व्यंजन (जैसे "इटालियन पास्ता") के लिए परफेक्ट रेसिपी खोजने के लिए हजारों संभावित रेसिपी में से घंटों तक खोजने के लिए लगाया। लेकिन यहाँ एक पेंच है: यदि आप अचानक "मैक्सिकन टैकोस" मांगते हैं, तो शेफ को पूरी खोज प्रक्रिया फिर से शून्य से शुरू करनी पड़ती है। यह धीमा और महंगा है।
  • दूसरा पुराना तरीका (द "इंस्टेंस" शेफ): अन्य तरीके हर एक ग्राहक के लिए व्यक्तिगत रूप से एक परफेक्ट रेसिपी लिखने की कोशिश करते हैं। यह उस एक ग्राहक के लिए बहुत अच्छा है, लेकिन यह समय की बर्बादी है क्योंकि "स्पाइसी टैकोस" की रेसिपी मूल रूप से "माइल्ड टैकोस" जैसी ही होती है। आप बार-बार एक ही निर्देश लिखते रह जाते हैं।

समाधान: MetaFlow (द "मास्टर शेफ अप्रेंटिस")

लेखक MetaFlow पेश करते हैं, जो AI को प्रशिक्षित करने का एक नया तरीका है। AI को केवल एक भोजन के लिए रेसिपी लिखने या हर बार रेसिपी खोजने के बजाय, वे इसे एक मास्टर ब्लूप्रिंट डिज़ाइनर बनना सिखाते हैं।

MetaFlow खाना पकाने के सिद्धांतों को सीखता है। एक बार प्रशिक्षित होने के बाद, यदि आप इसे एक नया प्रकार का व्यंजन (एक नया "Task") और उपकरणों का एक नया सेट (एक नया "Operator Set") देते हैं, तो यह बिना खोज या पुन: प्रशिक्षण के तुरंत एक परफेक्ट, पुन: प्रयोज्य रेसिपी (एक "Workflow") लिख सकता है।

उपमा (Analogy):
MetaFlow को एक मास्टर आर्किटेक्ट के रूप में सोचें जिसने हजारों घरों का अध्ययन किया है।

  • यदि आप "लकड़ी" का उपयोग करके एक "बीच हाउस" (समुद्र तट पर बना घर) मांगते हैं, तो वे तुरंत उसका ब्लूप्रिंट बना देते हैं।
  • यदि आप "पत्थर" का उपयोग करके एक "माउंटेन केबिन" (पहाड़ी झोपड़ी) मांगते हैं (ऐसे उपकरण जो उन्होंने पहले कभी नहीं देखे), तो वे घबराते नहीं हैं। वे पत्थर के साथ निर्माण करने के अपने गहरे ज्ञान का उपयोग करके तुरंत एक नया, परफेक्ट ब्लूप्रिंट बना लेते हैं।
  • उन्हें सही डिज़ाइन खोजने के लिए हफ्तों खर्च करने की आवश्यकता नहीं है; वे बस इसे "जानते" हैं।

उन्होंने AI को कैसे सिखाया (दो-चरणीय प्रशिक्षण)

एक मानक AI को इस मास्टर ब्लूप्रिंट डिज़ाइनर में बदलने के लिए, शोधकर्ताओं ने दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग किया:

1. "होमवर्क" चरण (सुपरवाइज्ड फाइन-ट्यूनिंग)
सबसे पहले, उन्होंने AI को हजारों उदाहरण दिखाए कि "Task + Tools = Perfect Workflow"।

  • उपमा: कल्पना कीजिए कि एक छात्र एक भाषा के व्याकरण के नियमों को याद कर रहा है और एक परफेक्ट निबंध कैसे लिखा जाता है, इसके उदाहरण देख रहा है। वे अभी समस्याओं को हल नहीं कर रहे हैं; वे केवल सिंटैक्स (syntax) सीख रहे हैं ताकि वे अर्थहीन शब्द न लिखें। यह सुनिश्चित करता है कि AI ऐसा कोड लिखे जो वास्तव में चलता हो।

2. "ट्रायल एंड एरल" चरण (रीइन्फोर्समेंट लर्निंग)
इसके बाद, उन्होंने AI को अपने आप समस्याओं को हल करने के लिए छोड़ दिया।

  • सेटअप: AI एक वर्कफ़्लो जनरेट करता है। सिस्टम इसे वास्तविक समस्याओं (जैसे गणित के प्रश्न या कोडिंग कार्य) पर चलाता है।
  • स्कोर: यदि वर्कफ़्लो समस्या को हल कर देता है, तो AI को एक "गोल्ड स्टार" (पुरस्कार) मिलता है। यदि यह विफल हो जाता है, तो उसे "थम्स डाउन" मिलता है।
  • जादुई ट्रिक (CRN): सीखने को निष्पक्ष बनाने के लिए, शोधकर्ताओं ने यह सुनिश्चित किया कि AI अपने सभी अलग-अलग विचारों का परीक्षण उसी सेट की समस्याओं पर एक ही समय में करे।
    • क्यों? कल्पना कीजिए कि दो धावक दौड़ रहे हैं। यदि एक धूप वाले दिन दौड़ता है और दूसरा बारिश वाले दिन, तो आपको पता नहीं चलेगा कि वास्तव में कौन तेज़ है। उन्हें एक ही ट्रैक पर एक ही समय में चलाकर, आप जानते हैं कि कौन सी रणनीति बेहतर थी। इसने AI को तेज़ी से और अधिक सटीक रूप से सीखने में मदद की।

उन्होंने क्या पाया (परिणाम)

पेपर का दावा है कि MetaFlow तीन मुख्य कारणों से गेम-चेंजर है:

1. यह तेज़ और सस्ता है (जीरो-शॉट)
प्रशिक्षित होने के बाद, MetaFlow एक ही चरण में काम करने वाला वर्कफ़्लो जनरेट कर सकता है।

  • तुलना: अन्य तरीकों को एक अच्छी रेसिपी खोजने के लिए हजारों सिमुलेशन चलाने की आवश्यकता हो सकती है। MetaFlow बस एक बार रेसिपी लिखता है, और वह काम करती है।

2. यह एक गिरगिट की तरह है (सामान्यीकरण/Generalization)
यह सबसे प्रभावशाली हिस्सा है। शोधकर्ताओं ने MetaFlow का परीक्षण उन चीजों पर किया जिन्हें उसने पहले कभी नहीं देखा था

  • परीक्षण: उन्होंने इसे "VectorSearch" नामक एक नया टूल दिया (जो विशाल डेटाबेस में खोजने का एक तरीका है) जिसका उपयोग प्रशिक्षण के दौरान कभी नहीं किया गया था।
  • परिणाम: MetaFlow ने न केवल उस टूल का उपयोग किया; बल्कि इसने जटिल, बहु-चरणीय प्रश्नों (जैसे कि एक ऐसा उत्तर ढूंढना जिसके लिए तीन अलग-अलग दस्तावेज़ों को पढ़ने की आवश्यकता हो) को हल करने के लिए इसे अन्य टूल्स के साथ कैसे जोड़ा, यह भी समझ लिया। इसने इन नए कार्यों पर मानक तरीकों की तुलना में 60% सुधार हासिल किया।

3. यह विश्वसनीय है
क्योंकि MetaFlow पूरे कार्य के प्रकार के लिए एक एकल, पुन: प्रयोज्य ब्लूप्रिंट बनाता है, इसलिए इसे उस AI की तुलना में डीबग करना और भरोसा करना आसान है जो हर सवाल के लिए एक नया समाधान बनाता है।

कमी (सीमाएं)

पेपर एक खामी के बारे में ईमानदार है: क्योंकि MetaFlow एक ही बार में "परफेक्ट" ब्लूप्रिंट लिखने की कोशिश करता है, इसलिए कभी-कभी यह सिंटैक्स एरर (कोड में टाइपो/गलती) कर देता है।

  • आंकड़ा: लगभग 31% बार, जनरेट किया गया वर्कफ़्लो इन त्रुटियों के कारण चलने में विफल रहता है।
  • समझौता: इन विफलताओं के बावजूद, इसके द्वारा बनाए गए सर्वश्रेष्ठ वर्कफ़्लोज़ इतने अच्छे होते हैं कि वे प्रतिस्पर्धा को पीछे छोड़ देते हैं। लेखक सुझाव देते हैं कि भविष्य में, AI को सिस्टम के साथ बातचीत करके "अपने टाइपो को ठीक करना" सिखाया जा सकता है, लेकिन फिलहाल, यह एक "वन-शॉट" दृष्टिकोण है।

सारांश

MetaFlow एक AI को ईंट जोड़ने वाले (bricklayer) के बजाय एक मास्टर आर्किटेक्ट बनने की शिक्षा देने जैसा है। हर दीवार के लिए ईंटें रखने (इंस्टेंस-लेवल) या हर नए भवन प्रकार के अनुरोध के लिए ब्लूप्रिंट खोजने (टास्क-लेवल सर्च) के बजाय, MetaFlow निर्माण के विज्ञान को सीखता है। यह इसे किसी भी नए प्रकार के भवन और किसी भी नए टूल सेट के लिए तुरंत परफेक्ट, पुन: प्रयोज्य संरचनाएं डिजाइन करने में सक्षम बनाता है, जिससे समय और कंप्यूटिंग पावर की भारी बचत होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →