← नवीनतम पेपर
🤖 AI

Evoflux: Inference-Time Evolution of Executable Tool Workflows for Compact Agents

यह शोध पत्र Evoflux को प्रस्तुत करता है, जो एक इन्फरेंस-टाइम इवोल्यूशनरी सर्च विधि है जो संरचित संपादन और निष्पादन फीडबैक के माध्यम से टाइप किए गए वर्कफ्लो ग्राफों की गतिशील रूप से मरम्मत और अनुकूलन करके कॉम्पैक्ट लैंग्वेज मॉडल्स के लिए टूल वर्कफ्लो की निष्पादन व्यवहार्यता में महत्वपूर्ण सुधार करता है, और लाइव टूल वातावरण में पारंपरिक सुपरवाइज्ड फाइन-ट्यूनिंग और रीइन्फोर्समेंट लर्निंग दृष्टिकोणों से बेहतर प्रदर्शन करता है।

मूल लेखक: Kushal Raj Bhandari, Ling Yue, Ching-Yun Ko, Dhaval Patel, Shaowu Pan, Pin-Yu Chen, Jianxi Gao

प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kushal Raj Bhandari, Ling Yue, Ching-Yun Ko, Dhaval Patel, Shaowu Pan, Pin-Yu Chen, Jianxi Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ Evoflux पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

बड़ी तस्वीर: "छोटा शेफ" वाली समस्या

कल्पive कि आपके पास एक बहुत ही छोटा, बजट-अनुकूल किचन रोबोट (एक कॉम्पैक्ट AI मॉडल) है। आप चाहते हैं कि वह एक विशाल, लगातार बदलते हुए पेंट्री (एक लाइव टूल कैटलॉग) से औजारों का उपयोग करके एक जटिल भोजन पकाए।

रोबोट को यह करना होगा:

  1. पेंट्री में सही सामग्री (टूल्स) ढूँढना।
  2. एक रेसिपी (वर्कफ्लो) का पालन करना जो चरणों को सही ढंग से जोड़ती हो।
  3. वास्तव में खाना पकाना (टूल्स को चलाना) और परिणाम का स्वाद लेना।

समस्या: छोटे रोबोट सस्ते और तेज़ होते हैं, लेकिन वे "भंगुर" (brittle) होते हैं। वे अक्सर एक ऐसी रेसिपी लिखते हैं जो कागज़ पर तो अच्छी दिखती है, लेकिन जब वे खाना पकाने की कोशिश करते हैं तो विफल हो जाती है। शायद वे गलत औजार उठा लेते हैं, अगले स्टेप के लिए सामग्री देना भूल जाते हैं, या किसी ऐसे टूल का उपयोग करने की कोशिश करते हैं जो अब मौजूद ही नहीं है।

आमतौर पर, इसे ठीक करने के लिए, हम रोबोट को हजारों बेहतरीन रेसिपी के उदाहरण दिखाकर "सिखाने" (training) की कोशिश करते हैं। लेकिन यह पेपर तर्क देता है कि जब आपके पास केवल कुछ सौ उदाहरण (एक सीमित बजट) हों, तो रोबोट को सिखाना काम नहीं करता है। वह केवल रेसिपी के आकार को याद कर लेता है लेकिन यह नहीं सीख पाता कि जब असली किचन में चीजें गलत हो जाएं तो उन्हें कैसे ठीक किया जाए।

समाधान: Evoflux (द "इवोल्यूशनरी रिपेयर क्रू")

रोबोट के दिमाग को फिर से ट्रेन करने के बजाय, Evofлуx रोबोट को एक "रिपेयर क्रू" (मरम्मत दल) देता है जो रोबोट के खाना पकाने के दौरान ही काम करता है।

Evoflux को एक डायनेमिक रिपेयर लूप के रूप में सोचें:

  1. पहला प्रयास: रोबोट एक रेसिपी (वर्कफ्लो ग्राफ) लिखता है।
  2. ट्रायल रन: सिस्टम रेसिपी चलाने की कोशिश करता है। यदि यह टूट जाता है (जैसे, "टूल नहीं मिला" या "सामग्री गायब है"), तो सिस्टम त्रुटि (error) को पकड़ लेता है।
  3. इवोल्यूशन (विकास): हार मानने के बजाय, सिस्टम टूटी हुई रेसिपी के साथ एक 'म्यूटेंट जीव' की तरह व्यवहार करता है। यह विशिष्ट त्रुटि को ठीक करने के लिए छोटे, स्मार्ट बदलाव (edits) करता है।
    • क्या इसने गलत टूल चुना? उसे बदल दें।
    • क्या यह कोई सामग्री भूल गया? उसे जोड़ें।
    • क्या स्टेप्स गलत क्रम में थे? उन्हें पुनर्व्यवस्थित करें।
  4. सर्वाइवल ऑफ द फिटेस्ट (योग्यतम की उत्तरजीविता): सिस्टम नए संस्करण को चलाता है। यदि यह बेहतर काम करता है, तो यह उसे रखता है। यदि यह विफल होता है, तो यह फिर से प्रयास करता है। यह एक छोटे अंतराल में कई बार ऐसा करता है, रेसिपी को तब तक विकसित करता है जब तक कि उसे वह न मिल जाए जो वास्तव में सफलतापूर्वक भोजन पका सके।

पेपर से ली गई मुख्य उपमाएँ (Metaphors)

  • "प्लासिबल बट ब्रोकन" ग्राफ: पेपर नोट करता है कि छोटे मॉडल अक्सर ऐसे वर्कफ्लो बनाते हैं जो एक वैध मानचित्र की तरह दिखते हैं लेकिन अंततः खाई में गिर जाते हैं। Evoflux केवल मानचित्र को नहीं देखता; यह यह देखने के लिए कार चलाता है कि सड़क वास्तविक है या नहीं।
  • "रिपेयर" बनाम "ट्रेनिंग" की बहस:
    • ट्रेनिंग (SFT/DPO): एक कुकबुक को याद करने की तरह। यदि कुकबुक छोटी है (कम उदाहरण), तो रोबलेट रेसिपी की शैली तो सीख जाता है लेकिन जब सामग्रियां बदल जाती हैं तो विफल हो जाता है। पेपर ने पाया कि कम बजट पर, यह अक्सर रोबोट को बिना सिखाए (zero-shot) अंदाज़ा लगाने की तुलना में भी खराब बना देता है।
    • Evoflux (सर्च): एक मैकेनिक की तरह जो कार चलाते समय इंजन ठीक करता है। यह ड्राइवर का दिमाग नहीं बदलता; यह बस सड़क की स्थितियों के आधार पर इंजन को ठीक करता है।
  • "टोकन कॉस्ट" (ईंधन):
    • ReAct (पुराना तरीका): यह एक ऐसे रोबोट की तरह है जो अगले कदम को समझने के लिए खुद से लंबे समय तक ज़ोर-ज़ोर से बात करता है। यह बेहतरीन समाधान पा सकता है, लेकिन यह बहुत अधिक ईंधन (टोकन) जलाता है और अप्रत्याशित है।
    • Evoflux: यह अधिक कुशल है। यह कुछ विशिष्ट सुधारों को आज़माता है, जाँचता है कि क्या वे काम करते हैं, और रुक जाता है। यह "बातचीत करने वाले" लंबे तरीके की तुलना में कम ईंधन में बेहतर परिणाम देता है।

इस पेपर ने वास्तव में क्या पाया

शोधकर्ताओं ने इसका परीक्षण MCP-Bench नामक बेंचमार्क पर किया, जो वास्तविक, लाइव टूल्स (जैसे फाइनेंस, ट्रैवल और साइंस टूल्स) का उपयोग करता है।

  1. सफलता दर (Success Rate): छोटे रोबोटों के लिए, पहली बार में रेसिपी के सफल होने की संभावना बहुत कम (लगभग 3%) थी।
  2. सुधार: Evoflux के साथ, सफलता दर बढ़कर 17% से 24% के बीच हो गई।
  3. ट्रेनिंग की विफलता: जब उन्होंने रोबोट को उन्हीं कुछ सौ उदाहरणों का उपयोग करके "सिखाने" की कोशिश की जिनका उपयोग Evoflux ने सर्च के लिए किया था, तो रोबोट बेहतर नहीं हुए। वास्तव में, वे अक्सर बिना सिखाए (zero-shot) अनुमान लगाने की तुलना में बदतर प्रदर्शन करते थे।
  4. तुलना: ReAct नामक एक विधि (जो रोबोट को स्टेप-बाय-स्टेप सोचने की अनुमति देती है) कभी-कभी उच्च स्कोर प्राप्त कर सकती है, लेकिन यह बहुत अस्थिर और महंगी थी। Evoflux अधिक विश्वसनीय और सस्ता था।

निचोड़ (The Bottom Line)

यदि आपके पास एक छोटा, सस्ता AI एजेंट है और उसे सिखाने के लिए सीमित उदाहरण हैं, तो केवल उसे ट्रेन करने की कोशिश न करें। इसके बजाय, उसे प्रयास करने दें, विफल होने दें, और फिर अपनी गलतियों को ठीक करने के लिए एक स्मार्ट, इवोल्यूशनरी सर्च प्रोसेस का उपयोग करें।

पेपर निष्कर्ष निकालता है कि छोटे एजेंटों के लिए, इसे चलाने के दौरान योजना को ठीक करना इसे चलाने के तरीके के कुछ उदाहरणों को याद करने की तुलना में बहुत अधिक विश्वसनीय रणनीति है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →