← नवीनतम पेपर
🤖 AI

Knowledge-Centric Agents for Workflow Generation

यह शोध पत्र एक ज्ञान-केंद्रित ढांचे का प्रस्ताव करता है जो वास्तविक दुनिया के उदाहरणों से पदानुक्रमित ज्ञान को उलटने (invert), इंजेक्ट करने और अनुमान लगाने (infer) को सीखकर विजुअल क्रिएशन सिस्टम में वर्कफ़्लो जनरेशन को बढ़ाता है, जिससे मौजूदा प्रत्यक्ष टेक्स्ट-टू-जेसन (text-to-JSON) दृष्टिकोणों की तुलना में बेहतर संरचनात्मक सुसंगतता और निष्पादन सफलता दर प्राप्त होती है।

मूल लेखक: Zhendong Li, Lei Sun, Ruibo Ming, He Zhang, Danda Pani Paudel, Luc Van Gool, Jinjin Gu

प्रकाशित 2026-07-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhendong Li, Lei Sun, Ruibo Ming, He Zhang, Danda Pani Paudel, Luc Van Gool, Jinjin Gu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप लेगो ब्रिक्स (LEGO bricks) से एक जटिल मशीन बनाने की कोशिश कर रहे हैं, लेकिन अपने हाथों से उन्हें जोड़ने के बजाय, आपको केवल शब्दों का उपयोग करके एक रोबोट को पूरे ब्लूप्रिंट का वर्णन करना होगा। यह ComfyUI की दुनिया है, जो आर्टिफिशियल इंटेलिजेंस के साथ चित्र बनाने के लिए एक लोकप्रिय टूल है। इस प्रणाली में, रचनात्मक प्रक्रिया का हर चरण—जैसे कि रंग बदलना, चेहरे को शार्प करना, या किसी छवि को बड़ा करना—एक अलग "ब्लॉक" या "नोड" (node) है। एक शानदार परिणाम प्राप्त करने के लिए, आपको इन सैकड़ों ब्लॉकों को एक बहुत ही विशिष्ट क्रम में जोड़ना होता है, जैसे कि एक विशाल, जटिल सर्किट बोर्ड। यदि आप गलत दो ब्लॉकों को जोड़ देते हैं, या कोई पावर कॉर्ड (पैरामीटर) लगाना भूल जाते हैं, तो पूरी मशीन लड़खड़ा जाती है और रुक जाती है।

लंबे समय तक, लोगों ने लार्ज लैंग्वेज मॉडल्स (LLMs)—वही स्मार्ट AI जो कहानियाँ लिखता है या सवालों के जवाब देता है—का उपयोग करके स्वचालित रूप से इन ब्लूप्रिंट्स को बनाने की कोशिश की। विचार सरल था: AI को कहें, "मेरे लिए एक स्टीमपंक एयरशिप (steampunk airship) का चित्र बनाओ," और उसे एकदम सही लेगो निर्देश दें। लेकिन समस्या यह है: ये AI मॉडल वाक्य लिखने में तो माहिर हैं, लेकिन जटिल संरचनाएं बनाने में वे बहुत खराब हैं। वे अक्सर भूल जाते हैं कि ब्लॉक कैसे जुड़ते हैं, निर्देशों को मिला देते हैं, या ऐसे ब्लूप्रिंट बना देते हैं जो कागज पर तो अच्छे दिखते हैं लेकिन जब आप उन्हें बनाने की कोशिश करते हैं तो बिखर जाते हैं। उनमें उस मानव विशेषज्ञ का "अनुभव" की कमी होती है जो जानता है कि ब्लॉक A को ब्लॉक B से क्यों जोड़ा जाना चाहिए, न कि केवल यह कि आपको ऐसा क्यों करना चाहिए।

यह ज़ेन्डोंग ली (Zhendong Li) और उनकी टीम द्वारा प्रस्तावित एक नए पेपर की ओर ले जाता है, जो हमें एक मास्टर बिल्डर बनने का तरीका सिखाने के लिए एक चतुर नया तरीका प्रस्तावित करते हैं। इसके बजाय कि वे AI को केवल अंतिम ब्लूप्रिंट का अनुमान लगाने के लिए कहें, वे इसे एक विशेषज्ञ मानव डिजाइनर की तरह सोचना सिखाते हैं। वे इसे एक नॉलेज-सेंट्रिक (Knowledge-Centric) दृष्टिकोण कहते हैं। इसे इस तरह समझें: यदि आप एक छात्र को एक आदर्श केक बनाना सिखाना चाहते हैं, तो आप उसे केवल तैयार केक नहीं दिखाते और यह नहीं कहते, "इसे कॉपी करो।" आप उसे रणनीति सिखाते हैं (क्यों हम पहले अंडे मिलाते हैं), कंकाल (बिना सटीक माप के चरणों की सूची), और अंत में रेसिपी (आटे के सटीक ग्राम)।

लेखकों ने पाया कि मौजूदा AI तरीके विफल हो रहे थे क्योंकि वे सीधे उपयोगकर्ता के अनुरोध से अंतिम, अव्यवस्थित कोड पर जाने की कोशिश कर रहे थे। इसे ठीक करने के लिए, उन्होंने एक तीन-चरणीय प्रक्रिया बनाई जिसे वे नॉलेज इन्वर्जन (Knowledge Inversion), इंजेक्शन (Injection), और इन्फरेंस (Inference) कहते हैं।

सबसे पहले, उन्होंने हजारों वास्तविक, काम करने वाले ब्लूप्रिंट्स को लिया और उन्हें एक "रिवर्स इंजीनियर" प्रक्रिया के माध्यम से चलाया। उन्होंने छिपे हुए पैटर्न खोजने के लिए उनके जटिल विवरणों को हटा दिया। यह एक हजार अलग-अलग कारों को अलग करके इंजन के काम करने के सामान्य नियमों को समझने जैसा है, बजाय इसके कि केवल एक विशिष्ट कार के आकार को याद किया जाए। उन्होंने इन ब्लूप्रिंट्स को तीन परतों में संकुचित किया:

  1. हाई-लेवल स्ट्रैटेजी (High-Level Strategy): "बड़ी तस्वीर" वाली योजना (जैसे, "हमें पहले चेहरा ठीक करना है, फिर स्टाइल बदलना है")।
  2. स्केलेटन स्यूडो-कोड (Skeleton Pseudo-code): चरणों की एक कच्चा रूपरेखा, बिना विशिष्ट संख्याओं के।
  3. फुल स्यूडो-कोड (Full Pseudo-code): पूर्ण, विस्तृत निर्देश जो निर्माण के लिए तैयार हैं।

इसके बाद, उन्होंने इस संकुचित ज्ञान को एक AI मॉडल में इंजेक्ट (inject) किया। उन्होंने इसे केवल डेटा नहीं दिया; उन्होंने इसे परतों के माध्यम से तर्क करना सिखाया। उन्होंने मॉडल को दिखाया: "यह एक कार्य है, यह वह रणनीति है जिसका एक विशेषज्ञ उपयोग करेगा, और वह रणनीति स्केलेटन में कैसे बदलती है।" यह एक छात्र को खाना पकाने की रेसिपी के बजाय खाना पकाने के तर्क वाला कुकबुक देने जैसा है।

अंत में, जब कोई उपयोगकर्ता एक नई छवि मांगता है, तो AI केवल अनुमान नहीं लगाता। यह सीखी गई परतों के माध्यम से समाधान को इन्फर (infer) करता है। यह पहले उच्च-स्तरीय रणनीति को समझता है, फिर कंकाल बनाता है, और अंत में विशिष्ट विवरणों को भरता है। पेपर में एक "सेल्फ-रिफाइनमेंट" (self-refinement) चरण भी शामिल है, जहाँ AI अपने काम की दोबारा जांच करता है, यह पूछता है, "क्या मैंने इन ब्लॉकों को सही ढंग से जोड़ा है?" इससे पहले कि वह योजना को अंतिम रूप दे।

परिणाम प्रभावशाली हैं। टीम ने 900 से अधिक वास्तविक दुनिया के कार्यों के डेटासेट पर अन्य AI टूल्स के मुकाबले उनके तरीके का परीक्षण किया। जबकि अन्य तरीके आधे समय से भी कम समय में काम करने वाले ब्लूप्रिंट बना पाए, इस नए "नॉलेज-सेंट्रिक" एजेंट ने 86.9% मामलों में सफलता प्राप्त की। जटिल, विविध संरचनाओं के निर्माण के मामले में, उनके तरीके ने विविधता पैमाने पर 152 का स्कोर किया, जबकि अगले सबसे अच्छे तरीके ने केवल 42 तक ही पहुँच प्राप्त की। यहाँ तक कि जब नए, कठिन कार्यों पर परीक्षण किया गया जिन्हें AI ने पहले कभी नहीं देखा था, तब भी यह 66.7% बार सफल रहा, जो प्रतिस्पर्धा से कहीं बेहतर है।

लेखक सुझाव देते हैं कि AI को केवल पैटर्न को याद करने के बजाय काम के पीछे की संरचना और तर्क को समझाने से, हम अधिक विश्वसनीय एजेंट बना सकते हैं। वे स्वीकार करते हैं कि सिस्टम अभी भी संघर्ष करता है जब इसे बहुत दुर्लभ, असामान्य ब्लॉकों का उपयोग करने के लिए कहा जाता है जो उसके प्रशिक्षण डेटा में नहीं थे, लेकिन कुल मिलाकर, उन्होंने दिखाया है कि विशेषज्ञों के सोचने के तरीके का एक "मानसिक मॉडल" देना ही बेहतर, अधिक जटिल रचनात्मक उपकरण बनाने की कुंजी है। यह एक रोबोट से "उत्तर का अनुमान लगाने" के बजाय उसे "सोचना सिखाने" की ओर एक बदलाव है, जो एक नाजुक, त्रुटिपूर्ण प्रक्रिया को एक मजबूत, विशेषज्ञ-स्तरीय शिल्प में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →