← नवीनतम पेपर
💻 computer science

kRAIG: A Natural Language-Driven Agent for Automated DataOps Pipeline Generation

यह शोध पत्र kRAIG को प्रस्तुत करता है, जो एक ऐसा AI एजेंट है जो उपयोगकर्ता के इरादे को स्पष्ट करने के लिए ReQuesAct फ्रेमवर्क, डेटा ट्रांसफॉर्मेशन के लिए रिट्रीवल-ऑगमेंटेड टूल सिंथेसिस, और पाइपलाइन की विश्वसनीयता एवं सटीकता सुनिश्चित करने के लिए LLM-आधारित वैलिडेशन का उपयोग करके प्राकृतिक भाषा से प्रोडक्शन-रेडी Kubeflow Pipelines के निर्माण को स्वचालित करता है।

मूल लेखक: Rohan Siva, Kai Cheung, Lichi Li, Ganesh Sundaram

प्रकाशित 2026-03-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rohan Siva, Kai Cheung, Lichi Li, Ganesh Sundaram

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हाई-टेक फैक्ट्री के CEO हैं। आपका लक्ष्य दुनिया भर से कच्चे माल (डेटा) को लेना, उन्हें साफ करना, पैक करना और फिर एक वेयरहाउस में भेजना है जहाँ रोबोट (AI मॉडल्स) उनका उपयोग उत्पाद बनाने के लिए कर सकें।

पुराने दिनों में, इस फैक्ट्री को चलाने के लिए आपको अत्यधिक विशिष्ट इंजीनियरों की एक टीम रखनी पड़ती थी। वे हफ्तों तक ब्लूप्रिंट बनाने, पाइप बिछाने और कन्वेयर बेल्ट को प्रोग्राम करने में बिताते थे। यदि निर्देशों में एक छोटी सी भी गलती हो जाती, तो पूरी फैक्ट्री रुक सकती थी, या इससे भी बुरा, इंजीनियर गलती से कच्चे माल को वेयरहाउस के बजाय ज्वालामुखी में डाल सकते थे।

मिलिए kRAIG से: द "स्मार्ट फैक्ट्री मैनेजर"

यह पेपर kRAIG को पेश करता है, जो एक AI एजेंट है जिसे उस फैक्ट्री मैनेजर के रूप में डिज़ाइन किया गया है। इंजीनियरों को काम पर रखने के बजाय, आप बस साधारण अंग्रेजी (या सहज भाषा) में kRAIG से बात करते हैं। आप कहते हैं, "मुझे इस वेबसाइट से डेटा चाहिए, इसे साफ करना है और हमारे क्लाउड स्टोरेज में डालना है।" kRAIG आपके लिए पूरी फैक्ट्री पाइपलाइन खुद ही बना देता है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "पहले स्पष्ट करें" का नियम (ReQuesAct)

अधिकांश AI असिस्टेंट एक घबराए हुए इंटर्न की तरह होते हैं जो तुरंत काम में कूद पड़ते हैं। आप कहते हैं, "मुझे डेटा ला कर दो," और वे चीजें पकड़ना शुरू कर देते हैं, अक्सर गलत चीजें पकड़ लेते हैं या नियमों को तोड़ देते हैं क्योंकि वे पूरी तस्वीर नहीं समझ पाए।

kRAIG अलग है। यह एक नई विधि का उपयोग करता है जिसे ReQuesAct (Reason + Question + Act) कहा जाता है।

  • पुराना तरीका: आप कहते हैं, "डेटा को मूव करो।" AI डेटा मूव कर देता है। क्रैश! इसने गलत डेटा मूव कर दिया।
  • kRAIG का तरीका: आप कहते हैं, "डेटा को मूव करो।" AI रुकता है और पूछता है, "ठहरिए, कौन सा डेटा? और इसे ठीक कहाँ जाना चाहिए? क्या हमें इसे पहले साफ करना चाहिए?"

यह एक सावधान प्रोजेक्ट मैनेजर की तरह काम करता है जो तब तक निर्माण शुरू करने से इनकार कर देता है जब तक कि ब्लूप्रिंट 100% स्पष्ट न हो जाए। यह उन "क्रैश" को रोकता है जो अस्पष्ट निर्देशों के कारण होते हैं।

2. "टूलबॉक्स" और "रेसिपी बुक"

एक बार जब kRAIG को ठीक से पता चल जाता है कि आपको क्या चाहिए, तो इसे पाइपलाइन बनानी होती है।

  • टूलबॉक्स: इसके पास पहले से बने टूल्स (जैसे "GitHub से डाउनलोड करें" टूल या "Amazon S3 पर अपलोड करें" टूल) से भरा एक विशाल डिजिटल टूलबॉक्स है।
  • रेसिपी बुक: यदि इसके पास वह सटीक टूल नहीं है जिसकी इसे आवश्यकता है, तो यह केवल अनुमान नहीं लगाता। यह एक "रेसिपी बुक" (पिछले सफल प्रोजेक्ट्स का डेटाबेस) को देखता है कि दूसरों ने समान समस्याओं को कैसे हल किया। फिर यह तुरंत एक कस्टम टूल बनाता है, लेकिन यह बहुत सावधानी से करता है, यह सुनिश्चित करते हुए कि नया टूल बाकी फैक्ट्री के साथ पूरी तरह फिट बैठता है।

3. "सेफ्टी इंस्पेक्टर" (सुरक्षा निरीक्षक)

यह सबसे महत्वपूर्ण हिस्सा है। वास्तविक दुनिया में, यदि कोई फैक्ट्री मैनेजर गलती से ऐसा कमांड लिख देता है जो कहता है "सब कुछ डिलीट कर दो," तो फैक्ट्री बर्बाद हो जाएगी।

kRAIG में एक इन-बिल्ट सेफ्टी इंस्पेक्टर (एक दूसरा AI दिमाग) है। किसी भी कोड को वास्तव में चलाने से पहले:

  1. इंस्पेक्टर उस ब्लूप्रिंट को पढ़ता है जो kRAIG ने बनाया है।
  2. यह "Delete," "Drop," या "Wipe" जैसे खतरनाक शब्दों की तलाश करता है।
  3. यदि इसे कुछ भी जोखिम भरा दिखता है, तो यह प्रक्रिया को रोक देता है और कहता है, "रुको, यह खतरनाक लग रहा है। चलिए इसे ठीक करते हैं।"
  4. यह यह भी सुनिश्चित करता है कि मैनेजर केवल "अनुमोदित टूल्स" (जैसे 'रीड-ओनली' की) का ही उपयोग करे, ताकि यदि मैनेजर भ्रमित भी हो जाए, तो भी वे कुछ नुकसान न पहुँचा सकें।

4. परिणाम: तेज़ और सुरक्षित

शोधकर्ताओं ने kRAIG का अन्य AI एजेंटों (जैसे SWE-Agent और Spider-Agent) के विरुद्ध परीक्षण किया।

  • प्रतिद्वंद्वी: वे उन इंटर्न की तरह थे जो निर्देशों का अनुमान लगाने की कोशिश करते थे। वे अक्सर असफल रहे, खासकर जब निर्देश पेचीदा थे। वे डेटा को दरवाजे के अंदर तो ला सकते थे, लेकिन अक्सर सफाई (cleaning) की प्रक्रिया में गड़बड़ी कर देते थे।
  • kRAIG: क्योंकि यह पहले सवाल पूछता है और अपनी सुरक्षा की जांच करता है, यह सिस्टम में डेटा डालने में 3 गुना बेहतर था और इसे सही ढंग से साफ करने में 25% बेहतर था।

बड़ी तस्वीर

kRAIG को एक निर्माण दल को अस्पष्ट आदेश देने बनाम एक पेशेवर आर्किटेक्ट को काम पर रखने के बीच के अंतर के रूप में सोचें जो:

  1. आपसे पूछता है कि आपको वास्तव में क्या चाहिए।
  2. बिल्डिंग कोड (सुरक्षा) की जांच करता है।
  3. सिद्ध तरीकों का उपयोग करके योजनाएं बनाता है।
  4. बिना आपके एक भी ईंट बिछाने की जानकारी के संरचना का निर्माण करता है।

यह क्यों मायने रखता है?
अभी, डेटा वैज्ञानिक अपना 80% समय केवल डेटा को मूव करने और साफ करने में बिताते हैं, जिससे केवल 20% समय वास्तविक AI जादू के लिए बचता है। kRAIG उस 80% हिस्से को ऑटोमेट करता है, जिससे इंसान अपने काम के रचनात्मक और विश्लेषणात्मक हिस्सों पर ध्यान केंद्रित कर पाते हैं, जबकि यह भी सुनिश्चित होता है कि फैक्ट्री गलती से जल न जाए।

चुनौती:
किसी भी नई तकनीक की तरह, यह अभी भी पूर्ण नहीं है। यदि आप इसे ऐसा कार्य देते हैं जो अविश्वसनीय रूप से जटिल है या जिसमें अलग-अलग नियमों वाले 50 विभिन्न देशों का डेटा शामिल है, तो यह अभी भी भ्रमित हो सकता है। लेकिन अधिकांश मानक कार्यों के लिए, यह डेटा इंजीनियरिंग को सुरक्षित और आसान बनाने की दिशा में एक बड़ी छलांग है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →