← नवीनतम पेपर
💬 NLP

CRAFT: Learn the Schema, Execute the Plan

CRAFT एंटरप्राइज़ कोडिंग एजेंटों के लिए एक दो-चरणीय पोस्ट-ट्रेनिंग फ्रेमवर्क है जो बिना व्यापक प्रॉम्प्ट-टाइम स्कीमा इंजेक्शन के स्कीमा-ग्राउंडेड प्लानिंग और निष्पादन व्यवहारों को सीखता है, जिससे टोकन ओवरहेड को कम करते हुए विश्लेषणात्मक प्रदर्शन, निरंतरता और दक्षता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Aakash Kolekar, Sahika Genc, Shahriar Shariat, Bunyamin Sisman, Tibor Mezi, Barbara Poblete, Shree Vandana Kachroo, Calvin Chi, Parth Parmar, Ari Singer, Prayaas Jain, Cindy Barker, Benoit Dumoulin

प्रकाशित 2026-07-28
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aakash Kolekar, Sahika Genc, Shahriar Shariat, Bunyamin Sisman, Tibor Mezi, Barbara Poblete, Shree Vandana Kachroo, Calvin Chi, Parth Parmar, Ari Singer, Prayaas Jain, Cindy Barker, Benoit Dumoulin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ आप एक सुपर-स्मार्ट रोबोटिक असिस्टेंट से बात कर सकते हैं और उसे साधारण अंग्रेजी का उपयोग करके जटिल गणित करने, डेटा के विशाल ढेर का विश्लेषण करने या कंप्यूटर प्रोग्राम लिखने के लिए कह सकते हैं। यह "कोडिंग एजेंट्स" का सपना है। लेकिन यहाँ एक पेंच है: अपना काम करने के लिए, इस रोबोट को उस डेटाबेस के गुप्त नियमों को जानने की आवश्यकता है जिस पर वह काम कर रहा है। इसे एक शेफ की तरह समझें जो एक शानदार भोजन पकाने की कोशिश कर रहा है। यदि शेफ को यह नहीं पता कि पेंट्री में कौन सी सामग्री है या चूल्हा कैसे काम करता है, तो वह खाना नहीं बना सकता। अतीत में, रोबलेट की मदद करने के लिए, इंजीनियर हर एक नियम, टेबल के नाम और कॉलम की परिभाषा की एक विशाल, धूल भरी विश्वकोश (एन्साइक्लोपीडिया) को हर बार जब वह कोई सवाल पूछता था, उसके दिमाग में ठूंस देते थे। यह ऐसा था जैसे शेफ को एक भी प्याज काटने से पहले पूरी विश्वकोश पढ़ने के लिए मजबूर करना। यह धीमा था, महंगा था, और यदि पेंट्री में थोड़ा भी बदलाव होता, तो पूरा सिस्टम टूट जाता।

अब, कल्पना कीजिए कि हर बार विश्वकोश पढ़ने के बजाय, शेफ रसोई के लेआउट को कुछ अभ्यास सत्रों के बाद याद रख सकता है। यही वह बड़ा सवाल है जिसे यह शोध पत्र संबोधित करता है: क्या हम इन AI सहायकों को डेटाबेस के नियमों को एक बार और हमेशा के लिए सीखना सिखा सकते हैं, ताकि उन्हें हर बार याद दिलाने की आवश्यकता न पड़े? शोधकर्ताओं ने यह देखना चाहा कि क्या वे AI को स्कीमा (डेटा का नक्शा) और उन उपकरणों को "आंतरिक रूप (internalize)" करना सिखा सकते हैं जिनका उसे उपयोग करने की आवश्यकता है, जिससे यह लंबा और जटिल होने पर भी तेज़, स्मार्ट और कम भ्रमित होने वाला बन सके।


द पेपर: CRAFT – मैप को सीखें, फिर दौड़ लगाएँ

यह पेपर CRAFT नामक एक नए सिस्टम का परिचय देता है (जिसका अर्थ है सीखने की दो-चरणीय विधि)। लेखकों ने, जो अमेज़न की एक टीम है, एक ऐसा AI बनाना चाहा जो विज्ञापन विशेषज्ञों को उनके अभियान डेटा का विश्लेषण करने में मदद कर सके बिना तकनीकी विवरणों में डूबे। उन्होंने पाया कि पुराने तरीके से AI के प्रॉम्प्ट में अंतहीन दस्तावेज़ों को "ठूंसना" एक ईंटों से भरा बैकपैक लेकर मैराथन दौड़ने जैसा था। इसने सब कुछ धीमा कर दिया और AI को गलतियाँ करने के प्रति संवेदनशील बना दिया।

इसलिए, उन्होंने एक अलग दृष्टिकोण अपनाया: स्कीमा को सीखें, योजना का निष्पादन करें।

चरण 1: "स्कीमा-रहित" क्लासरूम

सबसे पहले, उन्होंने AI को एक विशेष क्लासरूम में सिखाया जहाँ "विश्वकोश" छीन लिया गया था। उन्होंने AI को समस्याओं को हल करने के हजारों उदाहरण दिए, लेकिन उनसे कच्चे डेटाबेस नियम (DDL) छिपा दिए। नियमों को पढ़ने के बजाय, AI को सोचने और योजना बनाने के पैटर्न सीखने थे।

इसे एक छात्र को गणित की समस्या हल करना सिखाने जैसा समझें, जिसमें उसे चरणों और तर्क को दिखाया जाता है, लेकिन उसे फॉर्मूला शीट देखने नहीं दी जाती। उन्हें सोचने का तरीका याद करना होता है। शोधकर्ता इसे PLAN Supervised Fine-Tuning (SFT) कहते हैं। यह ऐसा है जैसे AI योजना बनाने और कोड लिखने की "मसल मेमोरी" सीख रहा है, बिना हर बार चीट शीट की आवश्यकता के।

चरण 2: "रीइन्फोर्समेंट लर्निंग" जिम

एक बार जब AI के पास बुनियादी मसल मेमोरी आ गई, तो उन्होंने उसे Reinforcement Learning (RL) के लिए एक जिम में डाल दिया। यहीं पर AI वास्तव में कोड चलाता है और उपकरणों का उपयोग करता है। यदि वह गलती करता है—जैसे गलत टूल कॉल करना या ऐसा कोड लिखना जिससे सिस्टम क्रैश हो जाए—तो उसे "नेगेटिव स्कोर" मिलता है। यदि वह सफल होता है, तो उसे "पॉजिटिव स्कोर" मिलता है।

शोधकर्ताओं ने एक विशेष स्कोरिंग सिस्टम का उपयोग किया जो केवल यह नहीं देखता था कि कोड चला या नहीं; बल्कि यह भी देखता था कि क्या कोड अच्छा था, क्या योजना कोड से मेल खाती थी, और क्या AI गलतियों के दौरान खुद को सुधार सकता था। यह एक कोच की तरह है जो धावक को केवल रेस पूरी करने के लिए नहीं देखता, बल्कि उसके फॉर्म, गति और बाधा आने पर उसके व्यवहार की भी जाँच करता है। इस चरण को, Execution-Shaped GRPO कहा गया, जिसने AI को विश्वसनीय और सुसंगत बनना सिखाया, भले ही उपयोगकर्ता फॉलो-अप प्रश्न पूछे या बातचीत के बीच में ही नियम बदल दे।

परिणाम: तेज़, स्मार्ट और कम अव्यवस्थित

परिणाम काफी प्रभावशाली थे। जब उन्होंने पुराने "ईंटों के बैकपैक" वाले तरीके के मुकाबले CRAFT का परीक्षण किया:

  • गति: नए सिस्टम ने उस टेक्स्ट (टोकन) की मात्रा को लगभग 9 गुना कम कर दिया जिसे AI को पढ़ना पड़ता था। यह AI के मस्तिष्क के लिए एक बड़ा वजन कम करने जैसा है।
  • स्मार्टनेस: समग्र "एजेंट स्कोर" (काम करने की क्षमता का एक माप) में 9.6 प्रतिशत अंक की वृद्धि हुई।
  • निरंतरता: AI 4.1 प्रतिशत अंक अधिक सुसंगत हो गया, जिसका अर्थ है कि यदि आप एक ही सवाल दो बार पूछते हैं, तो भी यह वही अच्छा उत्तर देता है।
  • कम भ्रम: इसने सही टूल खोजने के लिए AI के "खोजने" की संख्या को 5 गुना तक कम कर दिया।

शोधकर्ताओं ने यह भी पाया कि AI मल्टी-टर्न (बहु-चरणीय) बातचीत को संभालने में बहुत बेहतर हो गया। यदि कोई उपयोगकर्ता कहता है, "मुझे बिक्री दिखाएं," और फिर कहता है, "अब केवल लाल शर्ट के लिए फ़िल्टर करें," तो CRAF AI संदर्भ को याद रखता है और चर्चा को जारी रखता है, जबकि पुराना सिस्टम अक्सर भटक जाता था।

यह क्या नहीं है (और क्या ध्यान में रखें)

यह ध्यान रखना महत्वपूर्ण है कि यह पेपर क्या दावा नहीं करता है। लेखक बहुत स्पष्ट हैं कि यह सिस्टम स्थिर, ज्ञात स्कीमा के लिए डिज़ाइन किया गया है। यदि डेटाबेस अचानक पूरी तरह से नया प्रकार का डेटा या एक बिल्कुल नया टूल बनाता है जिसे AI ने पहले कभी नहीं देखा है, तो CRAFT अटक सकता है। यह उस शेफ की तरह है जो रसोई को तो अच्छी तरह जानता है लेकिन उस नए, अजीब गैजेट का उपयोग करना नहीं जानता जिसे उसने पहले कभी नहीं देखा। उन मामलों में, आपको अभी भी नियमों को देखने (रिट्रीवल) या शेफ को फिर से प्रशिक्षित करने की आवश्यकता हो सकती है।

साथ ही, पेपर स्वीकार करता है कि हालांकि AI योजना का पालन करने में महान है, लेकिन यह अभी तक इस बात के लिए पूरी तरह से अनुकूलित (optimize) नहीं है कि यह कितना कंप्यूटर मेमोरी उपयोग करता है या सर्वर पर इसे चलाने की लागत कितनी है। यह भविष्य के अपग्रेड के लिए एक कार्य है।

निष्कर्ष

CRAFT यह सुझाव देता है कि AI के चेहरे पर लगातार जानकारी ठूंसने के बजाय, हम इसे एक बार नियम सीखने और फिर योजना का निष्पादन करने के लिए भरोसा करने के लिए सिखा सकते हैं। "नो-चीट-शीट" प्रशिक्षण चरण और "अभ्यास और सुधार" चरण को जोड़कर, उन्होंने एक ऐसा एजेंट बनाया जो हल्का, तेज़ और अधिक विश्वसनीय है। यह AI सहायकों को ऐसा महसूस कराने की दिशा में एक कदम है जो मैनुअल पढ़ने वाले रोबोट के बजाय विशेषज्ञ सहयोगियों की तरह लगें जो वास्तव में जानते हैं कि व्यवसाय कैसे काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →