LLM as a Tool, Not an Agent: Code-Mined Tree Transformations for Neural Architecture Search
यह शोध पत्र LLMasTool प्रस्तुत करता है, जो एक पदानुक्रमित वृक्ष-आधारित (hierarchical tree-based) न्यूरल आर्किटेक्चर सर्च फ्रेमवर्क है, जो LLMs को एक विश्वसनीय एल्गोरिद्मिक खोज प्रक्रिया के भीतर विशिष्ट डिग्री ऑफ फ्रीडम (degrees of freedom) को हल करने के लिए उपकरणों के रूप में मानता है, जिससे स्थिर, ओपन-एंडेड मॉडल विकास सक्षम होता है जो CIFAR और ImageNet बेंचमार्क पर मौजूदा विधियों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप दुनिया का सबसे बेहतरीन LEGO किला बनाने की कोशिश कर रहे हैं।
लंबे समय से, बेहतरीन AI दिमाग (न्यूरल नेटवर्क) बनाने की कोशिश कर रहे वैज्ञानिकों ने दो मुख्य दृष्टिकोणों का उपयोग किया है:
- कठोर वास्तुकार (The Strict Architect): वे एक बहुत ही विशिष्ट, सीमित ब्लूप्रिंट बनाते हैं। वे केवल कुछ निश्चित प्रकार के LEGO ईंटों का उपयोग कर सकते हैं और उन्हें केवल विशिष्ट तरीकों से ही जोड़ सकते हैं। यह सुरक्षित और विश्वसनीय है, लेकिन यह रचनात्मकता को सीमित करता है। आप कभी भी ड्रैगन के सिर वाला किला नहीं बना पाएंगे क्योंकि ब्लूप्रिंट ने इसकी अनुमति नहीं दी थी।
- जादुई जिन्न (The Magic Genie - LLM): आप एक सुपर-स्मार्ट AI (लार्ज लैंग्वेज मॉडल) से बस "एक बेहतर किले के लिए कोड लिखें" कहते हैं। समस्या यह है कि AI अक्सर भ्रमित हो जाता है, मतिभ्रम (hallucinate) करने लगता है (ऐसी ईंटें बना देता है जो अस्तित्व में ही नहीं हैं), या बस उन्हीं पुराने किलों की नकल करता है जिन्हें उसने अपनी ट्रेनिंग की किताबों में देखा था। यह ऐसा है जैसे किसी जिन्न से किला बनाने के लिए कहना, और वह आपको एक ऐसा ब्लूप्रिंट थमा देता है जो बनाने की कोशिश करते ही ढह जाता है।
इस पेपर के लेखकों ने, "LLMasTool," एक तीसरा तरीका आज़माने का फैसला किया। उन्होंने महसूस किया: AI को वास्तुकार मत बनने दो। AI को एक सहायक बनने दो।
यहाँ बताया गया है कि उनका सिस्टम कैसे काम करता है, एक सरल उपमा का उपयोग करते हुए:
1. "मॉड्यूल लाइब्रेरी" (LEGO का डिब्बा)
AI को शून्य से नई ईंटें आविष्कार करने के लिए कहने के बजाय, सिस्टम पहले हजारों मौजूदा, काम करने वाले कोडबेस (जैसे PyTorch) को स्कैन करता है। यह स्वचालित रूप से सभी वैध, काम करने वाली "LEGO ईंटों" (मॉड्यूल) को खोज लेता है और उन्हें एक विशाल, व्यवस्थित लाइब्रेरी में रख देता है।
- यह क्यों महत्वपूर्ण है: AI को यह अनुमान लगाने की ज़रूरत नहीं है कि "कन्वोल्यूशनल ब्लॉक" क्या है। वह बस लाइब्रेरी से एक वास्तविक, काम करने वाला ब्लॉक उठा लेता है। यह गारंटी देता है कि उसके द्वारा उपयोग किया जाने वाला हर हिस्सा वास्तव में मौजूद है और काम करता है।
2. "पेड़" बनाम "कोड"
अधिकांश AI सिस्टम एक नया प्रोग्राम (एक लंबा, अव्यवस्थित टेक्स्ट पैराग्राफ) लिखने की कोशिश करते हैं ताकि एक नया आर्किटेक्चर समझाया जा सके। यदि AI एक भी टाइपो (लिखने की गलती) करता है, तो पूरा सिस्टम टूट जाता है।
- पेपर की तरकीब: वे AI मस्तिष्क को एक पेड़ (Tree) के रूप में दर्शाते हैं।
- तना (Trunk) पूरे मॉडल को दर्शाता है।
- बड़ी शाखाएं (Branches) प्रमुख हिस्सों को दर्शाती हैं (जैसे "बैकबोन" या "नेक")।
- छोटी टहनियाँ (Twigs) विशिष्ट सेटिंग्स को दर्शाती हैं (जैसे "32 चैनल्स का उपयोग करें" या "कर्नेल साइज 3")।
- लाभ: पूरे कोड के पैराग्राफ को फिर से लिखने के बजाय, पेड़ की एक शाखा को काटकर उसे लाइब्रेरी से एक अलग शाखा से बदलना बहुत आसान है।
3. "फोरमैन" और "स्पेशलिस्ट" (Coarse-to-Fine)
यही मुख्य नवाचार है। वे काम को एक नियम-आधारित एल्गोरिदम (फोरमैन) और LLM (स्पेशलिस्ट) के बीच विभाजित करते हैं।
फोरमैन (एल्गोरिदम): यह बॉस है। यह पेड़ को देखता है और बड़े स्तर की रणनीति तय करता है।
- उदाहरण: "ठीक है, हमें 'बैकबोन' शाखा को बदलने की आवश्यकता है। चलिए यहाँ एक लेयर हटाते हैं, या शायद वहां एक नई शाखा जोड़ते हैं।"
- फोरमैन यह तय करने के लिए गणित (बायेसियन सांख्यिकी) का उपयोग करता है कि आगे कहाँ देखना है, यह सुनिश्चित करते हुए कि वे केवल एक ही चीज़ को बार-बार न करते रहें। यह सिस्टम को नए, अजीब दिशाओं में अन्वेषण करने के लिए मजबूर करता है।
स्पेशलिस्ट (LLM): एक बार जब फोरमैन कहता है, "हे, चलो इस शाखा को 'ResBlock' से बदल दें," तो LLM काम संभाल लेता है।
- काम: LLM को पूरा किला आविष्कार नहीं करना है। उसे बस छोटे विवरण भरने हैं। "ठीक है, अगर हम यहाँ 'ResBlock' का उपयोग करते हैं, तो उसकी सेटिंग्स क्या होनी चाहिए? क्या बायस (bias) ऑन होना चाहिए या ऑफ? सबसे अच्छा नंबर क्या होगा?"
- जादू: क्योंकि LLM केवल छोटे, विशिष्ट कार्यों को कर रहा है, वह शायद ही कभी गलतियाँ करता है। यह एक बॉस के रूप में नहीं, बल्कि एक टूल के रूप में कार्य करता है।
4. "विकास" (Trial and Error)
यह सिस्टम प्राकृतिक चयन (natural selection) की तरह काम करता है:
- प्रस्ताव (Propose): फोरमैन पेड़ में एक स्थान चुनता है और LLM से एक छोटा बदलाव करने के लिए कहता है।
- परीक्षण (Test): वे नया "किला" बनाते हैं (AI मॉडल को ट्रेन करते हैं) और देखते हैं कि वह कैसा प्रदर्शन करता है।
- सीखना (Learn): यदि यह बेहतर होता है, तो वे उस बदलाव को याद रखते हैं। यदि यह बदतर होता है, तो वे उसे भूल जाते हैं।
- दोहराना (Repeat): वे इसे हजारों बार करते हैं, धीरे-धीरे आर्किटेक्चर को अविश्वसनीय रूप से कुशल और शक्तिशाली बनाने के लिए विकसित करते हैं।
यह एक बड़ी बात क्यों है?
- मतिभ्रम (Hallucinations) का कोई डर नहीं: क्योंकि AI केवल एक लाइब्रेरी से वास्तविक कोड चुन रहा है और खाली जगहों को भर रहा है, इसलिए वह लगभग कभी भी "टूटा हुआ" मॉडल नहीं बनाता है।
- सच्ची रचनात्मकता: "फोरमैन" सिस्टम को उन अजीब संयोजनों को आज़माने के लिए मजबूर करता है जो AI ने अपने आप कभी नहीं सोचे होते, जिससे वह AI के "ट्रेनिंग बायस" से बाहर निकल पाता है।
- बेहतर परिणाम: अपने परीक्षणों में, इस पद्धति ने मानक इमेज रिकग्निशन टेस्ट (जैसे CIFAR और ImageNet) पर पिछले स्टेट-ऑफ-द-आर्ट तरीकों को काफी बड़े अंतर से पीछे छोड़ दिया।
संक्षेप में:
एक प्रतिभाशाली AI से शुरुआत से उपन्यास लिखने के लिए कहने के बजाय (जो अक्सर विफल रहता है), उन्होंने उसे वास्तविक शब्दों का एक शब्दकोश (मॉड्यूल लाइब्रेरी) और एक सख्त संपादक (एल्गोरिदम) दिया जो उसे ठीक से बताता है कि किन शब्दों का उपयोग करना है। इसके बाद AI बस व्याकरण भरता है। परिणाम? एक उत्कृष्ट कृति जो रचनात्मक भी है और पूरी तरह से व्याकरणिक रूप से सही भी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।