LLM-FE: Automated Feature Engineering for Tabular Data with LLMs as Evolutionary Optimizers
यह शोध पत्र LLM-FE को प्रस्तुत करता है, जो एक नवीन ढांचा (framework) है जो टैबुलर डेटा के लिए प्रभावी फीचर ट्रांसफॉर्मेशन प्रोग्रामों की पुनरावृत्ति से खोज करने हेतु लार्ज लैंग्वेज मॉडल्स के साथ इवोल्यूशनरी सर्च को जोड़ता है, जिससे यह डोमेन ज्ञान और डेटा-संचालित फीडबैक का बेहतर लाभ उठाकर मौजूदा ऑटोमेटेड फीचर इंजीनियरिंग विधियों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य को सुलझाने की कोशिश कर रहे हैं और आपके पास सुरागों (डेटा) का एक ढेर है। आमतौर पर, आपको इन सुरागों को मैन्युअल रूप से छानना पड़ता है, उन्हें चतुराई से जोड़ना पड़ता है, और नए "सुपर-सुराग" बनाने पड़ते हैं ताकि आप केस को तेज़ी से सुलझा सकें। इस प्रक्रिया को फीचर इंजीनियरिंग (Feature Engineering) कहा जाता है। मशीन लर्निंग की दुनिया में, ऐसा मैन्युअल रूप से करना धीमा, उबाऊ है और इसके लिए एक मानव विशेषज्ञ की आवश्यकता होती है जिसे पता हो कि कौन से सुरागों का संयोजन काम कर सकता है।
यह पेपर एक नया टूल पेश करता है जिसे LLM-FE कहा जाता है, जो इस जासूसी काम को स्वचालित करने के लिए एक "अति-बुद्धिमान" AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग करता है, जो एक रचनात्मक साथी के रूप में कार्य करता है।
यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:
1. समस्या: "अनुमान लगाने का खेल" (The Guessing Game)
पारंपरिक स्वचालित उपकरण इसे संख्याओं को अंधाधुंध मिला कर (जैसे कॉलम A को कॉलम B में जोड़ना) हल करने की कोशिश करते हैं, जो नियमों की एक निश्चित सूची पर आधारित होता है। वे एक ऐसे रोबोट की तरह हैं जो केवल बाएं या दाएं मुड़ना जानता है, यह कभी नहीं समझ पाता कि कभी-कभी आपको बाड़ के ऊपर से कूदने की ज़रूरत होती है। वे अक्सर डेटा के पीछे की "कहानी" को समझने वाले "अहा!" क्षणों को चूक जाते हैं (जैसे यह जानना कि मधुमेह के लिए "इंसुलिन" और "ग्लूकोज" आपस में संबंधित हैं)।
2. समाधान: "विकासवादी शेफ" (The Evolutionary Chef)
लेखक LLM-FE का प्रस्ताव देते हैं, जो फीचर इंजीनियरिंग को एक कुकिंग कॉम्पिटिशन की तरह मानता है जहाँ AI शेफ है। केवल एक रेसिपी का पालन करने के बजाय, AI को दिया जाता है:
- सामग्री (The Ingredients): कच्चा डेटा (जैसे रोगी की आयु, रक्त शर्करा का स्तर)।
- मेन्यू (The Menu): हल करने के लिए विशिष्ट समस्या (जैसे, "क्या रोगी को मधुमेह है, इसका अनुमान लगाएं")।
- कुकबुक (The Cookbook): दुनिया के बारे में AI का अपना आंतरिक ज्ञान (जैसे, "मैं जानता हूँ कि उच्च चीनी और कम इंसुलिन स्वास्थ्य के लिए बुरा है")।
3. यह कैसे काम करता है: चार-चरणीय चक्र (The Four-Step Loop)
पेपर एक ऐसे चक्र का वर्णन करता है जो बार-बार दोहराया जाता है, ठीक वैसे ही जैसे प्रकृति में प्रजातियां बेहतर जीवित रहने के लिए विकसित होती हैं:
चरण A: रचनात्मक चिंगारी (Generation - सृजन)
AI डेटा और समस्या को देखता है। वह कहता है, "हम्म, यदि मैं ग्लूकोज के स्तर से इंसुलिन के स्तर को विभाजित कर दूँ, तो यह हमें बता सकता है कि शरीर चीनी को कैसे संसाधित करता है।" वह इस नए "सुपर-सुराग" को बनाने के लिए एक छोटा कंप्यूटर प्रोग्राम (एक रेसिपी) लिखता है।- उपमा: शेफ उपलब्ध सामग्रियों और उस व्यंजन के आधार पर एक नया सॉस बनाता है जिसे वह बनाने की कोशिश कर रहा है।
चरण B: स्वाद परीक्षण (Evaluation - मूल्यांकन)
नई रेसिपी को डेटा पर लागू किया जाता है। फिर, एक प्रेडिक्शन मॉडल (एक सरल परीक्षण) इस नए डेटा का उपयोग करके समस्या को हल करने की कोशिश करता है।- उपमा: शेफ जज को नया सॉस परोसता है। यदि जज को यह पसंद आता है (स्कोर बढ़ जाता है), तो रेसिपी अच्छी है। यदि नहीं, तो इसे हटा दिया जाता है।
चरण C: मेमोरी बैंक (Experience Management - अनुभव प्रबंधन)
यही LLM-FE का असली राज है। सिस्टम केवल विफल रेसिपीज़ को भूल नहीं जाता है। यह उन बेहतरीन रेसिपीज़ का एक "हॉल ऑफ फ़ेम" रखता है जो इसने कभी बनाई हैं।- उपमा: कल्पना कीजिए कि एक शेफ जो अपने 10 सबसे अच्छे व्यंजनों की एक नोटबुक रखता है। जब उसे नया व्यंजन बनाना होता है, तो वह शून्य से शुरुआत नहीं करता; वह अपने सबसे अच्छे पिछले व्यंजनों को देखता है और कहता है, "क्या होगा अगर मैं व्यंजन #3 के सबसे अच्छे हिस्से को व्यंजन #7 के सबसे अच्छे हिस्से के साथ मिला दूँ?"
चरण D: विकास (Refinement - परिष्करण)
AI और भी बेहतर रेसिपी बनाने के लिए "हॉल ऑफ फ़ेम" का उपयोग करता है। वह बेहतर होने के लिए सबसे अच्छी रेसिपी में "म्यूटेशन" (थोड़ा बदलाव) करने की कोशिश करता है।- उपमा: यह प्राकृतिक चयन (natural selection) की तरह है। सबसे मजबूत, स्वादिष्ट रेसिपी जीवित रहती है और विकसित होती है, जबकि कमजोर रेसिपी खत्म हो जाती हैं।
4. यह दूसरों से बेहतर क्यों है?
पेपर LLM-FE की अन्य तरीकों से तुलना करता है और पाता है कि यह तीन मुख्य कारणों से जीतता है:
- यह संदर्भ को जानता है: अन्य रोबोटों के विपरीत जो केवल गणित करते हैं, यह AI समझता है कि डेटा का अर्थ क्या है। यह जानता है कि "आयु" और "BMI" स्वास्थ्य से संबंधित हैं, इसलिए यह ऐसे फीचर्स बनाता है जो मनुष्यों के लिए सार्थक हैं, न कि केवल नंबर।
- यह अटकता नहीं है: अन्य तरीके अक्सर एक ही विचार को सुधारने की कोशिश में अटक जाते हैं। LLM-FE एक ही समय में विचारों के कई "द्वीपों" (islands) को चलाता है। यदि एक द्वीप किसी डेड एंड (बंद रास्ते) में फंस जाता है, तो दूसरा द्वीप शॉर्टकट खोज सकता है।
- यह गलतियों से सीखता है: पहले जो काम किया था, उसकी याददाश्त रखकर, यह हर प्रयास के साथ स्मार्ट होता जाता है, न कि केवल रैंडमली अनुमान लगाता है।
5. परिणाम
शोधकर्ताओं ने कई अलग-अलग डेटासेट्स (जैसे हृदय रोग, घरों की कीमतें और कारों की बिक्री की भविष्यवाणी करना) पर इसका परीक्षण किया। उन्होंने पाया कि LLM-FE ने लगातार पुराने तरीकों की तुलना में प्रेडिक्शन मॉडल्स को अधिक सटीक बनाया। यह केवल एक प्रकार के AI के साथ काम नहीं करता; इसने विभिन्न प्रकार के मॉडल्स को उनके काम में बेहतर होने में मदद की।
संक्षेप में: LLM-FE एक ऐसा सिस्टम है जो डेटा को देखने के नए, सार्थक तरीके खोजने के लिए एक स्मार्ट AI का उपयोग करता है। यह एक रचनात्मक शेफ की तरह कार्य करता है जो अपने सबसे अच्छे पिछले व्यंजनों से सीखता है, दुनिया के बारे में अपने ज्ञान का उपयोग करता है, और तब तक प्रयोग करता रहता है जब तक कि उसे समस्या को हल करने के लिए सही रेसिपी न मिल जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।