← नवीनतम पेपर
🤖 machine learning

LLM-FE: Automated Feature Engineering for Tabular Data with LLMs as Evolutionary Optimizers

यह शोध पत्र LLM-FE को प्रस्तुत करता है, जो एक नवीन ढांचा (framework) है जो टैबुलर डेटा के लिए प्रभावी फीचर ट्रांसफॉर्मेशन प्रोग्रामों की पुनरावृत्ति से खोज करने हेतु लार्ज लैंग्वेज मॉडल्स के साथ इवोल्यूशनरी सर्च को जोड़ता है, जिससे यह डोमेन ज्ञान और डेटा-संचालित फीडबैक का बेहतर लाभ उठाकर मौजूदा ऑटोमेटेड फीचर इंजीनियरिंग विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Nikhil Abhyankar, Parshin Shojaee, Chandan K. Reddy

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nikhil Abhyankar, Parshin Shojaee, Chandan K. Reddy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक रहस्य को सुलझाने की कोशिश कर रहे हैं और आपके पास सुरागों (डेटा) का एक ढेर है। आमतौर पर, आपको इन सुरागों को मैन्युअल रूप से छानना पड़ता है, उन्हें चतुराई से जोड़ना पड़ता है, और नए "सुपर-सुराग" बनाने पड़ते हैं ताकि आप केस को तेज़ी से सुलझा सकें। इस प्रक्रिया को फीचर इंजीनियरिंग (Feature Engineering) कहा जाता है। मशीन लर्निंग की दुनिया में, ऐसा मैन्युअल रूप से करना धीमा, उबाऊ है और इसके लिए एक मानव विशेषज्ञ की आवश्यकता होती है जिसे पता हो कि कौन से सुरागों का संयोजन काम कर सकता है।

यह पेपर एक नया टूल पेश करता है जिसे LLM-FE कहा जाता है, जो इस जासूसी काम को स्वचालित करने के लिए एक "अति-बुद्धिमान" AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग करता है, जो एक रचनात्मक साथी के रूप में कार्य करता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "अनुमान लगाने का खेल" (The Guessing Game)

पारंपरिक स्वचालित उपकरण इसे संख्याओं को अंधाधुंध मिला कर (जैसे कॉलम A को कॉलम B में जोड़ना) हल करने की कोशिश करते हैं, जो नियमों की एक निश्चित सूची पर आधारित होता है। वे एक ऐसे रोबोट की तरह हैं जो केवल बाएं या दाएं मुड़ना जानता है, यह कभी नहीं समझ पाता कि कभी-कभी आपको बाड़ के ऊपर से कूदने की ज़रूरत होती है। वे अक्सर डेटा के पीछे की "कहानी" को समझने वाले "अहा!" क्षणों को चूक जाते हैं (जैसे यह जानना कि मधुमेह के लिए "इंसुलिन" और "ग्लूकोज" आपस में संबंधित हैं)।

2. समाधान: "विकासवादी शेफ" (The Evolutionary Chef)

लेखक LLM-FE का प्रस्ताव देते हैं, जो फीचर इंजीनियरिंग को एक कुकिंग कॉम्पिटिशन की तरह मानता है जहाँ AI शेफ है। केवल एक रेसिपी का पालन करने के बजाय, AI को दिया जाता है:

  • सामग्री (The Ingredients): कच्चा डेटा (जैसे रोगी की आयु, रक्त शर्करा का स्तर)।
  • मेन्यू (The Menu): हल करने के लिए विशिष्ट समस्या (जैसे, "क्या रोगी को मधुमेह है, इसका अनुमान लगाएं")।
  • कुकबुक (The Cookbook): दुनिया के बारे में AI का अपना आंतरिक ज्ञान (जैसे, "मैं जानता हूँ कि उच्च चीनी और कम इंसुलिन स्वास्थ्य के लिए बुरा है")।

3. यह कैसे काम करता है: चार-चरणीय चक्र (The Four-Step Loop)

पेपर एक ऐसे चक्र का वर्णन करता है जो बार-बार दोहराया जाता है, ठीक वैसे ही जैसे प्रकृति में प्रजातियां बेहतर जीवित रहने के लिए विकसित होती हैं:

  • चरण A: रचनात्मक चिंगारी (Generation - सृजन)
    AI डेटा और समस्या को देखता है। वह कहता है, "हम्म, यदि मैं ग्लूकोज के स्तर से इंसुलिन के स्तर को विभाजित कर दूँ, तो यह हमें बता सकता है कि शरीर चीनी को कैसे संसाधित करता है।" वह इस नए "सुपर-सुराग" को बनाने के लिए एक छोटा कंप्यूटर प्रोग्राम (एक रेसिपी) लिखता है।

    • उपमा: शेफ उपलब्ध सामग्रियों और उस व्यंजन के आधार पर एक नया सॉस बनाता है जिसे वह बनाने की कोशिश कर रहा है।
  • चरण B: स्वाद परीक्षण (Evaluation - मूल्यांकन)
    नई रेसिपी को डेटा पर लागू किया जाता है। फिर, एक प्रेडिक्शन मॉडल (एक सरल परीक्षण) इस नए डेटा का उपयोग करके समस्या को हल करने की कोशिश करता है।

    • उपमा: शेफ जज को नया सॉस परोसता है। यदि जज को यह पसंद आता है (स्कोर बढ़ जाता है), तो रेसिपी अच्छी है। यदि नहीं, तो इसे हटा दिया जाता है।
  • चरण C: मेमोरी बैंक (Experience Management - अनुभव प्रबंधन)
    यही LLM-FE का असली राज है। सिस्टम केवल विफल रेसिपीज़ को भूल नहीं जाता है। यह उन बेहतरीन रेसिपीज़ का एक "हॉल ऑफ फ़ेम" रखता है जो इसने कभी बनाई हैं।

    • उपमा: कल्पना कीजिए कि एक शेफ जो अपने 10 सबसे अच्छे व्यंजनों की एक नोटबुक रखता है। जब उसे नया व्यंजन बनाना होता है, तो वह शून्य से शुरुआत नहीं करता; वह अपने सबसे अच्छे पिछले व्यंजनों को देखता है और कहता है, "क्या होगा अगर मैं व्यंजन #3 के सबसे अच्छे हिस्से को व्यंजन #7 के सबसे अच्छे हिस्से के साथ मिला दूँ?"
  • चरण D: विकास (Refinement - परिष्करण)
    AI और भी बेहतर रेसिपी बनाने के लिए "हॉल ऑफ फ़ेम" का उपयोग करता है। वह बेहतर होने के लिए सबसे अच्छी रेसिपी में "म्यूटेशन" (थोड़ा बदलाव) करने की कोशिश करता है।

    • उपमा: यह प्राकृतिक चयन (natural selection) की तरह है। सबसे मजबूत, स्वादिष्ट रेसिपी जीवित रहती है और विकसित होती है, जबकि कमजोर रेसिपी खत्म हो जाती हैं।

4. यह दूसरों से बेहतर क्यों है?

पेपर LLM-FE की अन्य तरीकों से तुलना करता है और पाता है कि यह तीन मुख्य कारणों से जीतता है:

  1. यह संदर्भ को जानता है: अन्य रोबोटों के विपरीत जो केवल गणित करते हैं, यह AI समझता है कि डेटा का अर्थ क्या है। यह जानता है कि "आयु" और "BMI" स्वास्थ्य से संबंधित हैं, इसलिए यह ऐसे फीचर्स बनाता है जो मनुष्यों के लिए सार्थक हैं, न कि केवल नंबर।
  2. यह अटकता नहीं है: अन्य तरीके अक्सर एक ही विचार को सुधारने की कोशिश में अटक जाते हैं। LLM-FE एक ही समय में विचारों के कई "द्वीपों" (islands) को चलाता है। यदि एक द्वीप किसी डेड एंड (बंद रास्ते) में फंस जाता है, तो दूसरा द्वीप शॉर्टकट खोज सकता है।
  3. यह गलतियों से सीखता है: पहले जो काम किया था, उसकी याददाश्त रखकर, यह हर प्रयास के साथ स्मार्ट होता जाता है, न कि केवल रैंडमली अनुमान लगाता है।

5. परिणाम

शोधकर्ताओं ने कई अलग-अलग डेटासेट्स (जैसे हृदय रोग, घरों की कीमतें और कारों की बिक्री की भविष्यवाणी करना) पर इसका परीक्षण किया। उन्होंने पाया कि LLM-FE ने लगातार पुराने तरीकों की तुलना में प्रेडिक्शन मॉडल्स को अधिक सटीक बनाया। यह केवल एक प्रकार के AI के साथ काम नहीं करता; इसने विभिन्न प्रकार के मॉडल्स को उनके काम में बेहतर होने में मदद की।

संक्षेप में: LLM-FE एक ऐसा सिस्टम है जो डेटा को देखने के नए, सार्थक तरीके खोजने के लिए एक स्मार्ट AI का उपयोग करता है। यह एक रचनात्मक शेफ की तरह कार्य करता है जो अपने सबसे अच्छे पिछले व्यंजनों से सीखता है, दुनिया के बारे में अपने ज्ञान का उपयोग करता है, और तब तक प्रयोग करता रहता है जब तक कि उसे समस्या को हल करने के लिए सही रेसिपी न मिल जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →