← नवीनतम पेपर
🤖 AI

SIGMA: SHAP-Guided Implicit-Trajectory Generation for Metadata-Free LLM-Based AutoFE

SIGMA एक स्केलेबल, मेटाडेटा-मुक्त AutoFE फ्रेमवर्क है जो एक कांस्टेंट कॉन्टेक्स्ट विंडो के साथ फीचर जनरेशन को निर्देशित करने के लिए SHAP वैल्यूज और एक EXposed-feature Implicit Trajectory (EXIT) दृष्टिकोण का लाभ उठाता है, जो प्रभावी रूप से फीचर डुप्लीकेशन को कम करता है और स्टेट-ऑफ-द-आर्ट प्रदर्शन से मेल खाते हुए दक्षता में सुधार करता है।

मूल लेखक: Xuan Zheng, Kento Uchida, Shinichi Shirakawa

प्रकाशित 2026-08-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xuan Zheng, Kento Uchida, Shinichi Shirakawa

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डेटा विज्ञान की दुनिया में, कंप्यूटरों को अक्सर समस्याओं को हल करने के लिए संख्याओं से भरी विशाल स्प्रेडशीट्स दी जाती हैं, जैसे कि ऋण चूक (लोन डिफॉल्ट) की भविष्यवाणी करना या बीमारियों का निदान करना। हालाँकि, ये कच्चे नंबर अपने आप में पर्याप्त नहीं होते हैं। सर्वोत्तम परिणाम प्राप्त करने के लिए, विशेषज्ञों को 'ऑटोमेटेड फीचर इंजीनियरिंग' नामक एक प्रक्रिया करनी होती है, जिसमें मौजूदा डेटा को संयोजित या रूपांतरित करके नए, अधिक स्मार्ट कॉलम बनाना शामिल है। एक ऐसे शेफ की कल्पना करें जो न केवल पेंट्री में मौजूद सामग्रियों का उपयोग करता है बल्कि किसी व्यंजन का स्वाद बेहतर बनाने के लिए नए स्वादों के संयोजन का आविष्कार भी करता है। दशकों से, कंप्यूटरों ने संख्याओं को अंधाधुंध मिलाने और जोड़ने की कोशिश की है, लेकिन यह दृष्टिकोण धीमा है और अक्सर भ्रमित करने वाले परिणाम देता है। हाल ही में, वैज्ञानिकों ने बड़े भाषा मॉडल (Large Language Models)—जो शक्तिशाली कृत्रिम बुद्धिमत्ता प्रणाली हैं जो संदर्भ से तर्क और सीख सकते हैं—का उपयोग इन रचनात्मक शेफ के रूप में करने के लिए शुरू किया है। इन AI प्रणालियों को बेहतर भविष्यवाणियों की कुंजी माना जाता था, लेकिन उन्हें एक बड़ी बाधा का सामना करना पड़ा: उन्हें ठीक से काम करने के लिए हर संख्या का अर्थ बताने वाले विस्तृत विवरणों की आवश्यकता होती थी। वास्तविक दुनिया में, गोपनीयता नियमों के कारण या केवल इसलिए कि डेटा सेंसर से आता है जो मानवीय भाषा नहीं बोलते, ऐसे विवरण अक्सर गायब होते हैं। इसके अलावा, जब इन AI प्रणालियों ने डेटा को बेहतर बनाने के लिए अपने पिछले प्रयासों से सीखने की कोशिश की, तो उनके इतिहास की सूची इतनी लंबी हो गई कि उसने कंप्यूटर की मेमोरी को अभिभूत कर दिया, जिससे सिस्टम एक ही गलतियों को दोहराने के लूप में फंस गया।

योकोहामा नेशनल यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने SIGMA नामक एक नई विधि विकसित की है ताकि इन समस्याओं को हल किया जा सके, जिससे कृत्रिम बुद्धिमत्ता को डेटा के क्या प्रतिनिधित्व हैं, इसके बिना बेहतर डेटा इंजीनियर करने की अनुमति मिलती है। डेटा को समझने के लिए मानवीय भाषा पर निर्भर रहने के बजाय, SIGMA एक गणितीय उपकरण SHAP का उपयोग करता है जो यह मापता है कि अंतिम भविष्यवाणी के लिए जानकारी का प्रत्येक हिस्सा वास्तव में कितना महत्वपूर्ण है। इस उपकरण को एक स्पॉटलाइट के रूप में सोचें जो सबसे महत्वपूर्ण संख्याओं को उजागर करता है और कम उपयोगी संख्याओं को धुंधला कर देता है, जिससे AI को यह जाने बिना कि संख्याओं को क्या कहा जाता है, दिशा का स्पष्ट बोध होता है। शोधकर्ताओं ने फिर इन संख्याओं को तीन श्रेणियों में विभाजित किया: सबसे महत्वपूर्ण, मध्यम रूप से उपयोगी, और कमजोर। उन्होंने AI को इन समूहों के भीतर संख्याओं को मिलाकर या मजबूत संख्याओं को कमजोरों के साथ जोड़कर नए डेटा कॉलम बनाने के लिए कहा, जो प्रभावी रूप से सिस्टम को सिखाता है कि अपनी रचनात्मकता को सबसे महत्वपूर्ण स्थानों पर केंद्रित करे।

इस कार्य का सबसे महत्वपूर्ण नवाचार एक तकनीक है जिसे शोधकर्ता "एक्सपोज्ड-फीचर इम्प्लिसिट ट्रजेक्टरी" (exposed-feature implicit-trajectory) कहते हैं। पिछले प्रयासों में, AI प्रणालियाँ डुप्लिकेट बनाने से बचने के लिए उन सभी फीचर्स की एक लिखित सूची रखती थीं जिन्हें उन्होंने कभी बनाया था, लेकिन यह सूची इतनी लंबी हो जाती थी कि कंप्यूटर की मेमोरी में फिट नहीं हो पाती थी। SIGMA एक अलग दृष्टिकोण अपनाता है। एक इतिहास लिखने के बजाय, यह कुछ समय के लिए पहले से उपयोग किए गए फीचर्स को AI की दृष्टि से छिपा देता है। यदि AI एक ऐसा फीचर बनाने की कोशिश करता है जिसमें किसी छिपे हुए नंबर का उपयोग किया गया है, तो उसे कहीं और देखने के लिए मजबूर होना पड़ता है। छिपाने और प्रकट करने की यह सरल क्रिया एक मूक मार्गदर्शक के रूप la कार्य करती है, जो सिस्टम को बिना किसी लंबा इतिहास लॉग स्टोर किए खुद को दोहराने से दूर ले जाती है। यह सिस्टम को मेमोरी सीमाओं या बार-बार बेकार फीचर्स उत्पन्न करने के चक्र में फंसे बिना, कई चरणों में अपने काम को परिष्कृत करने के लिए बहुत लंबे समय तक चलने की अनुमति देता है।

इस नए दृष्टिकोण के परिणाम आश्चर्यजनक हैं। सोलह विभिन्न वास्तविक दुनिया के डेटासेट्स पर परीक्षण किए जाने पर, SIGMA उन सर्वश्रेष्ठ मौजूदा AI तरीकों के समान प्रदर्शन करता है जो विस्तृत विवरणों पर निर्भर करते हैं, जिससे यह सिद्ध होता है कि प्रभावी होने के लिए सिस्टम को मानवीय लेबल की आवश्यकता नहीं है। इससे भी महत्वपूर्ण बात यह है कि इसने दोहराव की समस्या को हल कर दिया। पिछले सिस्टमों में, लगभग सैंतीस प्रतिशत जनरेट किए गए फीचर्स डुप्लिकेट थे, जिससे मूल्यवान कंप्यूटिंग शक्ति बर्बाद हो रही थी। SIGMA के उपयोग किए गए फीचर्स को छिपाने के तरीके के साथ, वह डुप्लिकेशन दर नाटकीय रूप से गिरकर सात प्रतिशत से भी कम हो गई। यह सिस्टम अविश्वसनीय रूप से कुशल भी साबित हुआ। जहाँ पारंपरिक तरीके कुछ अच्छे फीचर्स खोजने के लिए सैकड़ों नए फीचर्स उत्पन्न करते हैं, वहीं SIGMA ने औसतन केवल पांच नए फीचर्स प्रति डेटासेट का उपयोग करके शीर्ष-स्तरीय प्रदर्शन प्राप्त किया। इसका मतलब है कि सिस्टम तेजी से सबसे मूल्यवान सुधार खोज लेता है, जिससे बाकी डेटा साफ और प्रबंधनीय रहता है।

शोधकर्ताओं ने यह भी पाया कि यह विधि AI को डेटा के जटिल, बहु-स्तरीय ढांचे बनाने की अनुमति देती है जो पहले पहुंच से बाहर थे। कुछ परीक्षणों में, सिस्टम ने फीचर्स को एक श्रृंखला (चेन) में संयोजित करने में सफलता प्राप्त की, जिसमें एक चरण के आउटपुट को अगले चरण के इनपुट के रूप में उपयोग किया गया, जिससे संबंधों का एक गहरा नेटवर्क बना जिसने भविष्यवाणियों में महत्वपूर्ण सुधार किया। इस क्षमता ने SIGMA को उन पुराने, गैर-AI तरीकों से बेहतर प्रदर्शन करने में सक्षम बनाया जो कठोर, पूर्व-निर्धारित नियमों पर निर्भर करते हैं। अध्ययन इस बात की पुष्टि करता है कि मानवीय भाषा की आवश्यकता को गणितीय महत्व संकेतों (mathematical importance signals) से बदलकर और छिपाने और प्रकट करने की एक चतुर प्रणाली का उपयोग करके, कृत्रिम बुद्धिमत्ता डेटा विश्लेषण को बेहतर बनाने के लिए एक अधिक शक्तिशाली और व्यावहारिक उपकरण बन सकती है, यहाँ तक कि उन स्थितियों में भी जहाँ कोई मानवीय विवरण उपलब्ध नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →