← नवीनतम पेपर
🤖 machine learning

MacrOData: New Benchmarks of Thousands of Datasets for Tabular Outlier Detection

यह शोधपत्र MacrOData प्रस्तुत करता है, जो एक बड़े पैमाने का ओपन-सोर्स बेंचमार्क सुइट है जिसमें वास्तविक और कृत्रिम श्रेणियों के अंतर्गत 2,446 क्यूरेटेड डेटासेट शामिल हैं, ताकि टैबुलर आउटलियर डिटेक्शन विधियों के सांख्यिकीय रूप से सुदृढ़ और व्यापक मूल्यांकन को सक्षम बनाया जा सके।

मूल लेखक: Xueying Ding, Simon Klüttermann, Haomin Wen, Yilong Chen, Leman Akoglu

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xueying Ding, Simon Klüttermann, Haomin Wen, Yilong Chen, Leman Akoglu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को यह सिखाने की कोशिश कर रहे हैं कि अच्छे सेबों से भरी टोकरी में एक "खराब सेब" को कैसे पहचाना जाए। इसे आउटलियर डिटेक्शन (Outlier Detection) कहा जाता है। चाहे वह क्रेडिट कार्ड के फर्जी लेनदेन को ढूंढना हो, किसी मशीन के खराब पुर्जे को पहचानना हो, या कोई दुर्लभ बीमारी हो, कंप्यूटर को यह सीखने की आवश्यकता है कि "सामान्य" क्या दिखता है ताकि वह अजीब चीजों को चिह्नित कर सके।

लंबे समय से, इन "खराब सेबों को पकड़ने वाले डिटेक्टर्स" को बनाने की कोशिश कर रहे वैज्ञानिकों ने एक बहुत ही छोटा, कुछ हद तक टूटा हुआ टूलबॉक्स इस्तेमाल किया है। यह पेपर, macrOData, इस समस्या को ठीक करने के लिए एक विशाल, बिल्कुल नया टूलबॉक्स पेश करता है।

यहाँ बताया गया है कि लेखकों ने क्या किया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "छोटा खिलौना बॉक्स"

वर्षों से, इन डिटेक्टर्स का परीक्षण करने के लिए मानक उपकरण के रूप में ADBench नामक संग्रह का उपयोग किया जाता रहा है।

  • उपमा: कल्पना कीजिए कि ADBench एक खिलौना बॉक्स है जिसमें केवल 57 खिलौना कारें हैं।
  • समस्या: यदि आप अपनी नई, शानदार कार इंजन का परीक्षण केवल 57 छोटे खिलौना कारों पर करते हैं, तो आप यह नहीं बता सकते कि क्या यह एक असली ट्रक, मोटरसाइकिल या अंतरिक्ष यान पर काम करेगा।
  • छिपा हुआ जाल: लेखकों ने पाया कि ये 57 खिलौना कारें संदिग्ध रूप से एक जैसी दिखती थीं। वे ज्यादातर केवल "शोर" (जैसे रेडियो पर स्टेटिक) जैसी थीं। इस कारण से, साधारण, पुराने तरीकों (जैसे दूरी मापना) ने जटिल, आधुनिक AI की तरह ही अच्छा प्रदर्शन किया। यह एक फेरारी का परीक्षण एक कच्ची सड़क पर करने जैसा था जहाँ केवल एक ट्राइसाइकिल ही जीत सकती थी; उस परीक्षण ने गति को नहीं मापा, बल्कि यह मापा कि मिट्टी पर गाड़ी कितनी अच्छी तरह चलाई जा सकती है।

2. समाधान: "मेगा-मॉल" (macrOData)

लेखकों ने macrOData बनाया है, जो एक विशाल नया परीक्षण मैदान है जिसमें 2,446 डेटासेट शामिल हैं। उन्होंने केवल कॉपी-पेस्ट नहीं किया; उन्होंने इस मेगा-मॉल के तीन अलग-अलग "विंग्स" (पंखों) को सावधानीपूर्वक तैयार किया है:

  • विंग 1: OddBench (असली दुनिया का क्राइम सीन)
    • यह क्या है: 790 वास्तविक दुनिया के टेबल्स जहाँ "खराब सेब" वास्तव में सार्थक समस्याएं हैं (जैसे धोखाधड़ी, उपकरण की विफलता, या बीमारी)।
    • उपमा: यह वास्तविक जीवन के रहस्यों के एक संग्रहालय की तरह है। यह कंप्यूटर को भीड़ में चोर को पहचानने के लिए सिखाता है, न कि केवल एक धुंधले पिक्सेल को।
  • विंग 2: OvRBench (द "वन-वर्सेस-रेस्ट" जिम)
    • यह क्या है: मानक वर्गीकरण कार्यों (जहाँ आप आमतौर पर चीजों को श्रेणियों में बांटते हैं) से लिए गए 856 डेटासेट्स जिन्हें आउटलियर कार्यों में बदल दिया गया है।
    • उपमा: कल्पना कीजिए कि एक सॉर्टिंग गेम (जैसे लाल बनाम नीले मार्बल्स को छांटना) को लेकर आप कहते हैं, "ठीक है, अब उस एक मार्बल को ढूंढो जो किसी भी रंग में फिट नहीं बैठता।" यह परीक्षण करता है कि कंप्यूटर बदलते नियमों को कितनी अच्छी तरह संभालता है।
  • विंग 3: SynBench (वर्चुअल लैब)
    • यह क्या है: बनाए गए पैटर्न और विशिष्ट प्रकार के "खराब सेबों" वाले 800 कंप्यूटर-जनरेटेड डेटासेट्स।
    • उपमा: यह एक वीडियो गेम सिम्युलेटर है। वैज्ञानिक असंभव परिदृश्य बना सकते हैं (जैसे एक ऐसी दुनिया जहाँ गुरुत्वाकर्षण तिरछा काम करता है) यह देखने के लिए कि क्या डिटेक्टर टूट जाता है।

3. खेल के नए नियम

लेखकों ने केवल अधिक डेटा ही नहीं जोड़ा; उन्होंने खेल को निष्पक्ष बनाने के लिए खेलने का तरीका भी बदल दिया:

  • मानकीकृत विभाजन (Standardized Splits): प्रत्येक डेटासेट को पहले से ही एक "ट्रेनिंग" ढेर और एक "टेस्टिंग" ढेर में विभाजित किया गया है। जवाब देखकर नकल करने का कोई रास्ता नहीं है।
  • "ब्लाइंड" टेस्ट: उन्होंने 200 डेटासेट्स को गुप्त (Private) रखा है। उनके पास जवाब हैं, लेकिन जनता के पास नहीं। यह एक ऑनलाइन लीडरबोर्ड की अनुमति देता है जहाँ शोधकर्ता बिना पहले से सही उत्तर जाने निष्पक्ष रूप से प्रतिस्पर्धा कर सकते हैं।
  • मेटाडेटा टैग्स: प्रत्येक डेटासेट के साथ एक लेबल आता है जो बताता है कि वह क्या है (जैसे, "हेल्थकेयर," "फाइनेंस"), ताकि शोधकर्ताओं को पता चले कि वे वास्तव में क्या परीक्षण कर रहे हैं।

4. बड़ा प्रयोग: कौन जीतता है?

लेखकों ने इस मेगा-मॉल पर 14 अलग-अलग "जासूसों" (एल्गोरिदम) का परीक्षण किया। ये निम्नलिखित श्रेणियों में से थे:

  • पुराना स्कूल: सरल गणितीय ट्रिक्स (जैसे KNN)।
  • डीप लर्निंग: जटिल न्यूरल नेटवर्क।
  • फाउंडेशन मॉडल्स: नवीनतम, विशाल AI मॉडल जिन्हें भारी मात्रा में डेटा पर प्रशिक्षित किया गया है।

परिणाम:

  • पुराना गार्ड बनाम नया: आश्चर्यजनक रूप से, जटिल "डीप लर्निंग" मॉडल अक्सर साधारण मॉडलों से खराब प्रदर्शन करते थे। क्यों? क्योंकि वे अपनी सेटिंग्स के प्रति बहुत संवेदनशील थे (जैसे एक कार जो रेडियो की आवाज़ तेज़ होने पर बंद हो जाती है)।
  • चैंपियंस: फाउंडेशन मॉडल्स (विशेष रूप से OutFormer और FoMo-0D) स्पष्ट विजेता थे।
    • क्यों? वे तेज़, सटीक थे और उन्हें मैन्युअल रूप से "ट्यून" करने की आवश्यकता नहीं थी। वे "प्लग-एंड-प्ले" की तरह काम करते थे।
    • रूपक: यदि पुराने तरीके एक मैकेनिक को कार चलाने के लिए 50 पेंचों को एडजस्ट करने की आवश्यकता होने जैसे थे, तो फाउंडेशन मॉडल्स एक सेल्फ-ड्राइविंग कार की तरह थे जो बस एक्सीलरेटर दबाने पर ही चल पड़ती है।

5. मुख्य निष्कर्ष (The Takeaway)

यह पेपर कहता है: "अपने नए विचारों का परीक्षण एक छोटे, टूटे हुए खिलौना बॉक्स पर करना बंद करें।"
एक विशाल, विविध और निष्पक्ष परीक्षण मैदान (macrOData) प्रदान करके, उन्होंने दिखाया है कि फाउंडेशन मॉडल्स वर्तमान में टेबल डेटा में आउटलियर्स को पहचानने के लिए सबसे अच्छा टूल हैं। वे उन जटिल डीप लर्निंग मॉडलों की तुलना में तेज़, अधिक सटीक और उपयोग में आसान हैं जिन्होंने वर्षों से इस क्षेत्र पर कब्जा कर रखा था।

लेखकों ने अपने सभी 2,446 डेटासेट्स और लीडरबोर्ड को ओपन-सोर्स कर दिया है, और पूरी दुनिया को इसमें खेलने, परीक्षण करने और इन नए मानकों में सुधार करने के लिए आमंत्रित किया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →