Unbiased mixed variables distance
यह शोध पत्र विभिन्न प्रकार के चरों और पैमानों के कारण मौजूदा मिश्रित चर दूरी मापों (mixed variable distance measures) में होने वाले पूर्वाग्रह को संबोधित करता है, जिसके लिए ऐसे प्रासंगिक अवधारणाओं को परिभाषित किया गया है जो इस पूर्वाग्रह को मापने में सक्षम हैं और निष्पक्ष दूरियों के निर्माण के लिए एक सामान्य सूत्र प्रस्तावित किया गया है जहाँ व्यक्तिगत चर का योगदान माप के प्रकारों या इकाइयों से स्वतंत्र होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप यह मापने की कोशिश कर रहे हैं कि दो लोग एक-दूसरे से कितने अलग हैं। आपके पास गुणों (traits) की एक सूची है: उनकी ऊंचाई (एक संख्या), उनका पसंदीदा रंग (एक श्रेणी), उनकी आयु (एक संख्या), और उनका नौकरी का पद (एक श्रेणी)।
डेटा साइंस की दुनिया में, इसे "मिक्स्ड वेरिएबल" (mixed variable) समस्या कहा जाता है। आप "अंतर" के एक एकल फलों के सलाद (fruit salad) में सेब (संख्याओं) और संतरों (श्रेणियों) को मिलाने की कोशिश कर रहे हैं।
वैन डी वेल्डन और उनके सहयोगियों का शोध पत्र तर्क देता है कि इस सलाद को बनाने के मानक तरीके पक्षपाती (biased) हैं। वे इस तरह से संतरों का स्वाद बहुत अधिक तेज़ या सेबों का स्वाद बहुत कम कर देते हैं, जो केवल इस बात पर निर्भर करता है कि सामग्री को कैसे मापा गया है, न कि इस पर कि कौन सा गुण वास्तव में अधिक महत्वपूर्ण है।
यहाँ उनके तर्क और समाधान का एक सरल विवरण दिया गया है:
1. समस्या: "वॉल्यूम नॉब" खराब है
जब हम यह गणना करते हैं कि दो लोग एक-दूसरे से कितने "दूर" हैं, तो हम आमतौर पर हर गुण के अंतर को जोड़ देते हैं।
- समस्या: यदि आप ऊंचाई को मीटर में मापते हैं, तो अंतर 0.5 हो सकता है। यदि आप इसे मिलीमीटर में मापते हैं, तो अंतर 500 हो सकता है। यदि किसी नौकरी के पद के 50 विकल्प हैं, तो शीर्षकों के बीच का "दूरी" रंगों के केवल 3 विकल्पों की तुलना में बहुत बड़ी हो सकती है।
- पक्षपात: शोध पत्र दिखाता है कि मानक तरीके (जैसे प्रसिद्ध "गोअर डिस्टेंस") अनजाने में श्रेणीगत चरों (जैसे नौकरी के पद या रंग) के वॉल्यूम को बढ़ा देते हैं और संख्यात्मक चरों (जैसे ऊंचाई या वेतन) के वॉल्यूम को कम कर देते हैं। यह एक फुसफुसाहट की तुलना शोर से करने जैसा है, सिर्फ इसलिए क्योंकि माइक्रोफ़ोन की सेटिंग्स अलग हैं। परिणाम अंतर का वास्तविक माप नहीं है; यह इस बात का माप है कि डेटा को कैसे फॉर्मेट किया गया था।
2. निष्पक्ष मिश्रण के लिए दो नियम
इसे ठीक करने के लिए, लेखक एक "निष्पक्ष" दूरी कैलकुलेटर के लिए दो नियम प्रस्तावित करते हैं:
नियम #1: योज्यता (Additivity - हिस्सों का योग)
कल्पना कीजिए कि आप ब्लॉकों से एक टावर बना रहे हैं। टावर की कुल ऊंचाई व्यक्तिगत ब्लॉकों की ऊंचाइयों का योग होनी चाहिए। शोध पत्र इस बात पर जोर देता है कि दो लोगों के बीच कुल "दूरी" प्रत्येक विशिष्ट गुण के अंतर का योग होनी चाहिए। कोई फैंसी वर्गमूल (square roots) या छिपी हुई गणितीय प्रक्रिया नहीं जो यह बदले कि प्रत्येक ब्लॉक कितनी गिनती रखता है।नियम #2: तुलनीयता (Commensurability - "सेब-से-सेप्पल" वाला नियम)
"तुलनीय" का अर्थ है "उसी पैमाने पर मापने योग्य"।उपमा: कल्पना कीजिए कि आप एक बिल का भुगतान कर रहे हैं। आपके पास सिक्कों का एक ढेर है और डॉलर के नोटों का एक ढेर है। यदि आप डॉलर में बदलने के बिना केवल सिक्कों और नोटों की संख्या गिनते हैं, तो सिक्के डॉलर की तुलना में बहुत अधिक महत्वपूर्ण लगेंगे।
समाधान: आपको सब कुछ एक मानक इकाई (जैसे "औसत अंतर") में बदलने की आवश्यकता है। शोध पत्र मांग करता है कि, औसतन, प्रत्येक चर (चाहे वह संख्या हो या श्रेणी) कुल दूरी में बराबर मात्रा का योगदान दे। यदि किसी नौकरी के पद के 50 विकल्प हैं, तो हमें केवल "अलग = 1" नहीं गिनना चाहिए। हमें गणित को समायोजित करने की आवश्यकता है ताकि उस नौकरी के पद का "भार" (weight) ऊंचाई के अंतर के भार के बराबर हो जाए।
3. समाधान: "फेयरनेस वेट" (Fairness Weight)
लेखक इसे ठीक करने के लिए एक सामान्य सूत्र प्रदान करते हैं। इसे एक स्मार्ट स्केल के रूप में समझें।
- यह कैसे काम करता है: अंतर जोड़ने से पहले, स्केल हर चर को देखता है। वह पूछता है: "औसतन, यह चर आमतौर पर कितना बदलता है?"
- समायोजन: यदि कोई चर बहुत अधिक बदलता है (जैसे 50 विकल्पों वाला नौकरी का पद), तो स्केल उस पर बहुत कम वजन (tiny weight) डालता है। यदि कोई चर बहुत कम बदलता है (जैसे केवल 3 विकल्पों वाला रंग), तो स्केल उस पर भारी वजन (heavy weight) डालता है।
- परिणाम: जब आप अंत में उन सबको जोड़ते हैं, तो प्रत्येक चर को समान अवसर मिलता है। दूरी अब "पक्षपात रहित" है। इससे कोई फर्क नहीं पड़ता कि डेटा एक संख्या है या एक शब्द; गणित यह सुनिश्चित करता है कि वे समान रूप से योगदान दें।
4. सिद्धांत का परीक्षण
लेखकों ने केवल एक सिद्धांत नहीं लिखा; उन्होंने इसका परीक्षण भी किया।
- सिमुलेशन (Simulation): उन्होंने एक छिपे हुए "वास्तविक पैटर्न" (जैसे एक गुप्त आकार) के साथ नकली डेटा बनाया। फिर उन्होंने विभिन्न दूरी विधियों का उपयोग करके उस आकार को खोजने की कोशिश की।
- पुराने, पक्षपाती तरीकों ने आकार को गलत बताया क्योंकि वे श्रेणीगत चरों (नौकरी के पदों) से बहुत अधिक विचलित थे।
- उनके नए "पक्षपात रहित" तरीकों ने गुप्त आकार को बहुत अधिक सटीकता से पाया क्योंकि उन्होंने सभी चरों के साथ निष्पक्ष व्यवहार किया।
- वास्तविक दुनिया का परीक्षण: उन्होंने फीफा (FIFA) सॉकर खिलाड़ियों (2021) के डेटा का उपयोग किया। उन्होंने ऊंचाई, वजन और स्थिति जैसी चीजों को देखा। उन्होंने दिखाया कि मानक तरीकों ने "स्थिति" (position) चर को परिणामों पर हावी कर दिया, जबकि उनके नए तरीके ने स्थिति को ऊंचाई और वजन जैसे शारीरिक आंकड़ों के प्रभाव के साथ संतुलित किया।
मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि जब हम संख्याओं और श्रेणियों को मिलाते हैं, तो हम अक्सर अनजाने में डेटा के प्रकार को परिणामों को निर्धारित करने देते हैं, न कि वास्तविक डेटा को।
उनका समाधान एक नया तरीका है जो दूरी की गणना करता है जो एक लेवलिंग फील्ड (leveling field) की तरह कार्य करता है। यह सुनिश्चित करता है कि चाहे आप किसी व्यक्ति के वेतन की तुलना कर रहे हों या उसके पसंदीदा खेल की, कोई भी चीज़ केवल इसलिए हावी न हो जाए क्योंकि उसे कैसे मापा गया है। यह शोधकर्ताओं को डेटा को समूहित करने या उसका दृश्य (visualize) करने के लिए एक बहुत अधिक ईमानदार शुरुआती बिंदु देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।