← नवीनतम पेपर
📊 statistics

Unbiased mixed variables distance

यह शोध पत्र विभिन्न प्रकार के चरों और पैमानों के कारण मौजूदा मिश्रित चर दूरी मापों (mixed variable distance measures) में होने वाले पूर्वाग्रह को संबोधित करता है, जिसके लिए ऐसे प्रासंगिक अवधारणाओं को परिभाषित किया गया है जो इस पूर्वाग्रह को मापने में सक्षम हैं और निष्पक्ष दूरियों के निर्माण के लिए एक सामान्य सूत्र प्रस्तावित किया गया है जहाँ व्यक्तिगत चर का योगदान माप के प्रकारों या इकाइयों से स्वतंत्र होता है।

मूल लेखक: Michel van de Velden, Alfonso Iodice D'Enza, Angelos Markos, Carlo Cavicchia

प्रकाशित 2026-06-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michel van de Velden, Alfonso Iodice D'Enza, Angelos Markos, Carlo Cavicchia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह मापने की कोशिश कर रहे हैं कि दो लोग एक-दूसरे से कितने अलग हैं। आपके पास गुणों (traits) की एक सूची है: उनकी ऊंचाई (एक संख्या), उनका पसंदीदा रंग (एक श्रेणी), उनकी आयु (एक संख्या), और उनका नौकरी का पद (एक श्रेणी)।

डेटा साइंस की दुनिया में, इसे "मिक्स्ड वेरिएबल" (mixed variable) समस्या कहा जाता है। आप "अंतर" के एक एकल फलों के सलाद (fruit salad) में सेब (संख्याओं) और संतरों (श्रेणियों) को मिलाने की कोशिश कर रहे हैं।

वैन डी वेल्डन और उनके सहयोगियों का शोध पत्र तर्क देता है कि इस सलाद को बनाने के मानक तरीके पक्षपाती (biased) हैं। वे इस तरह से संतरों का स्वाद बहुत अधिक तेज़ या सेबों का स्वाद बहुत कम कर देते हैं, जो केवल इस बात पर निर्भर करता है कि सामग्री को कैसे मापा गया है, न कि इस पर कि कौन सा गुण वास्तव में अधिक महत्वपूर्ण है।

यहाँ उनके तर्क और समाधान का एक सरल विवरण दिया गया है:

1. समस्या: "वॉल्यूम नॉब" खराब है

जब हम यह गणना करते हैं कि दो लोग एक-दूसरे से कितने "दूर" हैं, तो हम आमतौर पर हर गुण के अंतर को जोड़ देते हैं।

  • समस्या: यदि आप ऊंचाई को मीटर में मापते हैं, तो अंतर 0.5 हो सकता है। यदि आप इसे मिलीमीटर में मापते हैं, तो अंतर 500 हो सकता है। यदि किसी नौकरी के पद के 50 विकल्प हैं, तो शीर्षकों के बीच का "दूरी" रंगों के केवल 3 विकल्पों की तुलना में बहुत बड़ी हो सकती है।
  • पक्षपात: शोध पत्र दिखाता है कि मानक तरीके (जैसे प्रसिद्ध "गोअर डिस्टेंस") अनजाने में श्रेणीगत चरों (जैसे नौकरी के पद या रंग) के वॉल्यूम को बढ़ा देते हैं और संख्यात्मक चरों (जैसे ऊंचाई या वेतन) के वॉल्यूम को कम कर देते हैं। यह एक फुसफुसाहट की तुलना शोर से करने जैसा है, सिर्फ इसलिए क्योंकि माइक्रोफ़ोन की सेटिंग्स अलग हैं। परिणाम अंतर का वास्तविक माप नहीं है; यह इस बात का माप है कि डेटा को कैसे फॉर्मेट किया गया था।

2. निष्पक्ष मिश्रण के लिए दो नियम

इसे ठीक करने के लिए, लेखक एक "निष्पक्ष" दूरी कैलकुलेटर के लिए दो नियम प्रस्तावित करते हैं:

  • नियम #1: योज्यता (Additivity - हिस्सों का योग)
    कल्पना कीजिए कि आप ब्लॉकों से एक टावर बना रहे हैं। टावर की कुल ऊंचाई व्यक्तिगत ब्लॉकों की ऊंचाइयों का योग होनी चाहिए। शोध पत्र इस बात पर जोर देता है कि दो लोगों के बीच कुल "दूरी" प्रत्येक विशिष्ट गुण के अंतर का योग होनी चाहिए। कोई फैंसी वर्गमूल (square roots) या छिपी हुई गणितीय प्रक्रिया नहीं जो यह बदले कि प्रत्येक ब्लॉक कितनी गिनती रखता है।

  • नियम #2: तुलनीयता (Commensurability - "सेब-से-सेप्पल" वाला नियम)
    "तुलनीय" का अर्थ है "उसी पैमाने पर मापने योग्य"।

  • उपमा: कल्पना कीजिए कि आप एक बिल का भुगतान कर रहे हैं। आपके पास सिक्कों का एक ढेर है और डॉलर के नोटों का एक ढेर है। यदि आप डॉलर में बदलने के बिना केवल सिक्कों और नोटों की संख्या गिनते हैं, तो सिक्के डॉलर की तुलना में बहुत अधिक महत्वपूर्ण लगेंगे।

  • समाधान: आपको सब कुछ एक मानक इकाई (जैसे "औसत अंतर") में बदलने की आवश्यकता है। शोध पत्र मांग करता है कि, औसतन, प्रत्येक चर (चाहे वह संख्या हो या श्रेणी) कुल दूरी में बराबर मात्रा का योगदान दे। यदि किसी नौकरी के पद के 50 विकल्प हैं, तो हमें केवल "अलग = 1" नहीं गिनना चाहिए। हमें गणित को समायोजित करने की आवश्यकता है ताकि उस नौकरी के पद का "भार" (weight) ऊंचाई के अंतर के भार के बराबर हो जाए।

3. समाधान: "फेयरनेस वेट" (Fairness Weight)

लेखक इसे ठीक करने के लिए एक सामान्य सूत्र प्रदान करते हैं। इसे एक स्मार्ट स्केल के रूप में समझें।

  • यह कैसे काम करता है: अंतर जोड़ने से पहले, स्केल हर चर को देखता है। वह पूछता है: "औसतन, यह चर आमतौर पर कितना बदलता है?"
  • समायोजन: यदि कोई चर बहुत अधिक बदलता है (जैसे 50 विकल्पों वाला नौकरी का पद), तो स्केल उस पर बहुत कम वजन (tiny weight) डालता है। यदि कोई चर बहुत कम बदलता है (जैसे केवल 3 विकल्पों वाला रंग), तो स्केल उस पर भारी वजन (heavy weight) डालता है।
  • परिणाम: जब आप अंत में उन सबको जोड़ते हैं, तो प्रत्येक चर को समान अवसर मिलता है। दूरी अब "पक्षपात रहित" है। इससे कोई फर्क नहीं पड़ता कि डेटा एक संख्या है या एक शब्द; गणित यह सुनिश्चित करता है कि वे समान रूप से योगदान दें।

4. सिद्धांत का परीक्षण

लेखकों ने केवल एक सिद्धांत नहीं लिखा; उन्होंने इसका परीक्षण भी किया।

  • सिमुलेशन (Simulation): उन्होंने एक छिपे हुए "वास्तविक पैटर्न" (जैसे एक गुप्त आकार) के साथ नकली डेटा बनाया। फिर उन्होंने विभिन्न दूरी विधियों का उपयोग करके उस आकार को खोजने की कोशिश की।
    • पुराने, पक्षपाती तरीकों ने आकार को गलत बताया क्योंकि वे श्रेणीगत चरों (नौकरी के पदों) से बहुत अधिक विचलित थे।
    • उनके नए "पक्षपात रहित" तरीकों ने गुप्त आकार को बहुत अधिक सटीकता से पाया क्योंकि उन्होंने सभी चरों के साथ निष्पक्ष व्यवहार किया।
  • वास्तविक दुनिया का परीक्षण: उन्होंने फीफा (FIFA) सॉकर खिलाड़ियों (2021) के डेटा का उपयोग किया। उन्होंने ऊंचाई, वजन और स्थिति जैसी चीजों को देखा। उन्होंने दिखाया कि मानक तरीकों ने "स्थिति" (position) चर को परिणामों पर हावी कर दिया, जबकि उनके नए तरीके ने स्थिति को ऊंचाई और वजन जैसे शारीरिक आंकड़ों के प्रभाव के साथ संतुलित किया।

मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि जब हम संख्याओं और श्रेणियों को मिलाते हैं, तो हम अक्सर अनजाने में डेटा के प्रकार को परिणामों को निर्धारित करने देते हैं, न कि वास्तविक डेटा को।

उनका समाधान एक नया तरीका है जो दूरी की गणना करता है जो एक लेवलिंग फील्ड (leveling field) की तरह कार्य करता है। यह सुनिश्चित करता है कि चाहे आप किसी व्यक्ति के वेतन की तुलना कर रहे हों या उसके पसंदीदा खेल की, कोई भी चीज़ केवल इसलिए हावी न हो जाए क्योंकि उसे कैसे मापा गया है। यह शोधकर्ताओं को डेटा को समूहित करने या उसका दृश्य (visualize) करने के लिए एक बहुत अधिक ईमानदार शुरुआती बिंदु देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →