← नवीनतम पेपर
🤖 machine learning

The Costs of Pretending That There Are Data-Generating Probability Distributions in the Social World

यह शोध पत्र यह तर्क देता है कि सामाजिक जगत में वास्तविक डेटा-जनरेटिंग संभाव्यता वितरण (probability distributions) की धारणा एक हानिकारक कल्पना है जो मशीन लर्निंग में महत्वपूर्ण विकल्पों और लक्ष्यों को अस्पष्ट करती है, और इसके बजाय प्रासंगिक आबादी पर केंद्रित एक ऐसे ढांचे का प्रस्ताव देता है जो शास्त्रीय शिक्षण सिद्धांत को संरक्षित करते हुए इन भ्रामक अमूर्तताओं से बचता है।

मूल लेखक: Benedikt Höltgen, Robert C. Williamson

प्रकाशित 2026-04-23
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Benedikt Höltgen, Robert C. Williamson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक शोध पत्र "The Costs of Pretending That There Are Data-Generating Probability Distributions in the Social World" का सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

मुख्य विचार: "जादुई पासे" का मिथक

कल्पना कीजिए कि आप एक पासे (die) के साथ एक खेल खेल रहे हैं। यदि आप इसे हज़ार बार फेंकते हैं, तो आप उच्च विश्वास के साथ अनुमान लगा सकते हैं कि लगभग 16% बार "6" आएगा। जुए या भौतिकी की दुनिया में, हम मानते हैं कि एक सच्चा, छिपा हुआ नियम (प्रोबेबिलिटी डिस्ट्रीब्यूशन) है जो उस पासे को नियंत्रित करता है। पासा आपकी परवाह नहीं करता; वह बस भौतिकी के नियमों का पालन करता है।

मशीन लर्निंग (ML) शोधकर्ता अक्सर लोगों के साथ वैसा ही व्यवहार करते हैं जैसा उस पासे के साथ किया जाता है।

वे यह मानते हैं कि यदि वे लोगों के बारे में पर्याप्त डेटा (उनकी आय, आयु, स्थान) एकत्र कर लें, तो एक छिपा हुआ, पूर्ण "नियम पुस्तिका" या "मानचित्र" होगा जो ठीक से बताता है कि वे लोग कैसे व्यवहार करेंगे। उनका मानना है कि उनका काम इस मानचित्र को खोजना है, जिसे वे डेटा-जेनरेटिंग डिस्ट्रीब्यूशन कहते हैं। वे सोचते हैं, "यदि हमें पर्याप्त डेटा मिल जाए, तो हम इस सत्य को खोज लेंगे कि किसी विशिष्ट व्यक्ति द्वारा अपराध करने या ऋण चुकाने में विफल होने की वास्तविक संभावना क्या है।"

इस शोध पत्र के लेखक कहते हैं: "दिखावा करना बंद करें।"

उनका तर्क है कि सामाजिक दुनिया (इंसानों से निपटने वाली दुनिया) में, ऐसी कोई छिपी हुई नियम पुस्तिका नहीं होती है। इंसान पासे नहीं हैं। हम जटिल हैं, बदलते रहते हैं, और अपने परिवेश से प्रभावित होते हैं। यह मानना कि एक पूर्ण, पूर्व-मौजूद प्रोबेबिलिटी मैप मौजूद है, न केवल गलत है, बल्कि खतरनाक भी है क्योंकि यह इस तथ्य को छिपा देता है कि ये मॉडल बनाने वाले लोग बहुत बड़े, व्यक्तिपरक (subjective) निर्णय ले रहे हैं।


उपमा 1: "रेसिपी" बनाम "सामग्री की सूची"

पुराना तरीका (Gen-D फ्रेमवर्क):
कल्पना कीजिए कि आप भविष्यवाणी करने की कोशिश कर रहे हैं कि एक केक का स्वाद कैसा होगा। सोचने का पुराना तरीका कहता है, "ब्रह्मांड में 'केक' के लिए एक आदर्श, जादुई रेसिपी मौजूद है। हमारा काम पर्याप्त केक चखना है ताकि हम उस सटीक रेसिपी का पता लगा सकें। एक बार जब हमें वह मिल जाती है, तो हम हर बार एक आदर्श केक बना सकते हैं।"

नया तरीका (लेखकों का दृष्टिकोण):
लेखक कहते हैं, "कोई जादुई रेसिपी नहीं है। यहाँ केवल वे विशिष्ट सामग्रियाँ हैं जो आपके पास अभी हैं और वह विशिष्ट ओवन है जिसका आप उपयोग कर रहे हैं।"

  • यदि आप आटे का ब्रांड बदलते हैं, तो केक बदल जाता है।
  • यदि आप ओवन का तापमान बदलते हैं, तो केक बदल जाता है।
  • यदि आप बेकर (बनाने वाला) बदलते हैं, तो केक बदल जाता है।

मशीन लर्निंग में, "सामग्रियाँ" वह डेटा है जिसे हम एकत्र करने का चुनाव करते हैं। "बेकर" वह व्यक्ति है जो मॉडल डिजाइन करता है। "रेसिपी" कोई छिपा हुआ सत्य नहीं है जिसे खोजा जाना बाकी है; यह उन लोगों द्वारा निर्मित (constructed) की जाती है जो मॉडल बना रहे हैं।

उपमा 2: "मौसम का पूर्वानुमान" बनाम "मानवीय मनोदशा"

मौसम (जहाँ पुराना विचार काम करता है):
यदि आप जानना चाहते हैं कि कल बारिश होगी या नहीं, तो आप वायुमंडलीय दबाव को देखते हैं। वायुमंडल आपकी भावनाओं की परवाह नहीं करता। यह भौतिक नियमों का पालन करता है। आप कह सकते हैं, "बारिश की 70% संभावना है," और वह संख्या एक स्थिर भौतिक वास्तविकता पर आधारित है।

मानवीय मनोदशा (जहाँ पुराना विचार विफल होता है):
अब, कल्पना कीजिए कि आप यह अनुमान लगाने की कोशिश कर रहे हैं कि कोई विशिष्ट व्यक्ति कल खुश रहेगा या नहीं।

  • यदि आप आज उनसे पूछते हैं, तो वे "हाँ" कह सकते हैं।
  • यदि आप काम पर एक बुरे दिन के बाद उनसे पूछते हैं, तो वे "नहीं" कह सकते हैं।
  • यदि आप पदोन्नति के बाद उनसे पूछते हैं, तो वे "हाँ" कह सकते हैं।

उस व्यक्ति के लिए कोई एक "खुशी की सच्ची संभावना" (True Probability of Happiness) नहीं है। संदर्भ, समय और आपके द्वारा पूछे गए प्रश्नों के आधार पर यह संख्या बदल जाती है।

शोध पत्र का तर्क है कि जब हम मानव व्यवहार (जैसे कि किसे नौकरी मिलेगी या कौन फिर से अपराध कर सकता है) की भविष्यवाणी करने के लिए AI का उपयोग करते हैं, तो हम मौसम की नहीं, बल्कि एक मनोदशा (mood) की भविष्यवाणी करने की कोशिश कर रहे होते हैं। लेकिन हम मौसम के लिए डिज़ाइन किए गए गणित का उपयोग कर रहे हैं। इससे हमें यह विश्वास होने लगता है कि हमारी भविष्यवाणियाँ "वस्तुनिष्ठ तथ्य" हैं, जबकि वे वास्तव में डेटा के एक विशिष्ट, मनमाने स्नैपशॉट पर आधारित अनुमान मात्र हैं।


दिखावा करना क्यों महत्वपूर्ण है? ("लागतें")

लेखक कहते हैं कि यह दावा करना कि ये "पूर्ण मानचित्र" मौजूद हैं, तीन बड़ी समस्याएँ पैदा करता है:

1. यह हमारे द्वारा किए गए विकल्पों को छिपा देता है

जब हम कहते हैं, "मॉडल ने वास्तविक संभावना ढूंढ ली," तो ऐसा लगता है जैसे कंप्यूटर ने सारा काम किया और हम बस देखते रहे।

  • वास्तविकता: कंप्यूटर ने कोई सत्य नहीं खोजा। इंजीनियरों ने चुना कि उन्हें इसमें कौन सा डेटा डालना है। उन्होंने चुना कि किन विशेषताओं (features) को देखना है (जैसे, "क्या हमें ज़िप कोड देखना चाहिए?")।
  • लागत: यह दावा करके कि मॉडल केवल एक सत्य को "खोज" रहा है, हम यह पूछना बंद कर देते हैं कि, "आपने इन विशिष्ट चरों (variables) को क्यों चुना?" यह खराब या पक्षपाती निर्णयों को छिपाने का एक जरिया बन जाता है।

2. यह वस्तुनिष्ठता का एक झूठा अहसास पैदा करता है

यदि आप एक न्यायाधीश को बताते हैं, "एल्गोरिदम कहता है कि इस व्यक्ति के दोबारा अपराध करने की 30% संभावना है," तो यह वैज्ञानिक और तटस्थ लगता है।

  • वास्तविकता: वह 30% कोई प्राकृतिक नियम नहीं है। यह एक विशिष्ट समूह के लोगों और एक विशिष्ट वर्ष के आधार पर गणना की गई संख्या है। यदि आप वर्ष या समूह को थोड़ा भी बदलते, तो यह संख्या 60% हो सकती थी या गिरकर 10% हो सकती थी।
  • लागत: लोग इस संख्या पर बहुत अधिक भरोसा करते हैं। वे सोचते हैं कि एल्गोरिदम "निष्पक्ष" है क्योंकि यह "गणित" है, लेकिन गणित एक अस्थिर आधार पर बना है।

3. यह "सामान्यीकरण" (Generalizing) और "अनुमान लगाने" (Guessing) के बीच भ्रम पैदा करता है

स्कूल में, हम सीखते हैं कि यदि हम एक नमूने (sample) में एक पैटर्न देखते हैं, तो हम इसे पूरी दुनिया पर लागू कर सकते हैं।

  • समस्या: सामाजिक दुनिया में, "पूरी दुनिया" लगातार बदल रही है। 2017 के डेटा पर प्रशिक्षित मॉडल 2024 में पूरी तरह से विफल हो सकता है क्योंकि समाज बदल गया है, न कि इसलिए कि मॉडल गणितीय रूप से "गलत" था।
  • लागत: हम ऐसे मॉडल बनाते रहते हैं जो बीते हुए कल की दुनिया के लिए काम करते हैं लेकिन आज की दुनिया में विफल हो जाते हैं, और हम डेटा में "शोर" (noise) को दोष देते हैं बजाय इसके कि यह समझें कि जिस "मानचित्र" का हम उपयोग कर रहे हैं वह पुराना हो चुका है।

समाधान: "भूत" (Ghost) को खोजना बंद करें

लेखक सुझाव देते हैं कि हमें "मशीन में छिपे भूत" (सच्चा वितरण) को खोजने की कोशिश बंद कर देनी चाहिए। इसके बजाय, हमें:

  1. यह स्वीकार करना चाहिए कि हम खोज नहीं रहे, बल्कि निर्माण कर रहे हैं: यह स्वीकार करें कि प्रत्येक मॉडल एक निर्माण है, जैसे ईंटों से बना एक घर।
  2. विशिष्ट जनसंख्या पर ध्यान केंद्रित करें: यह कहने के बजाय कि "यह मॉडल सभी के लिए काम करता है," कहें "यह मॉडल लोगों के इस विशिष्ट समूह के लिए इस विशिष्ट संदर्भ में काम करता है।"
  3. चयन के बारे में ईमानदार रहें: जब हम इन प्रणालियों का निर्माण करते हैं, तो हमें खुले तौर पर चर्चा करने की आवश्यकता है: "हमने इन चरों को देखने का चुनाव इसलिए किया क्योंकि..." बजाय इसके कि "डेटा ने स्वयं अपनी बात कही।"

निष्कर्ष

यह शोध पत्र एक चेतावनी है:
हम इंसानों के साथ पासे के फेंके जाने वाले नंबरों जैसा व्यवहार कर रहे हैं। हमें लगता है कि एक छिपा हुआ, पूर्ण नंबर है जो किसी व्यक्ति के भविष्य का वर्णन करता है। लेकिन ऐसा नहीं है। यहाँ केवल वह कहानी है जो हम उस डेटा के आधार पर उनके बारे में बताते हैं जिसे हमने एकत्र करने का चुनाव किया है।

यदि हम यह दिखाने का ढोंग करना जारी रखते हैं कि एक "सच्ची संभावना" (True Probability) मौजूद है, तो हम ऐसे सिस्टम बनाने का जोखिम उठाते हैं जो वस्तुनिष्ठ और निष्पक्ष महसूस होते हैं, लेकिन वास्तव में वे उन लोगों के पूर्वाग्रहों और निर्णयों को दर्शाते हैं जिन्होंने उन्हें बनाया है। हमें जादुई मानचित्र की तलाश करना बंद करना चाहिए और उस क्षेत्र (territory) के लिए जिम्मेदारी लेना शुरू करना चाहिए जिसे हम बना रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →