← नवीनतम पेपर
💰 quantitative finance

Discrimination-free Insurance Pricing with Privatized Sensitive Attributes

यह शोधपत्र एक विश्वसनीय तीसरे पक्ष द्वारा रखे गए निजीकृत संवेदनशील गुणों का उपयोग करके भेदभाव-मुक्त बीमा प्रीमियम का अनुमान लगाने के लिए सांख्यिकीय विधियों का प्रस्ताव करता है, जो ज्ञात और अज्ञात दोनों प्रकार के गोपनीयता तंत्रों के तहत निष्पक्ष मूल्य निर्धारण के लिए सैद्धांतिक गारंटी और अनुभवजन्य सत्यापन प्रदान करता है।

मूल लेखक: Tianhe Zhang, Suhan Liu, Peng Shi

प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianhe Zhang, Suhan Liu, Peng Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कार बीमा पॉलिसी के लिए कीमत तय करने की कोशिश कर रहे हैं। इसे निष्पक्ष और सटीक बनाने के लिए, आपको यह जानने की आवश्यकता है कि एक ड्राइवर कितना जोखिम लाता है। आमतौर पर, आप उनकी उम्र, ड्राइविंग इतिहास और उनके द्वारा चलाई जाने वाली कार के प्रकार जैसी चीजों को देखते हैं।

लेकिन, एक समस्या है: कई स्थानों पर, कानून कहता है कि आप कीमत तय करने के लिए कुछ व्यक्तिगत विवरणों का उपयोग नहीं कर सकते, जैसे कि किसी व्यक्ति का लिंग या जाति। यह भेदभाव को रोकने के लिए है। हालांकि, एक पेच है: भले ही आप लिंग के बारे में न पूछें, आपका कंप्यूटर मॉडल अन्य सुरागों (जैसे ज़िप कोड या खरीदारी की आदतें) को देखकर अभी भी इसका पता लगा सकता है जो लिंग से मजबूती से जुड़े हुए हैं। इसे "अप्रत्यक्ष भेदभाव" (indirect discrimination) कहा जाता है।

हाल ही में विशेषज्ञों ने एक गणितीय रेसिपी बनाई है जिसे "भेदभाव-मुक्त प्रीमियम" (Discrimination-Free Premium) कहा जाता है। यह रेसिपी लिंग को पूरी तरह से अनदेखा करने का प्रयास करती है, यह सुनिश्चित करती है कि समान ड्राइविंग आदतों वाले दो लोग, लिंग की परवाह किए बिना, समान भुगतान करें।

बड़ी समस्या:
इस "भेदभाव-मुक्त" रेसिपी का उपयोग करने के लिए, आपको गणित करने के लिए वास्तविक लिंग डेटा को देखने की आवश्यकता होती है। लेकिन, गोपनीयता कानूनों के कारण, बीमा कंपनियों को अक्सर वास्तविक लिंग डेटा देखने की अनुमति ही नहीं होती है। यह बिल्कुल वैसा ही है जैसे आप एक ऐसी रेसिपी का उपयोग करके केक बनाने की कोशिश कर रहे हों जिसमें अंडों की आवश्यकता है, लेकिन स्टोर आपको केवल "अंडे के स्वाद वाला पाउडर" बेचता है जो अंडों जैसा दिखता है लेकिन वास्तव में अंडे नहीं है।

इस पेपर का समाधान:
इस पेपर के लेखक (तियानहे झांग, सुहान लियू और पेंग शी) ने यह पता लगाया है कि केवल उस "पाउडर" का उपयोग करके केक कैसे बनाया जाए। उन्होंने एक नया तरीका विकसित किया जो तब भी काम करता है जब संवेदनशील जानकारी (जैसे लिंग) को गोपनीयता बनाए रखने के लिए "स्कैम्बल" या "शोर" (noise) के साथ मिला दिया गया हो।

उन्होंने इसे सरल उपमाओं का उपयोग करके समझाया है:

1. "विश्वस्त पड़ोसी" सेटअप (The "Trusted Neighbor" Setup)

कल्प_िए एक तीन-सदस्य टीम की:

  • बीमा कंपनी: उनके पास ग्राहक का ड्राइविंग डेटा (उम्र, कार का प्रकार) और क्लेम हिस्ट्री (कितना पैसा दिया गया) है। उनके पास लिंग का डेटा नहीं है।
  • विश्वस्त तीसरा पक्ष (TTP): एक तटस्थ, सुरक्षित तिजोरी जो स्कैम्बल किए गए लिंग डेटा को रखती है।
  • ग्राहक: वे अपना डेटा प्रदान करते हैं।

बीमा कंपनी अपना ड्राइविंग डेटा "विश्वस्त पड़ोसी" को भेजती है। पड़ोसी गणित करने के लिए ड्राइविंग डेटा को स्कैम्बल किए गए लिंग डेटा के साथ मिलाता है, और फिर बिना यह बताए कि वास्तव में कौन पुरुष है या महिला, अंतिम "निष्पक्ष कीमत" वापस भेज देता है।

2. "स्कैम्बल किया हुआ अंडा" (Privatized Data)

यह पेपर डेटा के दो परिदृश्यों से निपटता है कि डेटा कितना "स्कैम्बल" किया गया है:

  • परिदृश्य A: हमें स्कैम्बल की रेसिपी पता है।
    कल्पना कीजिए कि विश्वस्त पड़ोसी बीमा कंपनी को बताता है, "मैंने लिंग डेटा में ठीक 10% शोर (noise) जोड़ा है।" लेखक दिखाते हैं कि यदि आप जानते हैं कि डेटा को ठीक कैसे स्कैम्बल किया गया था, तो आप गणितीय रूप से पूर्वाग्रह को "अनस्कैम्बल" कर सकते हैं और सटीक निष्पक्ष कीमत की गणना कर सकते हैं। यह बिल्कुल वैसा ही है जैसे आपको पता हो कि सूप में ठीक कितना नमक डाला गया है, ताकि आप स्वाद ठीक करने के लिए कितना पानी डालना है, इसकी गणना कर सकें।

  • परिदृश्य B: हमें स्कैम्बल की रेसिपी नहीं पता।
    यह अधिक कठिन है। कल्पना कीजिए कि पड़ोसी कहता है, "मैंने इसे स्कैंबल्ड किया है, लेकिन मैं भूल गया कि मैंने इसमें कितना शोर जोड़ा था।" लेखकों ने डेटा में एक विशेष "एंकर पॉइंट" (डेटा का एक विशिष्ट प्रकार जहाँ हम 100% निश्चित हैं कि उनका लिंग क्या है) का उपयोग करके शोर के स्तर का अनुमान लगाने के लिए एक चतुर ट्रिक विकसित की है। एक बार जब वे शोर के स्तर का अनुमान लगा लेते हैं, तो वे अभी भी एक निष्पक्ष कीमत की गणना कर सकते हैं, हालांकि यह यदि उन्हें सटीक रेसिपी पता होती तो तुलनात्मक रूप से थोड़ी कम सटीक होगी।

3. "जादुई फिल्टर" (The "Magic Filter" - Transformed Data)

पेपर एक और शानदार ट्रिक भी पेश करता है। विश्वस्त पड़ोसी को डेटा भेजने से पहले, बीमा कंपनी ड्राइविंग डेटा को एक "जादुई फिल्टर" (एक न्यूरल नेटवर्क) के माध्यम से चलाती है। यह फिल्टर डेटा के उन हिस्सों को उजागर करना सीखता है जो वास्तव में जोखिम की भविष्यवाणी करते हैं (जैसे "धूम्रपान की स्थिति" या "आयु") और शोर को कम करता है।

  • परिणाम: भले ही लिंग का डेटा बहुत अधिक शोर वाला (बहुत अधिक स्कैम्बल किया गया) हो, ड्राइविंग डेटा पर इस "जादुई फिल्टर" का उपयोग करने से मॉडल सटीक बना रहता है। यह शोर रद्द करने वाले हेडफ़ोन (noise-canceling headphones) पहनने जैसा है; भले ही कमरे में शोर हो, आप संगीत को स्पष्ट रूप से सुन सकते हैं।

प्रयोगों ने क्या दिखाया

लेखकों ने कंप्यूटर सिमुलेशन चलाए और वास्तविक दुनिया के स्वास्थ्य और कार बीमा डेटा पर अपने तरीके का परीक्षण किया। उन्होंने पाया कि:

  • निष्पक्षता काम करती है: उनके तरीके ने प्रत्यक्ष और अप्रत्यक्ष दोनों प्रकार के भेदभाव को सफलतापूर्वक हटा दिया।
  • गोपनीयता सुरक्षित है: बीमा कंपनी को कभी भी वास्तविक लिंग डेटा देखने की आवश्यकता नहीं पड़ी।
  • शोर का महत्व: यदि गोपनीयता "शोर" (noise) बहुत अधिक है (बहुत अधिक स्कैम्बल किया गया है), तो कीमतें कम सटीक हो जाती हैं। हालांकि, उनका तरीका पुराने तरीकों की तुलना में इसे बेहतर ढंग से संभालता है।
  • कम आंकना जोखिम भरा है: यदि आप शोर के स्तर का अनुमान वास्तविक स्तर से कम लगाते हैं, तो आपकी कीमतें खराब हो जाती हैं। बेहतर यह है कि आप अपने अनुमान में थोड़ा "रूढ़िवादी" (conservative) रहें।

निष्कर्ष

यह पेपर बीमा कंपनियों के लिए एक व्यावहारिक टूलकिट प्रदान करता है। यह उन्हें निष्पक्ष कीमतें निर्धारित करने के लिए उन्नत AI का उपयोग करने की अनुमति देता है जो लिंग या जाति के आधार पर भेदभाव नहीं करती हैं, भले ही सख्त गोपनीयता कानून उन्हें वास्तविक लिंग डेटा देखने से रोकते हों। वे एक विश्वसनीय तीसरे पक्ष के साथ काम करके और "शोर" को ठीक करने के लिए सांख्यिकीय ट्रिक्स का उपयोग करके ऐसा कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →