← नवीनतम पेपर
📊 statistics

Conformal Selective Prediction with General Risk Control

यह शोध पत्र 'सेलेक्टिव कॉन्फॉर्मल रिस्क कंट्रोल विद ई-वैल्यूज़' (SCoRE) को प्रस्तुत करता है, जो एक नवीन ढांचा है जो किसी भी प्रशिक्षित मॉडल और उपयोगकर्ता-निर्धारित जोखिम मीट्रिक के लिए चयनात्मक भविष्यवाणी (selective prediction) हेतु परिमित-नमूना (finite-sample), वितरण-मुक्त (distribution-free) त्रुटि नियंत्रण प्रदान करने के लिए ई-वैल्यूज़ और परिकल्पना परीक्षण का लाभ उठाता है।

मूल लेखक: Tian Bai, Ying Jin

प्रकाशित 2026-03-27
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tian Bai, Ying Jin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान लेकिन कभी-कभी अति-आत्मविश्वासी मित्र है जिसे सलाह देना पसंद है। कभी-कभी उनकी सलाह एकदम सटीक होती है और आपके घंटों का काम बचा लेती है। अन्य समय में, वे केवल अनुमान लगा रहे होते हैं, और उनकी सलाह मानना आपको आर्थिक नुकसान पहुँचा सकता है या आपको मुसीबत में डाल सकता है।

बड़ा सवाल यह है: आप कैसे जानें कि कब उनकी बात सुननी है और कब कहना है, "नहीं, मैं इसे खुद समझ लूँगा/लूँगी"?

यह शोध पत्र SCoRE (Selective Conformal Risk control with E-values) नामक एक नई प्रणाली पेश करता है जो ठीक इसी समस्या को हल करती है। यह आर्टिफिशियल इंटेलिजेंस (AI) के लिए एक "ट्रस्ट फ़िल्टर" (विश्वास फ़िल्टर) की तरह है जो तब भी काम करता है जब AI एक "ब्लैक बॉक्स" हो (हमें नहीं पता कि वह कैसे सोचता है) और जोखिम जटिल हों (केवल "सही" या "गलत" नहीं, बल्कि "थोड़ा महंगा" या "बहुत खतरनाक")।

SCoRE कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. समस्या: "अनुमान लगाने का खेल"

अतीत में, यदि कोई AI मॉडल अनिश्चित होता था, तो वह शायद उत्तर देने से मना कर देता था। लेकिन यह बहुत सरल है।

  • परिदृश्य A (ड्रग डिस्कवरी/दवा की खोज): एक AI एक नई दवा का सुझाव देता है। यदि यह सही है, तो हम लाखों बचाते हैं। यदि यह गलत है, तो हम लैब परीक्षणों पर पैसा बर्बाद करते हैं। यहाँ "जोखिम" बर्बाद हुए पैसे की लागत है।
  • परिदृश्य B (अस्पताल की देखभाल): एक AI भविष्यवाणी करता है कि मरीज आईसीयू (ICU) में कितने दिन रहेगा। यदि यह गलत है, तो अस्पताल बेड बुक करने या स्टाफ तैनात करने में गलती कर सकता है। यहाँ "जोखिम" स्क्वेयर्ड एरर (squared error) है (भविष्यवाणी कितनी दूर तक गलत थी)।

चुनौती यह है कि ये जोखिम केवल "हाँ/ना" नहीं हैं। ये निरंतर संख्याएँ (डॉलर, दिन, त्रुटियाँ) हैं। हमें एक तरीका चाहिए जिससे हम कह सकें, "मैं इस विशिष्ट मामले में AI पर भरोसा करूँगा, लेकिन केवल तभी जब मैं यह गारंटी दे सकूँ कि मेरी गलतियों की औसत लागत एक निश्चित सीमा से नीचे रहेगी।"

2. समाधान: "E-Value" टिकट

लेखक एक चतुर सांख्यिकीय उपकरण का उपयोग करते हैं जिसे E-value कहा जाता है। एक E-value को ऐसे समझें जैसे कि AI के पास "ट्रस्टेड ज़ोन" (विश्वसनीय क्षेत्र) में प्रवेश करने के लिए खरीदने वाला एक टिकट हो।

  • नियम: टिकट पाने के लिए, AI को यह साबित करना होगा कि गलत होने की "कीमत" (जोखिम) पर्याप्त रूप से कम है।
  • गणितीय जादू: यह शोध पत्र एक विशेष फॉर्मूला बनाता है जो इस टिकट की कीमत की गणना उस पिछले डेटा के आधार पर करता है जिसे AI पहले ही देख चुका है (कैलिब्रेशन डेटा)।
  • गारंटी: यदि AI की टिकट की कीमत पर्याप्त रूप से अधिक है, तो हम गणितीय निश्चितता के साथ जान सकते हैं कि भले ही हम गलत हों, हमारी गलतियों की औसत लागत हमारे बजट से अधिक नहीं होगी।

यह एक कैसीनो की तरह है। कैसीनो (AI) चाहता है कि आप खेलें। E-value घर का तरीका है यह कहने का, "हमने संभावनाओं की जाँच कर ली है, और यदि आप केवल तभी खेलते हैं जब संभावनाएँ आपके पक्ष में हों, तो हम गारंटी देते हैं कि हम औसतन $100 से अधिक नहीं हारेंगे।"

3. "सुरक्षा" मापने के दो तरीके

यह शोध पत्र आपके लक्ष्य के आधार पर सुरक्षा बजट निर्धारित करने के दो अलग-अलग तरीके पेश करता है:

MDR (Marginal Deployment Risk): "कुल बजट" दृष्टिकोण

  • उपमा: कल्पना कीजिए कि आपके पास पूरे दिन के लिए $1,000 का वॉलेट है।
  • लक्ष्य: आप जितनी चाहें उतनी गलतियाँ कर सकते हैं, जब तक कि दिन के अंत तक आपके द्वारा खर्च किया गया कुल पैसा $1,000 से अधिक न हो जाए।
  • सर्वश्रेष्ठ उपयोग: ऐसी स्थितियों के लिए जहाँ आपके पास एक निश्चित बजट है और आपको कुछ बड़ी गलतियों से फर्क नहीं पड़ता, जब तक कि कुल नुकसान नियंत्रित रहे। (जैसे, "हमारे पास ड्रग ट्रायल्स के लिए $1M हैं; हम उससे अधिक खर्च नहीं कर सकते।")

SDR (Selective Deployment Risk): "औसत लागत" दृष्टिकोण

  • उपमा: कल्पना कीजिए कि आप एक गुणवत्ता नियंत्रण निरीक्षक (Quality Control Inspector) हैं। आप जितने चाहें उतने खराब उत्पादों को खारिज कर सकते हैं, लेकिन जिन उत्पादों को आप वास्तव में भेजते हैं, उनमें दोषों की औसर बहुत कम होनी चाहिए।
  • लक्ष्य: आप यह सुनिश्चित करना चाहते हैं कि हर बार जब आप AI पर भरोसा करते हैं, तो जोखिम कम हो। आप अपने विश्वसनीय निर्णयों की औसत गुणवत्ता की परवाह करते हैं।
  • सर्वश्रेष्ठ उपयोग: ऐसी स्थितियों के लिए जहाँ आप किसी भी बुरे परिणाम को निकलने देने का जोखिम नहीं उठा सकते, या जहाँ लागत निर्णयों की संख्या के साथ बढ़ती है। (जैसे, "जब भी हम मेडिकल रिपोर्ट जारी करते हैं, तो वह अत्यधिक सटीक होनी चाहिए।")

4. वास्तविक जीवन में यह कैसे काम करता है (उदाहरण)

शोध पत्र ने तीन वास्तविक दुनिया के परिदृश्यों में SCoRE का परीक्षण किया:

  1. नई दवाओं की खोज:

    • AI: भविष्यवाणी करता है कि एक रसायन वायरस से जुड़ेगा या नहीं।
    • जोखिम: यदि AI गलत है, तो हम लैब परीक्षणों पर पैसा बर्बाद करते हैं।
    • SCoRE का काम: यह उन रसायनों को फ़िल्टर करता है जो आशाजनक दिखते हैं लेकिन जिनमें महंगे विफल होने की उच्च संभावना होती है। यह सुनिश्चित करता है कि वास्तव में परीक्षण किए जाने वाले रसायनों की औसत लागत कम रहे।
  2. अस्पताल ICU भविष्यवाणियाँ:

    • AI: भविष्यवाणी करता है कि मरीज कितने दिन ICU में रहेगा।
    • जोखिम: यदि भविष्यवाणी 5 दिनों से अधिक गलत है, तो अस्पताल की योजना गड़बड़ा सकती है।
    • SCoRE का काम: यह AI की भविष्यवाणी पर केवल तभी भरोसा करता है जब वह बहुत आश्वस्त हो। यदि AI अनिश्चित है, तो SCoRE कहता है "नहीं," और एक मानव डॉक्टर कार्यभार संभाल लेता है। यह अस्पताल नियोजन में कुल त्रुटि को कम रखता है।
  3. AI रेडियोलॉजी रिपोर्ट:

    • AI: एक्स-रे के बारे में एक रिपोर्ट लिखता है।
    • जोखिम: यदि AI ट्यूमर को मिस कर देता है या फर्जी ट्यूमर बना देता है, तो यह खतरनाक है।
    • SCoRE का काम: यह AI की रिपोर्ट की जांच एक "कॉन्फिडेंस स्कोर" के विरुद्ध करता है। यदि AI आश्वस्त है और अर्थ संबंधी त्रुटि (semantic error) का जोखिम कम है, तो यह रिपोर्ट को डॉक्टर के पास जाने देता है। यदि नहीं, तो यह मानव समीक्षा के लिए फ्लैग करता है।

5. यह एक बड़ी बात क्यों है

इस शोध पत्र से पहले, अधिकांश AI सुरक्षा उपकरण एक बाइनरी लाइट स्विच की तरह थे: "सुरक्षित" या "असुरक्षित।" वे इस सूक्ष्मता को नहीं समझ सकते थे कि "यह जोखिम भरा है, लेकिन शायद तभी सार्थक है जब इनाम अधिक हो।"

SCoRE एक डिमर स्विच (dimmer switch) की तरह है। यह हमें अनुमति देता है:

  • लचीला होना: हम बहुत सख्त (कम जोखिम) या थोड़े उदार (उच्च जोखिम, उच्च इनाम) हो सकते हैं।
  • मजबूत होना: यह तब भी काम करता है जब डेटा बदल जाता है (जैसे, AI उन मरीजों को देखता है जो उसके प्रशिक्षण वाले शहर से अलग हैं)।
  • कुशल होना: यह केवल सब कुछ के लिए "ना" नहीं कहता है। यह वह "स्वीट स्पॉट" (सही बिंदु) ढूंढता है जहाँ हम समय और पैसा बचाने के लिए AI पर पर्याप्त भरोसा कर सकें, बिना बजट बिगाड़े।

सारांश

SCoRE एक स्मार्ट गेटकीपर (द्वारपाल) है। यह केवल यह नहीं पूछता है, "क्या AI सही है?" बल्कि यह पूछता है, "क्या AI पर्याप्त रूप से सही है, देखते हुए कि गलत होने की लागत क्या है?" E-values का उपयोग करके विशेष गणितीय टिकट प्रणाली के माध्यम से, यह गारंटी देता है कि यदि हम इसकी सलाह का पालन करते हैं, तो हम अपनी योजना से अधिक खर्च नहीं करेंगे। यह AI को एक लापरवाह जुआरी से एक अनुशासित साथी में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →