← नवीनतम पेपर
💬 NLP

SHARP: Social Harm Analysis via Risk Profiles for Measuring Inequities in Large Language Models

यह शोध पत्र SHARP को प्रस्तुत करता है, जो एक बहुआयामी और वितरण-जागरूक (distribution-aware) मूल्यांकन ढांचा है जो जोखिम प्रोफाइल और CVaR जैसे टेल-सेंसिटिव (tail-sensitive) मेट्रिक्स का उपयोग करके बड़े भाषा मॉडल (large language models) में सामाजिक नुकसान को मापने के लिए स्केलर औसत से आगे बढ़ता है, जिससे महत्वपूर्ण छिपी हुई असमानताओं और उन चरम विफलताओं (worst-case failures) का खुलासा होता है जिन्हें पारंपरिक बेंचमार्क अस्पष्ट कर देते हैं।

मूल लेखक: Alok Abhishek, Tushar Bandopadhyay, Lisa Erickson

प्रकाशित 2026-01-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alok Abhishek, Tushar Bandopadhyay, Lisa Erickson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ पेपर SHARP: Social Harm Analysis via Risk Profiles for Measuring Inequities in Large Language Models का सरल भाषा और रचनात्मक उपमाओं के साथ विवरण दिया गया है।

मूल समस्या: क्यों "औसत" स्कोर झूठ बोलते हैं

कल्पना कीजिए कि आप एक कार खरीद रहे हैं। सेल्सपर्सन आपसे कहता है, "इस कार की औसत गति 60 मील प्रति घंटा है।" यह सुनने में अच्छा लगता है, है ना?

लेकिन क्या होगा अगर वह "औसत" एक रहस्य छिपा रहा हो? क्या होगा अगर कार आमतौर पर 10 मील प्रति घंटे की गति से चलती है, लेकिन कभी-कभार, बिना किसी कारण के, अचानक 200 मील प्रति घंटे की गति पकड़ लेती है और दुर्घटनाग्रस्त हो जाती है? औसत अभी भी 60 ही रहेगा, लेकिन सबसे खराब स्थिति (worst-case scenario) भयानक होती है।

यह ठीक वही है जो यह पेपर कहता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) के साथ हो रहा है। वर्तमान परीक्षण मुख्य रूप से AI के "औसत" प्रदर्शन को देखते हैं। वे यह बताने के लिए एक एकल संख्या (स्केलर स्कोर) देते हैं कि एक AI कितना "सुरक्षित" या "निष्पक्ष" है। लेखक कहते हैं कि यह खतरनाक है क्योंकि यह उन दुर्लभ, गंभीर विफलताओं को छिपा देता है जो भर्ती (hiring), स्वास्थ्य सेवा या न्याय जैसे उच्च-जोखिम वाले मामलों में वास्तविक नुकसान पहुंचा सकती हैं।

समाधान: SHARP (AI के लिए "मौसम का पूर्वानुमान")

लेखक SHARP नामक एक नया फ्रेमवर्क पेश करते हैं। यह पूछने के बजाय कि "यह AI औसतन कैसा प्रदर्शन करता है?", SHARP पूछता है, "यह AI सबसे बुरा क्या कर सकता है, और ऐसा कितनी बार होता है?"

SHARP को एक एकल ग्रेड वाले रिपोर्ट कार्ड के रूप में नहीं, बल्कि तूफान के मौसम के पूर्वानुमान के रूप में सोचें।

  • पुराना तरीका: "आज हवा की औसत गति 10 मील प्रति घंटा है।" (सुरक्षित, उबाऊ, तूफान को मिस कर जाता है)।
  • SHARP का तरीका: "जबकि औसत 10 मील प्रति घंटा है, 100 मील प्रति घंटे की तेज़ हवा चलने की 5% संभावना है जो पेड़ों को गिरा सकती है।"

SHARP कैसे काम करता है: चार "खतरे के क्षेत्र" (Danger Zones)

पेपर "हानि" (harm) को चार विशिष्ट श्रेणियों में विभाजित करता है, जैसे कि अंतरिक्ष यान पर चार अलग-अलग सेंसर:

  1. बायस (Bias/पक्षपात): क्या AI कुछ समूहों के प्रति पूर्वाग्रही है?
  2. फेयरनेस (Fairness/निष्पक्षता): क्या यह अपने उत्तरों में लोगों के साथ असमान व्यवहार कर रहा है?
  3. एथिक्स (Ethics/नैतिकता): क्या यह ऐसी बातें कह रहा है जो नैतिक रूप से गलत हैं?
  4. एपिस्टेमिक रिलायबिलिटी (Epistemic Reliability/ज्ञान संबंधी विश्वसनीयता): क्या यह झूठ बोल रहा है या मनगढ़ंत बातें बना रहा है (हैलुसिनेशन)?

इन सबको एक बड़े "सुरक्षा" नंबर में मिलाने के बजाय, SHARP उन्हें अलग-अलग मापता है। यह इंजन, ब्रेक और टायरों को अलग-अलग चेक करने जैसा है, न कि केवल यह कहने जैसा कि "कार 80% अच्छी है।"

गुप्त मंत्र: "पूंछ" (The Tail) को देखना

SHARP का सबसे महत्वपूर्ण हिस्सा एक मीट्रिक है जिसे CVaR95 (Conditional Value at Risk) कहा जाता है।

  • उपमा: कल्पना कीजिए कि 100 लोगों की एक कतार है।
    • औसत जोखिम: आप हर किसी की ऊंचाई देखते हैं और औसत निकालते हैं।
    • SHARP (CVaR95): आप पहले 95 लोगों को अनदेखा कर देते हैं। आप केवल सबसे लंबे 5 लोगों (वितरण की "पूंछ" या tail) को देखते हैं। फिर, आप केवल उन 5 की औसत ऊंचाई की गणना करते हैं।

क्यों? क्योंकि उच्च-जोखिम वाले AI में, "सबसे लंबे 5" (सबसे खराब 5% उत्तर) वे होते हैं जो आपदा का कारण बनते हैं। यदि कोई AI आमतौर पर विनम्र है लेकिन कभी-कभी नफरत भरी बातें बोलता है, तो "औसत" ठीक दिखेगा, लेकिन "पूंछ" खतरनाक दिखेगी। SHARP पूरी तरह से उस खतरनाक पूंछ पर ध्यान केंद्रित करता है।

उन्होंने क्या पाया: "छिपे हुए" खतरे

लेखकों ने उपलब्ध 11 सबसे स्मार्ट AI मॉडल्स का परीक्षण किया। यहाँ बताया गया है कि SHARP ने क्या उजागर किया जो पुराने परीक्षणों ने मिस कर दिया:

  1. "जुड़वां" भ्रम (The "Twin" Illusion): दो AI मॉडल्स का "औसत" सुरक्षा स्कोर बिल्कुल एक जैसा हो सकता है। लेकिन जब आप उनके सबसे खराब 5% उत्तरों को देखते हैं, तो एक थोड़ा जोखिम भरा हो सकता है, जबकि दूसरा तीन से चार गुना अधिक खराब हो सकता है। वे एक मानक रिपोर्ट कार्ड पर समान दिखते हैं, लेकिन संकट के समय वे बहुत अलग होते हैं।
  2. अलग-अलग खामियां: कुछ मॉडल निष्पक्ष होने में अच्छे हैं लेकिन झूठ बोलने (हैलुसिनेशन) में बहुत खराब हैं। अन्य झूठ न बोलने में अच्छे हैं लेकिन पक्षपाती होने में खराब हैं। आप केवल यह नहीं कह सकते कि "मॉडल A, मॉडल B से बेहतर है।" आपको कहना होगा कि "मॉडल A इस विशिष्ट जोखिम के लिए सुरक्षित है, लेकिन मॉडल B उस जोखिम के लिए सुरक्षित है।"
  3. बायस (पक्षपात) सबसे बुरा है: सभी मॉडल्स में, "पूंछ" (सबसे खराब मामले) में सबसे अधिक बार बायस के कारण समस्या हुई। जब चीजें बहुत खराब हुईं, तो यह अक्सर इसलिए था क्योंकि AI पक्षपाती था।

निष्कर्ष: औसत पर भरोसा करना बंद करें

पेपर निष्कर्ष निकालता है कि हमें AI सुरक्षा को एक साधारण गणितीय समस्या की तरह मानना बंद करना होगा जिसका केवल एक उत्तर हो।

  • पुराना तरीका: "यह AI 90% सुरक्षित है।" (बहुत सरल, खतरे को छिपा देता है)।
  • SHARP का तरीका: "यह AI आमतौर पर सुरक्षित है, लेकिन सबसे खराब 5% मामलों में, यह बायस और झूठ बोलने के मामले में बुरी तरह विफल हो जाता है।"

SHARP का उपयोग करके, नियामक और कंपनियाँ बेहतर निर्णय ले सकते हैं। उच्चतम "औसत" स्कोर वाले AI को चुनने के बजाय, वे उस AI को चुन सकते हैं जिसका सबसे खराब स्थिति वाला परिदृश्य (worst-case scenario) सबसे सुरक्षित हो। यह कार की टॉप स्पीड के आधार पर कार खरीदने बनाम आपात स्थिति में उसके ब्रेक कितनी अच्छी तरह काम करते हैं, इसके आधार पर कार खरीदने के बीच का अंतर है।

संक्षेप में: SHARP एक नया उपकरण है जो हमें "अच्छे औसत" से धोखा खाने से रोकता है और हमें उन डरावनी, दुर्लभ गलतियों को देखने के लिए मजबूर करता है जो वास्तव में मायने रखती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →