← नवीनतम पेपर
💻 computer science

Entity-Level Post-Hoc Reliability Calibration for Named Entity Recognition via Multi-Source Features

यह शोध पत्र नेम्ड एंटिटी रिकग्निशन (Named Entity Recognition) के लिए एक पोस्ट-हॉक एंटिटी-स्तरीय विश्वसनीयता अंशांकन (reliability calibration) विधि प्रस्तावित करता है जो एक हल्के कैलिब्रेटर को प्रशिक्षित करने के लिए बहु-स्रोत विशेषताओं का लाभ उठाता है, जो अंतर्निहित मॉडल को संशोधित किए बिना आत्मविश्वास सटीकता और परिनियोजन सुदृढ़ता में महत्वपूर्ण सुधार करता है।

मूल लेखक: Junhui Yang, Feifan Xiao

प्रकाशित 2026-08-11
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junhui Yang, Feifan Xiao

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप पुराने पत्रों का एक ढेर पढ़कर एक रहस्य को सुलझाने की कोशिश कर रहे हैं एक जासूस के रूप में। आपके पास एक सुपर-स्मार्ट सहायक (एक AI) है जो किसी भी अन्य व्यक्ति की तुलना में इन पत्रों को तेज़ी से पढ़ सकता है और टेक्स्ट में छिपे हुए लोगों, स्थानों और संगठनों के नामों की ओर इशारा कर सकता है। इसे 'नेम्ड एंटिटी रिकग्निशन' (Named Entity Recognition) या NER कहा जाता है। लंबे समय तक, लक्ष्य केवल सहायक को यथासंभव सटीक बनाना था। लेकिन यहाँ एक पेंच है: कभी-कभी, भले ही सहायक गलत हो, वह सही होने के बारे में अत्यधिक आश्वस्त होता है। वह किसी यादृच्छिक शब्द की ओर इशारा कर सकता है और कह सकता है, "मुझे 99% यकीन है कि यह एक व्यक्ति का नाम है!" उसी दृढ़ता के साथ जैसे वह तब उपयोग करता है जब वह वास्तव में सही होता है। यह खतरनाक है। यदि आप मेडिकल रिकॉर्ड को फ़िल्टर करने या नौकरी के आवेदनों की स्क्रीनिंग करने के लिए एक सिस्टम बना रहे हैं, तो आपको न केवल यह जानने की आवश्यकता है कि सहायक ने क्या पाया, बल्कि यह भी कि आप उस पर कितना भरोसा कर सकते हैं। बड़ा सवाल केवल यह नहीं है कि "क्या उसने नाम ढूँढ लिया?" बल्कि यह है कि "क्या सहायक का आत्मविश्वास स्कोर एक झूठ है?"

यह शोध पत्र ठीक इसी समस्या से निपटता है। लेखकों, जुनहुई यांग और फीफ़ान ज़ियाओ ने महसूस किया कि AI के आत्मविश्वास की जाँच करने के मौजूदा तरीके बहुत व्यापक थे—वे पूरे वाक्य या पूरे दस्तावेज़ को देखते थे, इस तथ्य को नज़रअंदाज़ करते हुए कि एक वाक्य में एक विशिष्ट नाम गलत हो सकता है जबकि अन्य एकदम सही हो सकते हैं। वे एक चतुर "पोस्ट-हॉक" (घटना के बाद का) समाधान प्रस्तावित करते हैं। विशाल, जटिल AI मॉडल को फिर से प्रशिक्षित करने के बजाय (जो कि एक बेहतर स्पीडोमीटर जोड़ने के लिए कार के इंजन को फिर से बनाने जैसा है), वे आउटपुट के साथ एक छोटा, हल्का "विश्वसनीयता परीक्षक" (reliability checker) जोड़ देते हैं। यह परीक्षक AI के उत्तर को देखता है और पूछता है, "रुको, क्या यह वास्तव में समझ में आता है?" और यह पाँच अलग-अलग कोणों से सुराग इकट्ठा करके काम करता है: AI के निर्णय में कितनी अस्थिरता थी, AI के मस्तिष्क के भीतर शब्द कैसा दिखता है, क्या वह शब्द अपनी श्रेणी में फिट बैठता है, वाक्यांश कितना लंबा है, और वह अन्य चीजों के कितना समान है जो AI ने पहले देखी हैं।

AI के लिए "कॉन्फिडेंस पुलिस"

एक मानक AI मॉडल को एक परीक्षा देने वाले छात्र के रूप में सोचें। छात्र उत्तर लिखता है और प्रत्येक के लिए खुद को एक ग्रेड (कॉन्फिडेंस स्कोर) देता है। आमतौर पर, यदि छात्र एक प्रश्न का सही उत्तर देता है, तो वह आश्वस्त महसूस करता है। लेकिन कभी-कभी, छात्र एक प्रश्न गलत करता है और फिर भी बहुत आश्वस्त महसूस करता है क्योंकि उसने एक ऐसा पैटर्न याद कर लिया है जो पूरी तरह से फिट नहीं बैठता। लेखकों ने इस पेपर में एक "कॉन्फिडेंस पुलिस" अधिकारी बनाया है जो छात्र के पीछे खड़ा होता है। यह अधिकारी छात्र के उत्तरों को नहीं बदलता; वे बस छात्र के काम और आसपास के सुरागों को देखते हैं ताकि यह तय किया जा सके कि छात्र का आत्मविश्वास स्कोर भरोसेमंद है या नहीं।

यह शोध पत्र एक ऐसी विधि पेश करता है जो AI द्वारा खोजे गए प्रत्येक नाम को एक छोटी सी केस फाइल की तरह मानती है। केवल उस अंतिम "मैं 90% निश्चित हूँ" संख्या को देखने के बजाय जो AI देता है, नई विधि यह पता लगाने के लिए कि क्या वह उत्तर वास्तव में सही है, पाँच प्रकार के सुराग एकत्र करती है:

  1. "हिचकिचाहट" का सुराग (अनिश्चितता): क्या AI संघर्ष कर रहा था? यदि AI ने सोचा, "क्या यह एक व्यक्ति है या एक स्थान? शायद 50/50," तो यह एक बुरा संकेत है। यदि वह 99% निश्चित था, तो यह आमतौर पर अच्छा होता है, लेकिन हमेशा नहीं। परीक्षक देखता है कि AI का चुनाव कितना "तीक्ष्ण" या "धुंधला" था।
  2. "ब्रेन स्कैन" का सुराग (प्रतिनिधित्व): AI की एक गुप्त आंतरिक भाषा (छिपे हुए प्रतिनिधित्व) होती है जिसका उपयोग वह शब्दों को समझने के लिए करता है। परीक्षक AI के मस्तिष्क में शब्द के "आकार" को देखता है। यदि AI सोचता है कि "एप्पल" एक फल है, लेकिन आंतरिक आकार एक कार जैसा दिखता है, तो परीक्षक जानता है कि कुछ गड़बड़ है, भले ही AI कहे कि वह निश्चित है।
  3. "कॉमन सेंस" का सुराग (टाइप सिमेंटिक्स): क्या शब्द लेबल के अनुकूल है? यदि AI "खाना पकाने" के बारे में एक वाक्य को "स्थान" के रूप में लेबल करता है, तो यह अजीब है। परीक्षक शब्द के अर्थ की तुलना लेबल के अर्थ से करता है ताकि यह देखा जा सके कि क्या वे मेल खाते हैं।
  4. "आकार" का सुराग (संरचना): नाम कितना लंबा है? क्या यह एक छोटा शब्द है या एक लंबा, जटिल वाक्यांश? कुछ नाम सही होने में कठिन होते हैं। परीक्षक नोट करता है कि क्या AI एक विशेष रूप से कठिन, लंबे या नेस्टेड वाक्यांश को हल करने की कोशिश कर रहा है।
  5. "भीड़" का सुराग (पड़ोस): परीक्षक AI के पिछले प्रशिक्षण डेटा को देखता है। "हे, यह शब्द उन अन्य शब्दों जैसा दिखता है जो मैंने पहले देखे हैं। क्या वे सही थे या गलत?" यदि AI एक ऐसा शब्द देख रहा है जो उसके द्वारा पहले की गई गलतियों के समूह जैसा दिखता है, तो परीक्षक विश्वास स्कोर को कम कर देता है।

परिणाम: सही उत्तरों पर भरोसा करना

लेखकों ने इस "कॉन्फिडेंस पुलिस" का परीक्षण तीन अलग-अलग टेक्स्ट सेटों पर किया: समाचार लेख (CoNLL-2003), मेडिकल टेक्स्ट (GENIA), और सामान्य एनोटेटेड टेक्स्ट (OntoNotes 4.0)। उन्होंने उन कठिन स्थितियों में भी इसका परीक्षण किया जहाँ टेक्स्ट AI के प्रशिक्षण से अलग था, जैसे कि ऐसे शब्द जिनका उपयोग AI ने पहले कभी नहीं किया था (Out-of-Vocabulary) या पूरी तरह से अलग विषय का टेक्स्ट (Out-of-Distribution)।

परिणाम काफी उत्साहजनक थे। परीक्षक जोड़ने से पहले, AI के कच्चे आत्मविश्वास स्कोर अक्सर भ्रामक होते थे। उदाहरण के लिए, समाचार डेटासेट पर, गलत उत्तरों को पहचानने (Error Detection) की क्षमता में उल्लेखनीय सुधार हुआ। पेपर रिपोर्ट करता है कि त्रुटि का पता लगाने का मीट्रिक (AUPRC) 0.9490 से बढ़कर 0.9929 हो गया। इसका मतलब है कि परीक्षक "अच्छे" उत्तरों को "बुरे" उत्तरों से अलग करने में बहुत बेहतर हो गया।

शायद इससे भी अधिक महत्वपूर्ण "सिलेक्टिव प्रेडिक्शन" (चयनात्मक भविष्यवाणी) का परिणाम है। यह कहने की क्षमता है कि, "मैं इस बारे में अनिश्चित हूँ, इसलिए मैं इसे छोड़ दूँगा और एक इंसान को इसकी जाँच करने दूँगा।" पेपर दिखाता है कि परीक्षक के साथ, सिस्टम सबसे जोखिम भरे उत्तरों को खारिज कर सकता है जबकि स्वीकृत उत्तरों की सटीकता को बहुत उच्च रख सकता है। समाचार डेटासेट पर, एक गलत उत्तर रखने का "जोखिम" 0.0514 से गिरकर 0.0095 हो गया। यह एक बड़ी गिरावट है, जिसका अर्थ है कि सिस्टम वास्तविक दुनिया में उपयोग के लिए बहुत सुरक्षित है।

लेखकों ने यह भी पाया कि यह विधि तब सबसे अच्छा काम करती है जब AI भ्रमित होता है। जब टेक्स्ट अजीब या नया था (जैसे कि "आउट-ऑफ-डिस्ट्रीब्यूशन" टेस्ट), तो कच्चा AI आत्मविश्वास बहुत गलत था, लेकिन नए परीक्षक ने इसे ठीक कर दिया, जिससे त्रुटि पहचान स्कोर 0.8291 से बढ़कर 0.9409 हो गया। यह सुझाव देता है कि पाँच सुराग मिलकर उन कमियों को भरते हैं जब AI अंधे होकर उड़ रहा होता है।

इसका भविष्य के लिए क्या अर्थ है

यह पेपर तर्क देता है कि हमें अपने विशाल AI मॉडल को सुरक्षित बनाने के लिए उन्हें फिर से बनाने की आवश्यकता नहीं है। हमें बस इसके ऊपर एक छोटा, स्मार्ट "विश्वसनीयता स्तर" जोड़ने की आवश्यकता है। यह एक कार में डैशबोर्ड चेतावनी लाइट जोड़ने जैसा है जो पहले से ही अच्छी चलती है। लेखक सुझाव देते हैं कि यह दृष्टिकोण विशेष रूप से उन वास्तविक दुनिया के अनुप्रयोगों के लिए उपयोगी है जहाँ गलतियाँ महंगी पड़ती हैं, जैसे कि चिकित्सा निदान या कानूनी दस्तावेज़ समीक्षा। इन पाँच सुरागों का उपयोग करके, सिस्टम एक इंसान को बता सकता है, "हे, मुझे यह नाम मिला, लेकिन मैं केवल 40% आश्वस्त हूँ, इसलिए कृपया इसकी दोबारा जाँच करें," बजाय इसके कि वह आत्मविश्वास के साथ एक गलत उत्तर चिल्लाए।

अध्ययन निष्कर्ष निकालता है कि जबकि AI का कच्चा आत्मविश्वास अक्सर एक झूठ बोलने वाला होता है, एक बहु-स्रोत परीक्षक सच बोल सकता है। यह केवल नंबरों को बेहतर नहीं बनाता है; यह वास्तव में हमें खतरनाक गलतियों को छानने और सही उत्तरों पर भरोसा करने में मदद करता है, जिससे AI मानव के लिए एक बहुत अधिक विश्वसनीय साथी बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →