← नवीनतम पेपर
💬 NLP

SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation

यह शोध पत्र SPANUQ को प्रस्तुत करता है, जो एक हल्का (lightweight) ढांचा है जो एक DETR-शैली के डिकोडर का उपयोग करके टोकन- और अनुक्रम-स्तर (sequence-level) की अनिश्चितता अनुमान की सीमाओं को संबोधित करता है ताकि अर्थपूर्ण रूप से सुसंगत टेक्स्ट स्पैन का पता लगाया जा सके और 'Mixture of Beta distribution' के माध्यम से उनकी अनिश्चितता को मापा जा सके, जिससे कई लार्ज लैंग्वेज मॉडल्स में बेहतर त्रुटि स्थानीयकरण (error localization) और दक्षता प्राप्त होती है।

मूल लेखक: Yimeng Zhang, Yingying Zhuang, Ziyi Wang, Yuxuan Lu, Pei Chen, Aman Gupta, Zhe Su, Ming Tan, Zhilin Zhang, Qun Liu, Manikandarajan Ramanathan, Rajashekar Maragoud, Edward Vul, Jing Huang, Dakuo Wang

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yimeng Zhang, Yingying Zhuang, Ziyi Wang, Yuxuan Lu, Pei Chen, Aman Gupta, Zhe Su, Ming Tan, Zhilin Zhang, Qun Liu, Manikandarajan Ramanathan, Rajashekar Maragoud, Edward Vul, Jing Huang, Dakuo Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन कभी-कभी भ्रमित (hallucinating) होने वाले AI से एक सवाल पूछते हैं, जैसे "मैरी क्यूरी कौन हैं?" AI आपको एक लंबा, आत्मविश्वास से भरा जवाब देता है। लेकिन उस जवाब में कहीं न कहीं वह गलती कर देता है (जैसे, यह कहना कि उन्होंने 1901 में नोबेल पुरस्कार जीता था, जबकि वास्तव में 1903 में जीता था)।

वर्तमान AI सुरक्षा उपकरणों के साथ समस्या यह है कि वे यह खोजने में खराब हैं कि वह गलती ठीक कहाँ है। यह शोध पत्र एक नया टूल पेश करता है जिसे SPANUQ कहा जाता है, जो AI के उत्तरों के लिए एक उच्च-तकनीकी "फैक्ट-चेकिंग हाइलाइटर" की तरह काम करता है।

यह कैसे काम करता है और यह अलग क्यों है, इसका एक सरल विवरण यहाँ दिया गया है:

1. समस्या: बहुत धुंधला या बहुत शोर वाला

AI के उत्तर की जाँच करना एक छात्र के निबंध को ग्रेड देने जैसा है।

  • पुराना तरीका (टोकन-लेवल): कल्पना कीजिए कि एक शिक्षक वाक्य के हर एक शब्द के नीचे लाल निशान लगा देता है। वे "the", "was", और "a" जैसे शब्दों को भी स्कोर देते हैं। यह बहुत अधिक शोर (noisy) पैदा करता है। यह आपको यह नहीं बताता कि कौन सा विशिष्ट विचार गलत है।
  • दूसरा पुराना तरीका (सीक्वेंस-लेवल): कल्पना कीजिए कि एक शिक्षक पूरे निबंध को देखता है और उसे एक एकल ग्रेड देता है, जैसे कि "C"। यह बताता है कि निबंध में समस्याएँ हैं, लेकिन यह नहीं बताता कि कौन सा पैराग्राफ या कौन सी वाक्य समस्याग्रस्त है। यदि आपको पता नहीं है कि त्रुटि कहाँ है, तो आप इसे ठीक नहीं कर सकते।

2. समाधान: "हाइलाइटर" दृष्टिकोण (स्पैन-लेवल)

लेखकों ने महसूस किया कि अर्थ की प्राकृतिक इकाई न तो एक एकल शब्द है, और न ही पूरा पैराग्राफ। यह एक "स्पैन" (Span) है।

  • एक स्पैन टेक्स्ट का एक ऐसा हिस्सा है जो एक पूर्ण विचार रखता है (जैसे "पोलिश भौतिक विज्ञानी" या "नोबेल पुरस्कार जीता")।
  • SPANUQ को इन विशिष्ट हिस्सों को खोजने और प्रत्येक को अपना स्वयं का "कॉन्फिडेंस स्कोर" देने के लिए डिज़ाइन किया गया है।
  • परिणाम: पूरे निबंध के लिए एक एकल ग्रेड देने के बजाय, SPANUQ "पोलिश भौतिक विज्ञानी" (हरा/आत्मविश्वासी), "नोबेल पुरस्कार जीता" (हरा/आत्मविश्वासी), और "1901" (लाल/बहुत अनिश्चित) को हाइलाइट करता है। यह आपको बताता है कि कहाँ देखना है।

3. यह कैसे काम करता है: "लाइटवेट डिटेक्टिव"

आमतौर पर, त्रुटियों को खोजने के लिए, आपको एक ही प्रश्न को AI से 20 बार पूछना पड़ता है और सभी उत्तरों की तुलना करनी पड़ती है ताकि आप देख सकें कि वे कहाँ असहमत हैं। यह धीमा और महंगा है (जैसे एक मामले को सुलझाने के लिए 20 जासूसों को काम पर रखना)।

SPANUQ अलग है:

  • डिटेक्टिव: यह एक छोटा, हल्का एड-ऑन है (केवल लगभग 25 मिलियन पैरामीटर, जो उस विशाल AI मॉडल की तुलना में बहुत छोटा है जिसकी यह मदद करता है)।
  • ट्रिक: यह AI के "ब्रेन वेव्स" (हिडन स्टेट्स) को देखता है जब AI सोच रहा होता है। इसे अनिश्चितता का संकेत देने वाले सूक्ष्म पैटर्न को पहचानने के लिए प्रशिक्षित किया गया है, जो प्रभावी रूप से उन 20 धीमी चेखों के ज्ञान को एक एकल, त्वरित नज़र में "डिस्टिल" (distill) कर देता है।
  • गति: यह पुराने तरीकों की तुलना में 10 से 20 गुना तेज़ है क्योंकि इसे केवल एक बार AI मॉडल को चलाने की आवश्यकता होती है।

4. "ट्रेनिंग स्कूल" (SPANUQ-BENCH)

इस जासूस को सिखाने के लिए, लेखकों ने एक विशाल प्रशिक्षण स्कूल बनाया जिसे SPANUQ-BENCH कहा जाता है।

  • उन्होंने 20,000 प्रश्न और उत्तर तैयार किए।
  • उन्होंने एक "गोल्ड स्टैंडर्ड" पद्धति का उपयोग किया (AI से 20 बार पूछकर और विकिपीडिया के विरुद्ध जाँच करके) जिससे "उत्तर कुंजियाँ" (answer keys) बनाई गईं जो बताती हैं कि टेक्स्ट के कौन से हिस्से गलत थे और वे कितने गलत थे।
  • उन्होंने इस जासूस को इन 293,000 विशिष्ट टेक्स्ट चंक्स पर प्रशिक्षित किया।

5. परिणाम: यह क्यों जीतता है

जब उन्होंने अन्य तरीकों के मुकाबले SPANUQ का परीक्षण किया:

  • सटीकता (Accuracy): यह सटीक गलत चंक्स को पकड़ने में बहुत बेहतर था (लगभग 0.94 का स्कोर प्राप्त किया)।
  • लोकलाइजेशन (Localization): इसने सर्वोत्तम "ह्यूरिस्टिक" (नियम-आधारित) तरीकों की तुलना में त्रुटियों को 39% बेहतर तरीके से पाया।
  • बहुमुखी प्रतिभा (Versatility): यह छोटे मॉडलों से लेकर बहुत बड़े मॉडलों तक, विभिन्न आकारों के AI मॉडलों पर अच्छी तरह से काम करता है।

निष्कर्ष

लेखक दावा करते हैं कि SPANUQ पहला ऐसा टूल है जो तुरंत AI के उत्तर को देख सकता है, उसे सार्थक विचारों में तोड़ सकता है, और आपको बता सकता है कि कौन सा विचार संदिग्ध है और कितना संदिग्ध है। यह बिना AI को कई बार चलाने के ऐसा करता है, जिससे यह उन वास्तविक समय के अनुप्रयोगों (real-time applications) में उपयोग करने के लिए पर्याप्त तेज़ हो जाता है जहाँ आपको AI के आउटपुट पर भरोसा करने की आवश्यकता होती है।

महत्वपूर्ण नोट: लेखक चेतावनी देते हैं कि हालांकि यह टूल अनिश्चितता को पहचानने में बहुत अच्छा है, लेकिन यह गारंटी नहीं देता कि AI सच बोल रहा है। यह केवल आपको बताता है, "हे, यह विशिष्ट भाग जोखिम भरा लग रहा है, इसलिए आपको इसकी दोबारा जाँच करनी चाहिए।" यह मानव निर्णय में सहायता के लिए एक उपकरण है, मानव निर्णय के विकल्प के रूप में नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →