← नवीनतम पेपर
🤖 machine learning

Diffusion-Inspired Reconfiguration of Transformers for Uncertainty Calibration

यह शोध पत्र प्री-ट्रेंड ट्रांसफॉर्मर्स के एक डिफ्यूजन-प्रेरित पुनर्गठन (reconfiguration) का प्रस्ताव करता है जो फीचर रूपांतरणों को संभाव्य मैपिंग के रूप में मॉडल करता है ताकि आर्किटेक्चर में व्यवस्थित अनिश्चितता प्रसार (uncertainty propagation) को सक्षम बनाया जा सके, जिससे मौजूदा विधियों की तुलना में विजन और लैंग्वेज बेंचमार्क पर बेहतर अंशांकन (calibration) और भविष्य कहनेवाला सटीकता प्राप्त होती है।

मूल लेखक: Manh Cuong Dao, Quang Hung Pham, Phi Le Nguyen, Thao Nguyen Truong, Bryan Kian Hsiang Low, Trong Nghia Hoang

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Manh Cuong Dao, Quang Hung Pham, Phi Le Nguyen, Thao Nguyen Truong, Bryan Kian Hsiang Low, Trong Nghia Hoang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी समस्या: अति-आत्मविश्वासी विशेषज्ञ (The Overconfident Expert)

कल्पना कीजिए कि आपके पास एक बेहद प्रतिभाशाली, उच्च प्रशिक्षित विशेषज्ञ है (एक ट्रांसफॉर्मर मॉडल) जो तस्वीरों में बिल्लियों को पहचान सकता है या वाक्यों को समझ सकता है। यह विशेषज्ञ बहुत तेज़ है और आमतौर पर सही होता है। हालाँकि, एक पेंच है: इसे यह जानने में बहुत बुराई है कि यह कब गलत है।

यदि आप विशेषज्ञ को कुत्ते की तस्वीर दिखाते हैं, तो वह कह सकता है, "यह निश्चित रूप से एक बिल्ली है," 99% आत्मविश्वास के साथ। वास्तविक दुनिया में, यह खतरनाक है। यदि यह विशेषज्ञ कार चला रहा है या किसी मरीज का निदान कर रहा है, तो उसे यह पता होना चाहिए कि कब कहना है, "मुझे यकीन नहीं है," ताकि कोई इंसान हस्तक्षेप कर सके। आत्मविश्वास को वास्तविक सटीकता (accuracy) के साथ मिलाने की इस क्षमता को अनसर्टेन्टी कैलिब्रेशन (Uncertainty Calibration) कहा जाता है।

वर्तमान में, अधिकांश बड़े AI मॉडल उन अति-आत्मविश्वासी छात्रों की तरह हैं जो बेतरतीब ढंग से अनुमान लगाते हैं लेकिन सोचते हैं कि वे जीनियस हैं। उनमें यह बताने के लिए कोई अंतर्निहित "अंतर्ज्ञान" (gut feeling) नहीं है कि उनका उत्तर कब संदिग्ध हो सकता है।

पुराना तरीका: इसे टुकड़ों में ठीक करने की कोशिश

इसे ठीक करने के पिछले प्रयासों में विशेषज्ञ की सोचने की प्रक्रिया के हर एकल चरण को एक अलग, अनिश्चित घटना के रूप में माना गया।

  • उपमा (Analogy): कल्पना कीजिए कि विशेषज्ञ का मस्तिष्क एक फैक्ट्री असेंबली लाइन है जिसमें 10 स्टेशन हैं। "अनिश्चितता" जोड़ने के लिए, पिछले तरीकों ने प्रत्येक स्टेशन के नीचे व्यक्तिगत रूप से एक "डगमगाती मेज" (wobbly table) रखने की कोशिश की।
  • समस्या: क्योंकि स्टेशनों को अलग-अलग माना गया था, इसलिए "डगमगाहट" एक स्टेशन से दूसरे स्टेशन तक सही ढंग से प्रवाहित नहीं हो सकी। विशेषज्ञ यह ट्रैक करने की क्षमता खो देता था कि शुरुआती चरणों ने बाद के चरणों को कैसे प्रभावित किया। इसने अक्सर विशेषज्ञ को अधिक ईमानदार बनाने के चक्कर में उसकी सटीकता को कम कर दिया। यह एक बुरा समझौता था।

नया समाधान: DIRECTOR (द "फ्लो" मेथड)

लेखक DIRECTOR नामक एक नई विधि प्रस्तावित करते हैं। विशेषज्ञ के मस्तिष्क को अलग-अलग, असंबद्ध स्टेशनों के रूप में देखने के बजाय, उन्होंने पूरी प्रक्रिया को एक सुचारू, निरंतर यात्रा के रूप में पुनर्कल्पित किया, जो एक डिफ्यूजन प्रोसेस (diffusion process) (वही गणित जिसका उपयोग AI आर्ट बनाने के लिए किया जाता है) के समान है।

यह यहाँ कैसे काम करता है, चरण-दर-चरण:

1. "रिवर्स मूवी" की उपमा (The "Reverse Movie" Analogy)

AI की निर्णय लेने की प्रक्रिया को उल्टा चल रही एक फिल्म की तरह समझें।

  • फॉरवर्ड (Forward): आप एक धुंधली, शोर वाली छवि (इनपुट) से शुरू करते हैं और AI उत्तर खोजने के लिए उसे धीरे-धीरे साफ करता है।
  • रिवर्स (Reverse - AI का दृष्टिकोण): AI एक स्पष्ट उत्तर से शुरू करता है और धीरे-धीरे "शोर" जोड़ता है ताकि यह देखा जा सके कि डेटा पहले कैसा दिख सकता था।

लेखकों ने महसूस किया कि AI के आंतरिक चरण (ट्रांसफॉर्मर ब्लॉक्स) स्वाभाविक रूप से इस "रिवर्स मूवी" की तरह दिखते हैं। उन्होंने AI को इस तरह से पुनर्गठित (reconfigure) करने का निर्णय लिया कि प्रत्येक चरण स्पष्ट रूप से यह स्वीकार करे कि संभावनाओं की एक सीमा (अनिश्चितता) मौजूद है, न कि केवल एक एकल उत्तर।

2. "एकीकृत कंडक्टर" (The "Unified Conductor")

प्रत्येक स्टेशन के लिए एक अलग "डगमगाती मेज" रखने के बजाय, लेखकों ने एक एकल, एकीकृत कंडक्टर (एक डिफ्यूजन मॉडल) बनाया जो पूरी असेंबली लाइन की देखरेख करता है।

  • यह कंडक्टर स्टेशनों के बीच के सहसंबंधों (correlations) को सीखता है। यह समझता है कि यदि स्टेशन 1 डगमगा रहा है, तो स्टेशन 2 भी एक विशिष्ट तरीके से डगमगाएगा।
  • इन कनेक्शनों को सीखकर, AI अब तर्क की श्रृंखला को तोड़े बिना शुरुआत से अंत तक अनिश्चितता को सही ढंग से प्रसारित कर सकता है।

3. परिणाम: ईमानदार और स्मार्ट

चूंकि AI अब अपने स्वयं के चरणों के बीच के संबंध को समझता है:

  • यह सटीक रहता है: यह अपनी सही उत्तर पाने की क्षमता नहीं खोता (पुराने तरीकों के विपरीत)।
  • यह ईमानदार बनता है: जब यह अनिश्चित होता है, तो यह अपने आत्मविश्वास स्कोर को कम कर देता है। जब यह आश्वस्त होता है, तो इसे ऊँचा रखता है।
  • यह कुशल है: नया "कंडक्टर" मूल AI मस्तिष्क की तुलना में वास्तव में छोटा और हल्का है, जिसका अर्थ है कि यह कम कंप्यूटर मेमोरी का उपयोग करता है।

इस पेपर ने वास्तव में क्या पाया

लेखकों ने दो मुख्य प्रकार के कार्यों पर इसका परीक्षण किया: विज़न (CIFAR-10 जैसी छवियों में वस्तुओं को पहचानना) और भाषा (CoLA और IMDB जैसे वाक्यों को समझना)।

  • बेहतर कैलिब्रेशन: नया तरीका (DIRECTOR) पिछले तरीकों की तुलना में अपनी सटीकता के साथ अपने आत्मविश्वास को मिलाने में बहुत बेहतर था।
  • बेहतर सटीकता: आश्चर्यजनक रूप से, अनिश्चितता को ठीक करके, मॉडल ने न केवल अपनी सटीकता बनाए रखी बल्कि सही उत्तर पाने में और भी बेहतर प्रदर्शन किया।
  • मजबूती (Robustness): जब डेटा अव्यवस्थित या दूषित (जैसे स्टैटिक शोर वाली फोटो) था, तो DIRECTOR विश्वसनीय बना रहा, जबकि अन्य मॉडल संघर्ष करते रहे।
  • दक्षता (Efficiency): नए तरीके ने उस मूल मॉडल की तुलना में कम कंप्यूटर पैरामीटर्स (मेमोरी) का उपयोग किया जिस पर इसे बनाया गया था।

सारांश

यह पेपर एक तरीका पेश करता है जिससे एक मानक, अति-आत्मविश्वासी AI को लिया जा सकता है और इसके आंतरिक ढांचे को फिर से व्यवस्थित किया जा सकता है ताकि यह अपनी अनिश्चितता को "महसूस" कर सके। उन्होंने ऐसा AI की सोचने की प्रक्रिया को एक टूटे हुए, स्वतंत्र चरणों के बजाय एक सुचारू, जुड़े हुए प्रवाह (डिफ्यूजन प्रोसेस की तरह) के रूप में देखकर किया। परिणाम एक ऐसा AI है जो न केवल स्मार्ट है, बल्कि यह भी जानता है कि कब कहना है, "मुझे यकीन नहीं है," जो इसे वास्तविक दुनिया के उपयोग के लिए सुरक्षित और अधिक विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →