← नवीनतम पेपर
🤖 machine learning

Neural Uncertainty Principle: A Unified View of Adversarial Fragility and LLM Hallucination

यह शोध पत्र विज़न में एडवर्सरियल फ्रैजिलिटी (adversarial fragility) और लैंग्वेज मॉडल्स में मतिभ्रम (hallucination) को एक साझा ज्यामितीय घटना के रूप में एकीकृत करने के लिए न्यूरल अनसर्टेन्टी प्रिंसिपल (NUP) को प्रस्तुत करता है, जो एक इनपुट-ग्रेडिएंट अनसर्टेन्टी बाउंड द्वारा नियंत्रित है, जिससे मॉडल की मजबूती बढ़ाने और मतिभ्रम का पता लगाने के लिए कंजमस्क (ConjMask) और लॉजिटरेग (LogitReg) जैसे कुशल, ट्रेनिंग-मुक्त तरीकों का विकास संभव होता है।

मूल लेखक: Dong-Xiao Zhang, Hu Lou, Jun-Jie Zhang, Jun Zhu, Deyu Meng

प्रकाशित 2026-03-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dong-Xiao Zhang, Hu Lou, Jun-Jie Zhang, Jun Zhu, Deyu Meng

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया देखना और सच बोलना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह सटीक (accurate) हो (सही उत्तर दे) और मजबूत (robust) हो (छोटी, अदृश्य बदलावों से धोखा न खाए)।

यह पेपर एक नया विचार पेश करता है जिसे न्यूरल अनसर्टेन्टी प्रिंसिपल (Neural Uncertainty Principle - NUP) कहा जाता है। यह सुनने में भौतिकी (physics) जैसा लगता है, लेकिन इसे AI के लिए एक "संतुलन के नियम" के रूप में समझें।

यहाँ रोजमर्रा के उदाहरणों का उपयोग करके इसका सरल विवरण दिया गया है:

1. मुख्य समस्या: दो अलग-अलग विफलताएं

वर्तमान में, वैज्ञानिक दो बड़ी AI समस्याओं को पूरी तरह से असंबंधित मानते हैं:

  • "कांपती हुई आँख" (दृष्टि/Vision): यदि आप कंप्यूटर को पांडा की एक तस्वीर दिखाते हैं, और आप उसमें एक छोटा, अदृश्य शोर (noise) जोड़ देते हैं, तो कंप्यूटर अचानक चिल्ला सकता है, "यह एक गिटार है!" यह बहुत अधिक संवेदनशील है।
  • "झूठ बोलने वाला मुँह" (भाषा/Language): यदि आप चैटबॉट से गणित का सवाल पूछते हैं, तो वह धाराप्रवाह और आत्मविश्वास के साथ उत्तर दे सकता है, लेकिन गणित पूरी तरह से मनगढ़ंत हो सकता है। यह मतिभ्रम (hallucination) का शिकार है।

आमतौर पर, शोधकर्ता आँख को ठीक करने के लिए एक उपकरण और मुँह को दूसरे उपकरण से ठीक करने की कोशिश करते हैं। यह पेपर कहता है: "रुको! वे वास्तव में एक ही समस्या हैं।"

2. बड़ा विचार: "सत्य की रस्सी पर संतुलन" (The Tightrope of Truth)

लेखकों का कहना है कि एक AI के काम करने के लिए, उसे दो चीजों को संतुलित करना होगा:

  1. फोकस (Focus): वह इनपुट (जैसे फोटो या वाक्य) के विशिष्ट विवरणों को कितनी स्पष्टता से देखता है।
  2. संवेदनशीलता (Sensitivity): यदि आप इनपुट में थोड़ा सा बदलाव करते हैं, तो उसका उत्तर कितना बदल जाता है।

एक रस्सी पर चलने वाले (tightrope walker) की कल्पना करें।

  • यदि वॉकर रस्सी के एक विशिष्ट स्थान पर बहुत अधिक केंद्रित (too focused) है (अत्यधिक सटीक होने की कोशिश कर रहा है), तो वह हवा के प्रति अत्यधिक संवेदनशील हो जाता है। हवा का एक छोटा सा झोंका (छवि में एक छोटा सा बदलाव) उसे नीचे गिरा सकता है। यह "कांपती हुई आँख" है।
  • यदि वॉकर बहुत अधिक ढीला (too relaxed) है और रस्सी पर बिल्कुल ध्यान नहीं दे रहा है, तो वह बिना किसी दिशा के भटक जाएगा। वह रस्सी से पूरी तरह उतर सकता है और इस बारे में कहानी बना सकता है कि वह कहाँ जा रहा है। यह "झूठ बोलने वाला मुँह" है।

न्यूरल अनसर्टेन्टी प्रिंसिपल कहता है: आप एक ही समय में पूर्ण फोकस और पूर्ण स्थिरता (perfect focus AND perfect stability) नहीं रख सकते। अनिश्चितता का एक "बजट" होता है। यदि आप पूर्ण सटीकता प्राप्त करने के लिए बजट को बहुत कसकर दबाते हैं, तो आप स्थिरता खो देते हैं। यदि आप इसे बहुत ढीला छोड़ देते हैं, तो आप फोकस खो देते हैं।

3. जादुई उपकरण: "कंजुगेट प्रोब" (The Conjugate Probe)

हमें कैसे पता चलेगा कि AI रस्सी पर है या भटक गया है? लेखकों ने CC-Probe नामक एक सरल उपकरण बनाया है।

AI के मस्तिष्क को एक कमरे के रूप में सोचें:

  • इनपुट (Input): वह प्रश्न या छवि जो आप उसे देते हैं।
  • ग्रेडिएंट (Gradient): वह "तनाव" या "तनाव" (stress) जो AI महसूस करता है जब वह उत्तर देने की कोशिश करता है।

प्रोब (Probe) प्रश्न और तनाव के बीच के कोण (angle) को मापता है।

  • दृष्टि में (The Eye): यदि कोण अजीब है (उच्च कपलिंग), तो इसका मतलब है कि AI तनावग्रस्त और नाजुक है। वह एक चट्टान के किनारे पर खड़ा है। पेपर दिखाता है कि यदि आप छवि के उन हिस्सों को "मास्क" (ढक) देते हैं जो इस तनाव का कारण बन रहे हैं, तो AI बिना महंगे पुन: प्रशिक्षण (retraining) के अधिक स्थिर हो जाता है।
  • भाषा में (The Mouth): यदि कोण बहुत सपाट (कम कपलिंग) है, तो इसका मतलब है कि AI आपके प्रॉम्प्ट को ध्यान से नहीं सुन रहा है। वह ख्याली दुनिया में खोया हुआ है। पेपर दिखाता है कि यदि आप AI के टाइप करना शुरू करने से पहले इस कोण की जांच करते हैं, तो आप भविष्यवाणी कर सकते हैं कि क्या वह झूठ बोलने वाला है।

4. समाधान: "ConjMask" और "LogitReg"

इस सिद्धांत के आधार पर, उन्होंने दो सरल समाधान बनाए हैं:

  • दृष्टि के लिए (ConjMask): कल्पना कीजिए कि AI एक तस्वीर देख रहा है और एक विशिष्ट छाया से भ्रमित हो रहा है। पूरे AI को फिर से प्रशिक्षित करने के बजाय, लेखक बस उसे कहते हैं, "एक पल के लिए उस विशिष्ट छाया को अनदेखा करें।" यह तनाव को कम करता है, और AI को हैकर्स द्वारा ठगना बहुत कठिन हो जाता है।
  • भाषा के लिए (Prefill Check): चैटबॉट के एक शब्द का उत्तर लिखने से पहले, सिस्टम प्रॉम्प्ट के "कोण" की जांच करता है। यदि कोण यह सुझाव देता है कि AI "भटक" (drifting) रहा है (कम कपलिंग), तो सिस्टम कह सकता है, "हे, यह प्रॉम्प्ट बहुत अस्पष्ट है, आइए कुछ अलग आज़माते हैं," या इसे संभावित झूठ के रूप में चिह्नित कर सकता है।

5. यह क्यों महत्वपूर्ण है

यह पेपर एक गेम-चेंजर है क्योंकि यह दुनिया को एकीकृत करता है।

  • पहले: हम सोचते थे कि "दृष्टि कठिन है" और "भाषा कठिन है" और हमने उन्हें अलग-अलग माना।
  • अब: हमें एहसास हुआ कि ये दोनों एक ही सिक्के के दो अलग-अलग पहलू हैं। चाहे वह कैमरा हो या चैटबॉट, यदि AI बहुत कठोर है, तो वह आसानी से टूट जाता है। यदि वह बहुत ढीला है, तो वह झूठ बोलता है।

निष्कर्ष (The Takeaway):
सुरक्षित, विश्वसनीय AI बनाने के लिए, हमें केवल इसमें अधिक डेटा डालने की आवश्यकता नहीं है। हमें इसके तनाव की ज्यामिति (geometry of its stress) को समझने की आवश्यकता है। यह मापने से कि AI का "इनपुट" और उसका "तनाव" एक-दूसरे से कैसे संबंधित हैं, हम भविष्यवाणी कर सकते हैं कि वह कब विफल होने वाला है और उसे गिरने से पहले धीरे से वापस रस्सी पर ला सकते हैं।

यह AI को एक बैलेंस बीम (balance beam) और एक स्पॉटर (spotter) देने जैसा है जो ठीक जानता है कि AI कब डगमगाने वाला है, जिससे हमें उसके क्रैश होने से पहले उसे ठीक करने की अनुमति मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →