← नवीनतम पेपर
🤖 machine learning

A Tale of Two Variances: When Single-Seed Benchmarks Fail in Bayesian Deep Learning

यह शोधपत्र यह प्रदर्शित करता है कि बेयसियन डीप लर्निंग में सिंगल-सीड इवैल्यूएशन मेट्रिक्स रिपोर्ट करना अविश्वसनीय है क्योंकि प्रशिक्षण के दौरान महत्वपूर्ण, नॉन-मोनोटोनिक वेरिएंस उतार-चढ़ाव होते हैं, विशेष रूप से उन विधियों में जिनमें लर्नड हेटेरोसेडास्टिक हेड्स होते हैं, और यह सुझाव देता है कि चिकित्सकों को केवल एंडपॉइंट मीन्स के बजाय वेरिएंस ट्रेजेक्टरीज रिपोर्ट करनी चाहिए।

मूल लेखक: Qishi Zhan, Minxuan Hu, Liang He, Guansu Wang, Jiaxin Liu

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qishi Zhan, Minxuan Hu, Liang He, Guansu Wang, Jiaxin Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

दो विचलन (Variances) की कहानी: आपकी AI का "रिपोर्ट कार्ड" आपसे झूठ क्यों बोल सकता है

कल्पना कीजिए कि आप एक पेशेवर बास्केटबॉल टीम के स्काउट हैं। आप जानना चाहते हैं कि क्या एक नया खिलाड़ी वास्तव में अच्छा है, इसलिए आप उन्हें केवल एक गेम खेलते हुए देखते हैं। उन्होंने 40 अंक बनाए! आप अपनी नोटबुक में लिखते हैं: "यह खिलाड़ी एक सुपरस्टार है।"

लेकिन इसमें एक पेंच है: वह एक गेम उस दिन खेला गया था जब खिलाड़ी ने अतिरिक्त कैफीन लिया था, विपक्षी टीम का स्टार डिफेंडर बीमार था, और बास्केट का रिम "भाग्यशाली" महसूस कर रहा था। यदि आपने उन्हें 50 अलग-अलग गेम खेलते हुए देखा होता, तो आपको एहसास होता कि उनका औसत वास्तव में केवल 15 अंक है।

यह पेपर ठीक इसी समस्या के बारे में है, लेकिन आर्टिफिशियल इंटेलिजेंस (AI) के लिए।


समस्या: "सिंगल-गेम" का जाल

जब वैज्ञानिक AI मॉडल बनाते हैं (विशेष रूप से वे "बायेसियन" मॉडल जो न केवल एक उत्तर देने की कोशिश करते हैं, बल्कि यह भी बताते हैं कि वे कितने निश्चित हैं), तो वे आमतौर पर यह दिखाने के लिए एक एकल स्कोर रिपोर्ट करते हैं कि AI ने कैसा प्रदर्शन किया। यह उस स्काउट द्वारा लिखने जैसा है कि उसने एक 40-पॉइंट वाला गेम देखा।

शोधकर्ताओं ने पाया कि कई मामलों में, वह एकल स्कोर एक झूठ है। यह AI के बारे में कोई स्थिर तथ्य नहीं है; यह केवल एक भाग्यशाली (या दुर्भाग्यपूर्ण) क्षण है।

खोज: AI का "मिड-लाइफ क्राइसिस" (मध्य-जीवन संकट)

शोधकर्ताओं ने इस बात का अध्ययन किया कि जैसे-जैसे आप AI को अधिक डेटा देते हैं, उसका प्रदर्शन कैसे बदलता है। आमतौर पर, आप उम्मीद करेंगे कि जैसे-जैसे एक AI को अधिक "अध्ययन सामग्री" (डेटा) मिलती है, उसका प्रदर्शन अधिक स्थिर और अनुमानित हो जाता है। इसे सुधार की एक सुचारू, नीचे की ओर जाती ढलान होनी चाहिए।

इसके बजाय, उन्होंने कुछ अजीब पाया: द "मिड-लाइफ क्राइसिस" स्पाइक।

कुछ प्रकार के AI के लिए, मध्यम मात्रा में डेटा पर एक "खतरा क्षेत्र" (danger zone) होता है। इस विशिष्ट चरण में, AI अविश्वसनीय रूप से अनिश्चित हो जाता है। एक बार वह शानदार प्रदर्शन करता है; अगली बार, वह बुरी तरह विफल हो जाता है।

रूपक (Metaphor): कल्पना कीजिए कि एक छात्र परीक्षा के लिए पढ़ाई कर रहा है।

  • चरण 1 (कम डेटा): उसे कुछ नहीं पता। वह हर अभ्यास परीक्षा में फेल हो जाता है। (स्थिर विफलता)।
  • चरण 2 (मध्यम डेटा - द स्पाइक): उसने कुछ चीजें सीखी हैं, लेकिन वह भ्रमित है। एक दिन उसे लगता है कि वह कैलकुलस समझ गया है; अगले दिन, वह साधारण भाग (long division) भी नहीं कर पाता। उसके स्कोर 0% से 100% तक झूलते रहते हैं। यह खतरा क्षेत्र है।
  • चरण 3 (बहुत सारा डेटा): अंततः उसे "समझ" आ जाती है। वह लगातार 95% स्कोर करता है। (स्थिर सफलता)।

शोधकर्ताओं ने पाया कि यदि कोई वैज्ञानिक उस "चरण 2" के स्पाइक के दौरान AI का स्कोर रिपोर्ट करता है, तो वे अनजाने में 95% का स्कोर रिपोर्ट कर सकते हैं जबकि AI का वास्तविक औसत वास्तव में 40% है।

ऐसा क्यों होता है? ("कंफ्यूज्ड टीचर" प्रभाव)

पेपर बताता है कि कुछ AI मॉडल को एक विशिष्ट गणितीय विधि (जिसे "हेटरोसेडास्टिक NLL" कहा जाता है) का उपयोग करके सिखाया जाता है जो अनिवार्य रूप से AI को बताती है: "यदि तुम निश्चित नहीं हो, तो बस एक बड़ा मार्जिन ऑफ एरर (त्रुटि का अंतर) मान लो।"

उस "मिड-लाइफ क्राइसिस" चरण में, AI एक लूप में फंस जाता है। वह एक गलती करता है, भ्रमित होता है, निर्णय लेता है कि वह "अनिश्चित" है, और फिर उस अनिश्चितता का उपयोग और भी अधिक गलतियाँ करने के औचित्य के रूप में करता है। यह उस छात्र की तरह है जो, जब वह एक कठिन गणित के सवाल पर आता है, तो तय करता है, "मुझे गणित नहीं आता, इसलिए मैं हर उत्तर के लिए 'शायद' लिख दूँगा," जो उसके ग्रेड को बुरी तरह से ऊपर-नीचे करता है।

समाधान: सिखाने का एक बेहतर तरीका

शोधकर्ताओं ने एक "फिक्स" का परीक्षण किया। उन्होंने प्रशिक्षण के दौरान AI को ग्रेड करने के तरीके को बदल दिया (जिसे β\beta-NLL कहा जाता है)।

यह नया "ग्रेडिंग सिस्टम" बहुत अधिक उत्साहजनक है। यह AI को सीखने से बचने के लिए "अनिश्चितता" का उपयोग करने से रोकता है। जब उन्होंने इस पद्धति का उपयोग किया, तो "मिड-लाइफ क्राइसिस" गायब हो गया, और AI की प्रगति एक सुचारू, विश्वसनीय चढ़ाई बन गई।

वास्तविक दुनिया के लिए सीख

पेपर भविष्य बनाने वाले लोगों को एक चेतावनी के साथ समाप्त होता है:

  1. एकल स्कोर पर भरोसा न करें: यदि कोई AI शोधकर्ता आपको एक नंबर दिखाता है, तो उनसे पूछें, "अगर आप परीक्षण को फिर से चलाएं तो वह नंबर कितना हिलेगा?"
  2. "खतरा क्षेत्रों" पर नज़र रखें: यदि आप एक AI को प्रशिक्षित कर रहे हैं, तो यह मान न लें कि क्योंकि यह आज अच्छा दिख रहा है, इसलिए यह कल स्थिर रहेगा। प्रशिक्षण के मध्य चरणों के दौरान स्थिरता की जांच करें।
  3. उद्देश्य (Objective) बदलें: यदि आपका AI अनिश्चित व्यवहार कर रहा है, तो मानक "अनिश्चितता" गणित का उपयोग करना बंद करें और इसे सही रास्ते पर रखने के लिए β\beta-NLL पद्धति का प्रयास करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →