← नवीनतम पेपर
🤖 machine learning

PRBench: A Standardized Probabilistic Robustness Benchmark

यह शोध पत्र PRBench को प्रस्तुत करता है, जो डीप लर्निंग मॉडल्स में संभाव्य सुदृढ़ता (probabilistic robustness) के मूल्यांकन के लिए पहला मानकीकृत बेंचमार्क है, जो यह प्रकट करता है कि जबकि एडवरसैरियल ट्रेनिंग विधियाँ हाइपरपैरामीटर्स के across अधिक बहुमुखी प्रतिभा प्रदान करती हैं, संभाव्य सुदृढ़ता-विशिष्ट प्रशिक्षण विधियाँ कम सामान्यीकरण त्रुटि (generalization error) और उच्च क्लीन एक्यूरेसी प्राप्त करती हैं।

मूल लेखक: Yi Zhang, Zheng Wang, Zhen Chen, Wenjie Ruan, Qing Guo, Siddartha Khastgir, Carsten Maple, Xingyu Zhao

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yi Zhang, Zheng Wang, Zhen Chen, Wenjie Ruan, Qing Guo, Siddartha Khastgir, Carsten Maple, Xingyu Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने बिल्लियों और कुत्तों की तस्वीरों को पहचानने के लिए एक बहुत ही स्मार्ट रोबोट बनाया है। आप यह सुनिश्चित करना चाहते हैं कि आपका रोबोट तस्वीरों में होने वाले सूक्ष्म, अदृश्य बदलावों से भ्रमित न हो—जैसे कि कुछ पिक्सेल का खिसक जाना या थोड़ा सा स्टैटिक शोर (static noise)।

AI की दुनिया में, यह परीक्षण करने के दो मुख्य तरीके हैं कि आपका रोबोट कितना "मजबूत" है:

  1. "सबसे खराब स्थिति" वाला परीक्षण (Adversarial Robustness): यह एक मास्टर चोर की तरह है जो आपके रोबोट को चकमा देने का एकल, सटीक तरीका खोजने की कोशिश कर रहा है। यदि चोर को एक भी ऐसी तस्वीर मिल जाती है जो रोबोट को स्पष्ट रूप से "बिल्ली" दिखने के बावजूद "कुत्ता" कहने पर मजबूर कर दे, तो आपका रोबोट विफल हो जाता है। यह वह मानक तरीका है जिससे लोग वर्षों से AI का परीक्षण करते आ रहे हैं।

  2. "वास्तविक दुनिया" वाला परीक्षण (Probabilistic Robustness): यह एक मौसम के पूर्वानुमान की तरह है। यह पूछने के बजाय कि, "क्या एक चोर रोबोट को धोखा दे सकता है?" यह पूछता है कि, "यदि हम तस्वीर को 1,000 बार यादृच्छिक (randomly) रूप से हिलाते हैं, तो कितनी बार रोबोट अभी भी इसे सही पहचान पाता है?" शायद रोबोट 1,000 में से 5 बार विफल होता है, लेकिन 995 बार सही पहचानता है। वास्तविक दुनिया में, यह पर्याप्त हो सकता है।

समस्या: एक गायब स्कोरकार्ड

इस शोध पत्र के लेखकों ने एक बड़े अंतर को देखा। हमारे पास "सबसे खराब स्थिति" वाले चोर के लिए परीक्षणों का एक विशाल पुस्तकालय है, लेकिन हमारे पास "वास्तविक दुनिया" वाले मौसम परीक्षण के लिए विभिन्न प्रशिक्षण विधियों की तुलना करने का कोई मानकीकृत तरीका नहीं है।

कुछ शोधकर्ताओं ने इस "वास्तविक दुनिया" के स्कोर को सुधारने के लिए विशेष प्रशिक्षण विधियाँ बनाने की कोशिश की। लेकिन क्योंकि हर कोई अलग-अलग नियमों और अलग-अलग परीक्षणों का उपयोग कर रहा था, इसलिए कोई भी यह नहीं बता सका कि कौन सा तरीका वास्तव में सबसे अच्छा है। यह दो कारों की गति की तुलना करने जैसा था जब एक ड्राइवर स्टॉपवॉच का उपयोग कर रहा हो और दूसरा धूपघड़ी (sundastial) का।

समाधान: PRBench (एक नया स्कोरकार्ड)

टीम ने PRBench बनाया, जो विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन किया गया पहला मानकीकृत "स्कोरकार्ड" है कि AI यादृच्छिक, वास्तविक दुनिया के व्यवधानों को कितनी अच्छी तरह संभालता है।

उन्होंने 229 अलग-अलग AI मॉडल (साधारण से लेकर बहुत जटिल तक) लिए और उन्हें 13 अलग-अलग विधियों का उपयोग करके प्रशिक्षित किया। इन विधियों में शामिल थे:

  • मानक प्रशिक्षण (Standard Training): बस AI को सामान्य रूप से सिखाना।
  • एडवर्सरियल ट्रेनिंग (AT - Adversarial Training): AI को "चोर" की सर्वश्रेष्ठ चालें दिखाकर सिखाना (सबसे खराब स्थिति वाले परिदृश्य)।
  • प्रोबेबिलिस्टिक ट्रेनिंग (RT - Probabilistic Training): विशेष रूप से यादृच्छिक शोर (random noise) को संभालने के लिए AI को सिखाना।
  • हाइब्रिड विधियाँ (Hybrid Methods): दोनों का मिश्रण।

बड़े आश्चर्य

सभी परीक्षण चलाने के बाद, लेखकों ने कुछ ऐसी चीजें पाईं जो हमारी सामान्य धारणा के विपरीत थीं:

1. "फ्री लंच" की खोज
सबसे बड़ा आश्चर्य यह था कि वे विधियाँ जिन्हें "चोर" को रोकने के लिए डिज़ाइन किया गया था (एडवर्सरियल ट्रेनिंग), वे वास्तव में यादृच्छिक शोर को संभालने में भी सबसे अच्छी थीं।

  • उपमा: कल्पना कीजिए कि आप एक मुक्केबाज को प्रशिक्षित कर रहे हैं। आप उसे हेवीवेट चैंपियन (सबसे खराब स्थिति) से लड़ने के लिए प्रशिक्षित करने का निर्णय लेते हैं। आप उम्मीद करते हैं कि वह हेवीवेट से लड़ने में बहुत अच्छा हो जाएगा। लेकिन, आश्चर्यजनक रूप से, वह भीड़ के यादृच्छिक, हल्के थप्पड़ों से बचने में भी अविश्वसनीय रूप से कुशल हो जाता है।
  • निष्कर्ष: शोध पत्र का दावा है कि यदि आप अपने AI को "सबसे खराब स्थिति" वाले चोर के खिलाफ मजबूत बनाने के लिए प्रशिक्षित करते हैं, तो आपको "प्रोबेबिलिस्टिक रोबस्टनेस" (यादृच्छिक शोर को संभालना) लगभग मुफ्त में मिल जाता है। आपको केवल यादृच्छिक शोर के लिए किसी अलग, विशेष प्रशिक्षण विधि की आवश्यकता नहीं है।

2. समझौते (Trade-offs)
हालाँकि, इसकी एक कीमत है।

  • एडवर्सरियल ट्रेनिंग (हेवीवेट फाइटर): यह AI को चोरों और यादृच्छिक शोर दोनों के खिलाफ बहुत सख्त बनाता है, लेकिन कभी-कभी यह परफेक्ट, साफ तस्वीरों को देखते समय AI को थोड़ा धीमा या कम सटीक बना देता है।
  • प्रोबेबिलिस्टिक ट्रेनिंग (शोर विशेषज्ञ): ये विधियाँ AI को साफ तस्वीरों को देखने में बहुत अच्छा बनाए रखती हैं और यादृच्छिक शोर को अच्छी तरह से संभालती हैं, लेकिन वे "चोर" (सबसे खराब स्थिति के हमलों) के खिलाफ आश्चर्यजनक रूप से कमजोर हैं।

3. "हाइब्रिड" की आशा
एक नई, फैंसी विधि है जिसे AT-PR कहा जाता है जो दोनों दुनियाओं के सर्वश्रेष्ठ को मिलाने की कोशिश करती है। यह "चोर-लड़ने" वाली रणनीति का उपयोग करती है लेकिन इसे यादृच्छिक शोर की भी परवाह करने के लिए ट्यून किया गया है। यह सब कुछ संतुलित करने में बहुत अच्छा काम करता है, लेकिन इसे चलाना बहुत महंगा है (जैसे एक के बजाय 100 प्रशिक्षकों की टीम को काम पर रखना)।

निष्कर्ष

शोध पत्र सुझाव देता है कि लंबे समय से, लोग केवल "यादृच्छिक शोर" की समस्या को ठीक करने के लिए जटिल, विशिष्ट उपकरण आविष्कार करने की कोशिश कर रहे हैं। लेकिन डेटा बताता है कि मानक "चोर-लड़ने" वाले उपकरण (एडवर्सरियल ट्रेनिंग) पहले से ही दोनों समस्याओं को हल करने में शानदार काम कर रहे हैं।

लेखक यह नहीं कह रहे हैं कि हम "प्रोबेबिलिस्टिक रोबस्टनेस" पर शोध करना बंद कर दें। बल्कि, वे कह रहे हैं: "पहिए का पुन: आविष्कार करना बंद करें। हमारे पास पहले से मौजूद उपकरण सबसे खराब स्थिति के परिदृश्यों के लिए आश्चर्यजनक रूप से अच्छे हैं और वे रोजमर्रा की चीजों को भी अच्छी तरह से संभालते हैं।"

उन्होंने इस बेंचमार्क (PRBench) को बनाया है ताकि भविष्य में, शोधकर्ता अनुमान लगाने के बजाय एक स्पष्ट, साझा पैमाने का उपयोग कर सकें, जिससे यह सुनिश्चित हो सके कि हम अत्यधिक और रोजमर्रा की दोनों स्थितियों में सुरक्षित और विश्वसनीय AI का निर्माण कर रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →