NeurIPS Should Require Reproducibility Standards for Frontier AI Safety Claims
यह स्थिति पत्र (position paper) तर्क देता है कि न्यूरिप्स (NeurIPS) को फ्रंटियर एआई सुरक्षा दावों के लिए पुनरुत्पादकता मानकों को अनिवार्य करना चाहिए, जो वर्तमान "प्रमाणिक व्युत्क्रमण" (evidential inversion) को संबोधित करने के लिए एक तीन-स्तरीय प्रकटीकरण ढांचे का प्रस्ताव करता है जहाँ रोके गए आर्टिफैक्ट्स के कारण सबसे महत्वपूर्ण सुरक्षा दावे सबसे कम सत्यापन योग्य हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ एक कंपनी एक अविश्वसनीय रूप से शक्तिशाली नई मशीन बनाती है। इसे जनता को बेचने से पहले, वे एक रिपोर्ट प्रकाशित करते हैं जिसमें लिखा है, "चिंता न करें, यह मशीन सुरक्षित है। यह किसी को नुकसान नहीं पहुँचाएगी।"
इस शोध पत्र के अनुसार समस्या यह है कि कंपनियाँ अक्सर आपको यह दिखाने से मना कर देती हैं कि उन्होंने उस मशीन का परीक्षण कैसे किया। वे आपको केवल अंतिम स्कोर (जैसे, "99% सुरक्षित!") देती हैं लेकिन परीक्षण के प्रश्न, स्कोरिंग के नियम और मशीन की सेटिंग्स को छिपा लेती हैं। वे कहती हैं, "हम पर भरोसा करें, हमने इसकी जाँच की है।"
इस पेपर के लेखक तर्क देते हैं कि NeurIPS कॉन्फ्रेंस (कंप्यूटर वैज्ञानिकों का एक प्रमुख समागम) को नियमों को बदलने की आवश्यकता है। वे कहते हैं: "यदि आप एक सुपर-शक्तिशाली AI के बारे में सुरक्षा का दावा प्रकाशित करना चाहते हैं, तो आपको इसे सिद्ध करना होगा। यदि आप अपना काम (प्रमाण) नहीं दिखा सकते, तो आप बड़ा दावा नहीं कर सकते।"
यहाँ उनके प्रस्ताव का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. समस्या: "साक्ष्य व्युत्क्रमण" (Evidential Inversion)
आमतौर पर, विज्ञान में, दावा जितना बड़ा और महत्वपूर्ण होता है, उसे सिद्ध करने के लिए उतने ही अधिक प्रमाणों की आवश्यकता होती है।
- सामान्य विज्ञान: यदि कोई वैज्ञानिक कहता है, "मुझे एक नया ग्रह मिला है," तो उन्हें टेलीस्कोप का डेटा दिखाना चाहिए ताकि अन्य लोग भी उसे देख सकें।
- AI सुरक्षा (समस्या): यदि कोई कंपनी कहती है, "यह AI पावर ग्रिड चलाने के लिए सुरक्षित है," तो वे अक्सर डेटा छिपा देते हैं।
लेखक इसे "एविडेंशियल इनवर्जन" कहते हैं। यह एक जादूगर की तरह है जो दावा करता है कि उसका करतब हानिरहित है, लेकिन वह ताश के पत्तों की गड्डी को देखने से इनकार कर देता है। यह पेपर तर्क देता है कि यह केवल पारदर्शिता की कमी नहीं, बल्कि विज्ञान की विफलता है।
2. समाधान: एक तीन-स्तरीय "ट्रैफिक लाइट" प्रणाली
लेखक जानते हैं कि कभी-कभी, "कार्ड्स" (परीक्षण डेटा) दिखाना खतरनाक हो सकता है। यदि आप दिखाते हैं कि सुरक्षा प्रणाली को कैसे तोड़ा जा सकता है, तो बुरे तत्व इसका उपयोग सीख सकते हैं।
इसलिए, वे सूचना साझा करने के स्तर के लिए एक तीन-स्तरीय प्रणाली (ट्रैफिक लाइट की तरह) का प्रस्ताव करते हैं:
🟢 स्तर 1 (ग्रीन लाइट - सार्वजनिक):
- कब: जब परीक्षण डेटा सभी को दिखाने के लिए सुरक्षित हो।
- नियम: आपको सब कुछ प्रकाशित करना होगा: आपने AI से क्या प्रश्न पूछे, आपने कौन सा कोड उपयोग किया, और परिणाम क्या रहे। कोई भी इस परीक्षण को दोबारा चला सकता है।
- परिणाम: पूर्ण विश्वास। दावा पूरी तरह से समर्थित है।
🟡 स्तर 2 (येलो लाइट - नियंत्रित):
- कब: जब डेटा सार्वजनिक रूप से दिखाना खतरनाक हो (उदाहरण के लिए, यह लोगों को हैक करना सिखाता हो), लेकिन एक विश्वसनीय विशेषज्ञ इसे सुरक्षित रूप से देख सके।
- नियम: आप डेटा को जनता के लिए प्रकाशित नहीं करते हैं। इसके बजाय, आप इसे विश्वसनीय, स्वतंत्र विशेषज्ञों के एक गुप्त पैनल को सौंपते हैं (जैसे कि एक निजी सुरक्षा क्लीयरेंस)। वे बंद दरवाजों के पीछे काम की जाँच करते हैं और "थम्स अप" या "थम्स डाउन" देते हैं।
- परिणाम: दावा समर्थित है, लेकिन एक नोट के साथ कि, "हमने इसकी निजी तौर पर जाँच की है, लेकिन आप कच्चा डेटा नहीं देख सकते।"
🔴 स्तर 3 (रेड लाइट - प्रतिबंधित):
- कब: जब एक गुप्त पैनल भी डेटा को नहीं देख सकता क्योंकि यह बहुत अधिक खतरनाक है (उदाहरण के लिए, परीक्षण में जैविक हथियार का सिमुलेशन बनाना शामिल है)।
- नियम: आप अभी भी पेपर लिख सकते हैं, लेकिन आप यह बड़ा दावा नहीं कर सकते कि "यह AI जारी करने के लिए पर्याप्त सुरक्षित है।" आप केवल यह कह सकते हैं, "हमने इसे परीक्षण करने की कोशिश की, लेकिन डेटा बहुत संवेदनशील है।"
- परिणाम: दावा "सही-स्केल" (right-scaled) है। आप अपने पेपर का उपयोग दुनिया को AI जारी करने के औचित्य के रूप में नहीं कर सकते।
3. "दावा सूची" (The Claim Inventory - रसीद)
कंपनियों को धोखाधड़ी करने से रोकने के लिए, पेपर एक नया फॉर्म सुझाता है जिसे लेखक को भरना होगा, जिसे "क्लेम इन्वेंटरी" कहा जाता है।
- इसे एक दुकान पर मिलने वाली रसीद की तरह समझें।
- लेखक को अपने द्वारा किए गए प्रत्येक सुरक्षा दावे को सूचीबद्ध करना होगा।
- प्रत्येक दावे के बगल में, उन्हें एक बॉक्स चेक करना होगा: "क्या हमने डेटा दिखाया? क्या हमने गुप्त पैनल से इसकी जाँच करवाई? या क्या यह दिखाने के लिए बहुत खतरनाक है?"
- यदि वे "बहुत खतरनाक" चुनते हैं लेकिन उनके पास अच्छा कारण नहीं है, तो पेपर को खारिज कर दिया जाता है या दावे को कमजोर कर दिया जाता है।
4. NeurIPS क्यों?
लेखकों ने NeurIPS को इसलिए चुना क्योंकि यह AI अनुसंधान के "ओलंपिक्स" जैसा है।
- वर्तमान में, कंपनियाँ अपने सुरक्षा रिपोर्ट को NeurIPS में प्रकाशित करना पसंद करती हैं क्योंकि इससे उनके दावों को वैज्ञानिक वैधता मिलती है। इससे जनता और सरकारें उन पर भरोसा करती हैं।
- पेपर तर्क देता है: "यदि आप स्वर्ण पदक (NeurIPS में प्रकाशन) चाहते हैं, तो आपको नियमों का पालन करना होगा। आप केवल यह नहीं कह सकते कि आप सुरक्षित हैं; आपको इसे सिद्ध करना होगा, या तो सार्वजनिक रूप से या एक विश्वसनीय रेफरी को दिखाकर।"
5. धोखाधड़ी को कैसे रोकें
लेखक अनुमान लगाते हैं कि कुछ कंपनियाँ सिस्टम के साथ हेरफेर करने की कोशिश कर सकती हैं (जैसे, डेटा को छिपाने के लिए यह दावा करना कि वह "बहुत खतरनाक" है)।
- समाधान: वे एक "फेडरेटेड रिव्यू सिस्टम" का प्रस्ताव करते हैं। कल्पना कीजिए कि विभिन्न "सुरक्षा क्लीयरेंस" (जैसे विभिन्न राष्ट्रीय सुरक्षा संस्थान या स्वतंत्र लैब) का एक समूह है। यदि कोई कंपनी कहती है कि उनका डेटा NeurIPS के लिए बहुत संवेदनशील है, तो इस समूह का एक तटस्थ विशेषज्ञ इसकी जाँच करता है।
- यदि विशेषज्ञ कहता है, "नहीं, यह वास्तव में इतना खतरनाक नहीं है, आपको इसे दिखाना चाहिए," तो कंपनी को इसे दिखाना होगा। यदि वे मना करते हैं, तो पेपर को खारिज कर दिया जाता है।
सारांश
यह पेपर AI समुदाय के लिए कार्रवाई का आह्वान है: सुरक्षा के लिए "हम पर भरोसा करें" को प्रमाण के रूप में स्वीकार करना बंद करें।
यदि आप दावा करते हैं कि एक शक्तिशाली AI सुरक्षित है, तो आपको या तो:
- अपना काम सभी को दिखाना होगा।
- एक विश्वसनीय, स्वतंत्र रेफरी को गुप्त रूप से अपना काम दिखाने देना होगा।
- यदि आप दोनों में से कुछ भी नहीं कर सकते, तो स्वीकार करें कि आपने यह सिद्ध नहीं किया है कि यह सुरक्षित है, और अपने पेपर का उपयोग AI को जारी करने के औचित्य के रूप में न करें।
लक्ष्य AI विकास को रोकना नहीं है; बल्कि यह सुनिश्चित करना है कि जब हम कहें "यह सुरक्षित है," तो हमारे पास इसे सिद्ध करने के लिए वास्तव में रसीदें (प्रमाण) हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।