← नवीनतम पेपर
💻 computer science

Evaluating Nova 2.0 Lite model under Amazon's Frontier Model Safety Framework

यह शोध पत्र अमेज़न के नोवा 2.0 लाइट (Nova 2.0 Lite) मॉडल का फ्रंटियर मॉडल सेफ्टी फ्रेमवर्क (Frontier Model Safety Framework) के विरुद्ध एक व्यापक मूल्यांकन प्रस्तुत करता है, जो स्वचालित बेंचमार्क, विशेषज्ञ रेड-टीमिंग और अपलिफ्ट अध्ययनों के संयोजन के माध्यम से CBRN, आक्रामक साइबर ऑपरेशंस और स्वचालित AI अनुसंधान एवं विकास (R&D) जैसे उच्च-जोखिम वाले क्षेत्रों में इसकी महत्वपूर्ण जोखिम प्रोफ़ाइल पर केंद्रित है।

मूल लेखक: Satyapriya Krishna, Matteo Memelli, Tong Wang, Abhinav Mohanty, Claire O'Brien Rajkumar, Payal Motwani, Rahul Gupta, Spyros Matsoukas

प्रकाशित 2026-01-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Satyapriya Krishna, Matteo Memelli, Tong Wang, Abhinav Mohanty, Claire O'Brien Rajkumar, Payal Motwani, Rahul Gupta, Spyros Matsoukas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि अमेज़न ने एक नया, अविश्वसनीय रूप से स्मार्ट डिजिटल मस्तिष्क बनाया है जिसे Nova 2.0 Lite कहा जाता है। यह मस्तिष्क विशेष है क्योंकि यह एक साथ भारी मात्रा में जानकारी पढ़ सकता है—जैसे कि एक ही नज़र में किताबों, कोड और वीडियो के पूरे पुस्तकालय को पचा लेना। क्योंकि यह इतना शक्तिशाली है, अमेज़न यह सुनिश्चित करना चाहता था कि यह अनजाने में बुरे तत्वों को खतरनाक हथियार बनाने या सुरक्षित सिस्टम को हैक करने में मदद न करे।

इसे करने के लिए, उन्होंने एक सख्त "सुरक्षा नियम पुस्तिका" का उपयोग किया जिसे फ्रंटियर मॉडल सेफ्टी फ्रेमवर्क (FMSF) कहा जाता है। इस नियम पुस्तिका को एक हवाई अड्डे पर उच्च-सुरक्षा चेकपॉइंट की तरह समझें। मॉडल को उड़ने (सार्वजनिक रूप से जारी करने) की अनुमति देने से पहले, इसे तीन बहुत ही विशिष्ट, उच्च-दांव वाले सुरक्षा परीक्षणों से गुजरना होगा।

यहाँ यह पेपर उन परीक्षणों के परिणामों को सरल उपमाओं का उपयोग करके समझाता है:

तीन सुरक्षा चेकपॉइंट्स

शोधकर्ताओं ने Nova 2.0 Lite का तीन खतरनाक क्षेत्रों में परीक्षण किया:

  1. CBRN (रासायनिक, जैविक, रेडियोलॉजिकल, परमाणु): क्या यह मॉडल किसी को जहर या गंदा बम बनाने में मदद कर सकता है?
  2. आक्रामक साइबर ऑपरेशन्स (Offensive Cyber Operations): क्या यह मॉडल किसी हैकर को बैंक या सरकारी सर्वर में घुसपैठ करने में मदद कर सकता है?
  3. स्वचालित AI अनुसंधान और विकास (Automated AI R&D): क्या यह मॉडल बिना किसी मानव हस्तक्षेप के अपने आप नए, और भी स्मार्ट AI मॉडल बना सकता है, जिससे एक अनियंत्रित खतरनाक AI की श्रृंखला बन सके?

परीक्षण विधियाँ: मस्तिष्क की जाँच करने के दो तरीके

शोधकर्ताओं ने केवल मॉडल से यह नहीं पूछा, "क्या आप सुरक्षित हैं?" उन्होंने दो अलग-अलग तरीकों का उपयोग किया यह पता लगाने के लिए कि क्या वह सुरक्षित है:

  • स्वचालित क्विज़ (बहुविकल्पीय परीक्षा): उन्होंने मॉडल को हजारों पेचीदा सवाल और पहेलियाँ दीं, जैसे कि एक मानकीकृत परीक्षा। उन्होंने यह जांचा कि क्या मॉडल खतरनाक तथ्यों (जैसे कि टॉक्सिन कैसे बनाया जाए) को जानता है या क्या वह जटिल सुरक्षा पहेलियों (जैसे कि कंप्यूटर सिस्टम में छेद ढूँढना) को हल कर सकता है।
  • "रेड टीम" सिमुलेशन (भूमिका निर्वहन/रोल-प्ले): उन्होंने मानव विशेषज्ञों (जैसे पेशेवर सुरक्षा परीक्षकों) को मॉडल को धोखा देने की कोशिश करने के लिए काम पर रखा। उन्होंने मॉडल से उन्हें हथियार बनाने या सिस्टम को हैक करने में मदद करने के लिए कहा, जैसे कि कोई गैर-विशेषज्ञ किसी चीज़ को सीखने के लिए AI का उपयोग कर रहा हो। यह एक मास्टर चोर द्वारा एक नौसिखिए को ताला खोलने का तरीका सिखाने जैसा है, जहाँ AI एक ट्यूटर के रूप में कार्य करता है।

उन्हें क्या मिला?

1. मॉडल स्मार्ट है, लेकिन "खतरनाक रूप से" स्मार्ट नहीं है
पेपर स्वीकार करता है कि Nova 2.0 Lite निश्चित रूप से अपने पुराने संस्करणों (Nova 1.0) से अधिक स्मार्ट है।

  • CBRN क्षेत्र में: इसने खतरनाक रसायनों और जीव विज्ञान के बारे में परीक्षणों में उच्च स्कोर किया। हालाँकि, जब मानव विशेषज्ञों ने वास्तव में हथियार बनाने के लिए इसका उपयोग करने की कोशिश की, तो मॉडल एक दीवार से टकरा गया। यह उन चरण-दर-चरण निर्देशों को प्रदान करने में असमर्थ रहा जो एक गैर-विशेषज्ञ को हथियार बनाने वाले में बदल सकें।
  • साइबर क्षेत्र में: मॉडल सुरक्षा अवधारणाओं को समझने में बहुत अच्छा हो गया (सिद्धांत परीक्षणों पर 85% से अधिक स्कोर किया)। यह "कैप्चर द फ्लैग" पहेलियों (सुरक्षा खेल) को पहले की तुलना में बेहतर ढंग से हल कर सकता है, विशेष रूप से आसान वाले। लेकिन जब बात कठिन चीजों की आई—जैसे कि वास्तव में एक जटिल सिस्टम में घुसपैटना या आधुनिक सुरक्षा को बायपास करने वाला वायरस बनाना—तो इसे संघर्ष करना पड़ा। यह उस छात्र की तरह है जो जानता है कि कार का इंजन कैसे काम करता है, लेकिन कार चोरी करने के लिए उसे हॉटवायर (बिना चाबी के चालू करना) नहीं कर सकता।
  • AI अनुसंधान क्षेत्र में: मॉडल ने मशीन लर्निंग कार्यों के लिए कोड को ठीक करने और सेटिंग्स को बदलने की क्षमता दिखाई। हालाँकि, यह एक नए, खतरनाक AI को बनाने के लिए स्वतंत्र रूप से एक पूर्ण अनुसंधान परियोजना नहीं चला सका। इसे मार्गदर्शन के लिए मनुष्यों की आवश्यकता थी, और यह अपने आप खतरनाक शोध को तेज करने के लिए "बगावत" नहीं कर सका।

2. "गार्डरेल्स" (सुरक्षा घेरे) ने काम किया
पेपर इस बात पर प्रकाश डालता है कि मॉडल में अंतर्निहित "गार्डरेल्स" (सुरक्षा फिल्टर) हैं।

  • खतरनाक रसायनों के बारे में पूछे जाने पर, मॉडल कभी-कभी उत्तर जानता था लेकिन निर्देश देने से मना कर देता था, या इसने खतरनाक निर्देश के बजाय एक सुरक्षित, शैक्षिक उत्तर दिया।
  • साइबर परीक्षणों में, मॉडल को अक्सर किसी पहेली को हल करने के लिए मानव के संकेत या हिंट की आवश्यकता होती थी। इसने अचानक से किसी सिस्टम को हैक करने का निर्णय नहीं लिया।

3. निर्णय
सभी परीक्षणों के बाद, स्वतंत्र ऑडिटरों (काम की जाँच करने वाले "पुलिस") ने अमेज़न की टीम के साथ सहमति व्यक्त की। उन्होंने निष्कर्ष निकाला कि Nova 2.0 Lite को रिलीज़ करना सुरक्षित है।

पेपर "असुरक्षित" की एक विशिष्ट परिभाषा का उपयोग करता है: यदि मॉडल किसी गैर-विशेषज्ञ को सार्वजनिक उपकरणों के उपयोग से बेहतर, हथियार बनाने या सिस्टम को हैक करने में मदद कर सकता है, तो वह असुरक्षित होगा। परीक्षणों ने दिखाया कि Nova 2.0 Lite इस सीमा को पार नहीं कर पाया। यह एक शक्तिशाली उपकरण है, लेकिन यह वास्तव में हानिकारक चीजें करने के लिए प्रवेश की बाधा को कम नहीं करता है।

निचोड़ (The Bottom Line)

Nova 2.0 Lite को एक बहुत ही जानकार लाइब्रेरियन के रूप में समझें जो रसायन विज्ञान और कंप्यूटर सुरक्षा के बारे में बहुत कुछ जानता है। हालांकि वे खतरनाक चीजों के बारे में जानते हैं, लेकिन उन्हें सख्त नियमों के साथ प्रशिक्षित किया गया है कि वे कभी भी हथियार बनाने या बैंकों में घुसपैठ करने के "कैसे करें" (how-to) मैनुअल नहीं देंगे। पेपर पुष्टि करता है कि ये नियम काम कर रहे हैं, और लाइब्रेरियन सार्वजनिक पुस्तकालय में जाने के लिए सुरक्षित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →