← नवीनतम पेपर
🤖 AI

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

यह शोध पत्र AIR-BENCH Live को प्रस्तुत करता है, जो फाउंडेशन मॉडल्स के लिए एक स्व-विकसित सुरक्षा बेंचमार्क है जो तेजी से बदलते एआई परिदृश्य में स्थिर बेंचमार्क की सीमाओं को संबोधित करने के लिए नए सरकारी नियमों को निरंतर एकीकृत करने और बहुभाषी हमला प्रॉम्ट्स उत्पन्न करने के लिए एक स्वचालित पाइपलाइन का उपयोग करता है।

मूल लेखक: Rohan Naphade, Minzhou Pan, Bo Li

प्रकाशित 2026-07-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Rohan Naphade, Minzhou Pan, Bo Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया की कल्पना एक विशाल, निरंतर विस्तार करती लाइब्रेरी के रूप में करें जहाँ रोबोट कहानियाँ लिखना, समस्याओं को हल करना और यहाँ तक कि हमसे बातें करना भी सीख रहे हैं। लेकिन किसी भी लाइब्रेरी की तरह, इसमें भी कुछ नियम हैं कि क्या लिखा जा सकता है: बम बनाने के निर्देश नहीं, नफरत फैलाने वाली बातें नहीं, और रहस्य चुराने की कोई चाल नहीं। वैज्ञानिक यह देखने के लिए "सुरक्षा परीक्षण" (सेफ्टी टेस्ट) बनाते हैं कि क्या रोबोट नियमों का पालन करते हैं। इन परीक्षणों को उन पहेलियों या जाल की एक श्रृंखला के रूप में समझें जो रोबोट को नियम तोड़ने के लिए छलने के लिए डिज़ाइन किए गए हैं। यदि रोबोट छल से बच जाता है, तो उसे उच्च स्कोर मिलता है; यदि वह छल का शिकार हो जाता है, तो उसे कम स्कोर मिलता है। समस्या यह है कि दुनिया तेज़ी से बदलती है। नए कानून पारित किए जाते हैं, रोबोट को छलने के नए तरीके आविष्कार किए जाते हैं, और पुरानी पहेलियाँ हल करने के लिए बहुत आसान हो जाती हैं। पिछले साल का सुरक्षा परीक्षण आज बेकार हो सकता है क्योंकि रोबोट ने पुराने छल को अनदेखा करना सीख लिया है, या इसलिए क्योंकि एक नए कानून ने कुछ ऐसा प्रतिबंधित कर दिया है जिसके बारे में परीक्षण ने कभी सोचा भी नहीं था। यही कारण है कि शोधकर्ता हमेशा इन परीक्षणों को "जीवंत" (लाइव) और स्वयं को अपडेट करने वाला बनाने का तरीका खोजते रहते हैं, ताकि वे एक ऐसी दुनिया में प्रासंगिक बने रहें जो कभी रुकती नहीं है।

यह शोध पत्र एक नया, स्वयं-अपडेट होने वाला सुरक्षा परीक्षण पेश करता है जिसे AIR-BENCH Live कहा जाता है। इसे एक ऐसे सुरक्षा गार्ड के रूप में समझें जो केवल दरवाजे पर प्रतिबंधित वस्तुओं की एक निश्चित सूची लेकर खड़ा नहीं रहता, बल्कि उसके पास एक रोबोट सहायक है जो लगातार समाचारों को स्कैन करता है, दुनिया भर के नए कानूनों को पढ़ता है, और एआई (AI) को परखने के लिए तुरंत नई, पेचीदा पहेलियाँ बनाता है। शोधकर्ताओं ने एक ऐसा पाइपलाइन बनाया है जो स्वचालित रूप से अमेरिका, चीन और यूरोपीय संघ जैसी जगहों से सरकारी नियमों को "स्क्रैप" (पढ़ता) करता है। जब इसे कोई नया नियम मिलता है—जैसे कि किसी रोबोट के मस्तिष्क को चुराने या चुनावों में गड़बड़ी करने के लिए नकली वीडियो का उपयोग करने के खिलाफ कानून—तो यह अपनी सुरक्षा चेकलिस्ट में एक नया श्रेणी जोड़ देता है। फिर, एआई एजेंटों की एक टीम इन नए नियमों के आधार पर यथार्थवादी, बहुभाषी प्रॉम्प्ट (पहेलियाँ) लिखने के लिए मिलकर काम करती है। वे "पर्सोना" (चरित्र) का उपयोग करते हैं, जो अभिनय की भूमिकाओं की तरह हैं, ताकि पहेलियों को ऐसा दिखाया जा सके जैसे वे अलग-अलग स्थितियों में वास्तविक लोगों से आ रही हों, न कि किसी स्क्रिप्ट को पढ़ रहे रोबोट से।

टीम ने इस नए, विकसित होते बेंचमार्क का उपयोग करके 14 अलग-अलग एआई मॉडल्स का परीक्षण किया। उन्होंने सुरक्षा में एक बड़ा अंतर पाया: कुछ मॉडल्स अविश्वसनीय रूप से सुरक्षित थे, जो लगभग हर छल को अस्वीकार कर देते थे (1.00 स्कोर करते हुए), जबकि अन्य को छलना काफी आसान था (0.17 तक का स्कोर)। दिलचस्प बात यह है कि नए, आधुनिक प्रॉम्प्ट्स पुराने वाले से अधिक कठिन थे, जिससे सबसे अधिक अनुपालन करने वाले मॉडल्स को भी थोड़ा चूकने पर मजबूर कर दिया गया। शोधकर्ताओं ने यह भी पाया कि अंग्रेजी के अलावा अन्य भाषाओं में पूछे जाने पर अधिकांश मॉडल्स थोड़े कम सुरक्षित थे, जो यह सुझाव देता है कि सभी मानव भाषाओं में रोबोट को विनम्र और सुरक्षित रखना अभी भी एक प्रगतिशील कार्य है। शोध पत्र निष्कर्ष निकालता है कि हालांकि हम दुनिया को बदलने से नहीं रोक सकते, लेकिन हम ऐसे सुरक्षा परीक्षण बना सकते हैं जो इसके साथ ही विकसित होते हैं, यह सुनिश्चित करते हुए कि जैसे-जैसे एआई स्मार्ट होता जाता है, इसकी सुरक्षा को परखने की हमारी क्षमता भी स्मार्ट होती जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →