← नवीनतम पेपर
🔒 cryptography

EVMbench: Evaluating AI Agents on Smart Contract Security

यह शोध पत्र EVMbench को प्रस्तुत करता है, जो एक बेंचमार्किंग फ्रेमवर्क है जो एक यथार्थवादी स्थानीय एथेरियम वातावरण के भीतर स्मार्ट कॉन्ट्रैक्ट कमजोरियों का पता लगाने, उन्हें पैच करने और उनका शोषण करने में फ्रंटियर एआई एजेंटों की क्षमताओं का मूल्यांकन करता है, जो लाइव ब्लॉकचेन इंस्टेंस के विरुद्ध एंड-टू-एंड हमलों को सफलतापूर्वक निष्पादित करने की उनकी क्षमता को प्रकट करता है।

मूल लेखक: Justin Wang, Andreas Bigger, Xiaohai Xu, Justin W. Lin, Andy Applebaum, Tejal Patwardhan, Alpin Yukseloglu, Olivia Watkins

प्रकाशित 2026-03-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Justin Wang, Andreas Bigger, Xiaohai Xu, Justin W. Lin, Andy Applebaum, Tejal Patwardhan, Alpin Yukseloglu, Olivia Watkins

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ पैसा बैंकों में सुरक्षा गार्डों और तिजोरियों में नहीं, बल्कि "स्मार्ट कॉन्ट्रैक्ट्स" नामक डिजिटल कांच के घरों में रखा जाता है। ये घर एक सार्वजनिक ब्लॉकचेन (जैसे Ethereum) पर बने हैं। एक बार जब ब्लूप्रिंट (नक्शा) तैयार हो जाता है और घर बन जाता है, तो आप बिना किसी को बताए एक भी ईंट नहीं बदल सकते। यदि ब्लूप्रिंट में कोई खामी है, तो एक चोर सीधे अंदर घुसकर सब कुछ चुरा सकता है, और क्योंकि यह घर एक सार्वजनिक लेजर पर है, यह चोरी तुरंत होती है और इसे बदला नहीं जा सकता।

अभी, आर्टिफिशियल इंटेलिजेंस (AI) ब्लूप्रिंट पढ़ने और कोड लिखने में बहुत कुशल होता जा रहा है। बड़ा सवाल यह है: क्या AI इन कांच के घरों में होने वाले दोषों को बुरे लोगों से पहले खोजने के लिए पर्याप्त स्मार्ट है? या क्या यह खुद अंदर घुसकर पैसा चुराने के लिए काफी स्मार्ट है?

यह शोध पत्र, EVMbench, इसी सवाल का जवाब है। यह AI एजेंटों के लिए एक विशाल "टेस्ट ड्राइव" है ताकि यह देखा जा सके कि वे क्रिप्टो सुरक्षा की उच्च-दांव वाली दुनिया को कैसे संभालते हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इस पेपर का विवरण दिया गया है:

1. परिवेश: "डार्क फॉरेस्ट" (अंधेरा जंगल)

कल्पना कीजिए कि ब्लॉकचेन एक डार्क फॉरेस्ट है।

  • पेड़: ये वे स्मार्ट कॉन्ट्रैक्ट्स हैं जिनमें अरबों डॉलर रखे हैं।
  • शिकारी: ये हैकर्स (और अब, AI बॉट्स) हैं जो जंगल को स्कैन कर रहे हैं। यदि उन्हें एक कमजोर टहनी (एक भेद्यता/vulnerability) मिलती है, तो वे उसे हिला सकते हैं जब तक कि फल (पैसा) उनकी टोकरी में न गिर जाए।
  • समस्या: इस जंगल में, यदि आप कोई गलती करते हैं, तो आप सब कुछ तुरंत खो देते हैं। यहाँ "अनडू" (undo) बटन नहीं है।

2. परीक्षण: EVMbench

शोधकर्ताओं ने EVMbench नामक एक विशाल प्रशिक्षण जिम बनाया है। केवल AI को "कविता लिखने" या "गणित की समस्या हल करने" के लिए कहने के बजाय, उन्होंने AI को इस डार्क फॉरेस्ट के एक सिम्युलेटेड संस्करण में डाल दिया, जिसमें 117 अलग-अलग "कांच के घर" हैं जिनमें ज्ञात कमियां (holes) हैं।

AI को तीन अलग-अलग खेल खेलने होते हैं:

गेम A: जासूस (डिटेक्ट मोड)

  • कार्य: AI को ब्लूप्रिंट का एक ढेर दिया जाता है और सभी छिपी हुई कमियों को खोजने के लिए कहा जाता है।
  • लक्ष्य: एक रिपोर्ट लिखना कि, "हे, यह खिड़की खुली है," या "इस दरवाजे में कोई ताला नहीं है।"
  • परिणाम: सबसे अच्छे AI ने छिपे हुए लगभग 46% जाल खोज लिए। यह बेहतर हो रहा है, लेकिन यह अभी भी उन सूक्ष्म दरारों को मिस कर रहा है जिन्हें मानव विशेषज्ञ पकड़ लेते हैं।

गेम B: मिस्त्री (पैच मोड)

  • कार्य: AI को कमियां मिलती हैं और उसे उन्हें ठीक करना होता है बिना घर को नुकसान पहुँचाए।
  • लक्ष्य: दरवाजे पर नया ताला लगाना या खिड़की को मजबूत करना, लेकिन यह सुनिश्चित करना कि घर के अंदर रहने वाले लोगों के लिए घर वैसा ही काम करता रहे।
  • परिणाम: AI इसमें आश्चर्यजनक रूप से अच्छा है। एक बार जब उसे पता चल जाता है कि समस्या कहाँ है, तो वह अक्सर इसे पूरी तरह से ठीक कर देता है। मुख्य संघर्ष कोड को ठीक करना नहीं है; बल्कि सबसे पहले समस्या को खोजना है।

गेम C: चोर (एक्सप्लॉइट मोड)

  • कार्य: यह डरावना हिस्सा है। AI को एक नकली वॉलेट दिया जाता है जिसमें कुछ पैसा होता है और कहा जाता है: "इन घरों से पैसा चुराने का रास्ता खोजो।"
  • लक्ष्य: AI को यह समझना होता है कि घर को अपना फंड देने के लिए मजबूर करने हेतु कदमों का सटीक क्रम क्या होगा।
  • परिणाम: यह सबसे चिंताजनक निष्कर्ष है। AI पहले से ही इन घरों में एंड-टू-एंड सेंध लगाने में सक्षम है। कुछ परीक्षणों में, शीर्ष AI ने 71% प्रयासों में "पैसा" (सिम्युलेटेड टोकन) सफलतापूर्वक चुरा लिया। उसने केवल छेद नहीं ढूँढा; वह उसके माध्यम से अंदर गया, तिजोरी खाली की और भाग गया।

3. "फ्लैश लोन" की उपमा

इस पेपर में एक बहुत ही दिलचस्प (और डरावना) उदाहरण है जिसे फ्लैश लोन कहा जाता है।

  • कल्पना करें: आप एक बैंक में जाते हैं, एक अरब डॉलर उधार लेते हैं, उस पैसे से एक घर खरीदते हैं, घर बेचते हैं, एक अरब डॉलर वापस करते हैं, और मुनाफा अपने पास रखते हैं—यह सब पलक झपकने के समय में होता है।
  • AI का कदम: परीक्षण में, AI ने एक जटिल वित्तीय मशीन को धोखा देने के लिए "फ्लैश लोन" का उपयोग करने का तरीका खोज निकाला। उसने पैसा उधार लिया, मशीन को यह विश्वास दिलाने के लिए उसका उपयोग किया कि वह एक भरोसेमंद दोस्त है, असली पैसा चुराया, और तुरंत ऋण चुका दिया। AI ने यह पूरी तरह से अपने आप किया, बिना किसी इंसान द्वारा उसे यह बताए कि उसे ठीक से क्या करना है।

4. यह क्यों मायने रखता है

यह शोध पत्र आशा और चेतावनी के मिश्रण के साथ समाप्त होता है:

  • अच्छी खबर: AI सुरक्षा गार्ड बनने में बहुत अच्छा हो रहा है। यदि हम कोड को ऑडिट करने के लिए AI का उपयोग करते हैं, तो हम बग्स को इंसानों की तुलना में तेज़ी से ढूंढ सकते हैं, जिससे वित्तीय प्रणाली सुरक्षित हो सकती है।
  • बुरी खबर: AI एक लुटेरा बनने में भी बहुत अच्छा हो रहा है। यदि कोई बुरा व्यक्ति AI को एक "हैक बटन" दे देता है, तो यह क्रिप्टो सिस्टम से अरबों डॉलर को तब तक निकाल सकता है जब तक कि इंसानों को पता भी न चले कि क्या हुआ है।

निचोड़ (The Bottom Line)

EVMbench को भविष्य के लिए एक तनाव परीक्षण (stress test) के रूप में देखें। यह हमें दिखाता है कि AI एजेंट अब केवल कोड लिख सकने वाले चैटबॉट्स नहीं हैं; वे स्वायत्त एजेंट (autonomous agents) बन रहे हैं जो जटिल प्रणालियों को समझ सकते हैं, कमजोरियां ढूंढ सकते हैं और वास्तविक दुनिया में हमलों (या बचाव) को अंजाम दे सकते हैं।

शोधकर्ता अपने परीक्षण डेटा को जनता के लिए जारी कर रहे हैं ताकि सुरक्षा विशेषज्ञ AI को बेहतर रक्षक बनाने के लिए प्रशिक्षित करना जारी रख सकें, यह सुनिश्चित करने के लिए कि जब AI और भी स्मार्ट हो जाए, तो वह डार्क फॉरेस्ट के चोरों के बजाय अच्छे लोगों की ओर से हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →