EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation
यह शोध पत्र EVM-QuestBench प्रस्तुत करता है, जो 107 परमाणु (atomic) और मिश्रित (composite) कार्यों के डायनेमिक, फोर्क-आधारित परीक्षण के माध्यम से EVM-संगत चेन्स पर प्राकृतिक भाषा लेनदेन कोड जनरेशन की सुरक्षा और सटीकता का कड़ाई से मूल्यांकन करने के लिए डिज़ाइन किया गया एक निष्पादन-आधारित (execution-grounded) बेंचमार्क है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, बहुत बातूनी रोबोट सहायक है। आप उससे लगभग कुछ भी करने के लिए कह सकते हैं: "एक कविता लिखो," "एक छुट्टी की योजना बनाओ," या "मेरे कोड में एक बग ठीक करो।" लेकिन क्या होता है अगर आप उसे आपके पैसे संभालने के लिए कहें?
ब्लॉकचेन की दुनिया में (विशेष रूप से एथेरियम और समान चेन्स में), एक छोटी सी गलती केवल एक टाइपो नहीं है; यह ऐसा है जैसे गलती से अपनी जीवन भर की बचत गलत व्यक्ति को भेज देना। एक बार जब वह पैसा चला गया, तो वह हमेशा के लिए चला गया। वहां कोई "Undo" बटन नहीं है।
यह पेपर इन AI सहायकों के लिए एक नया "ड्राइविंग टेस्ट" पेश करता है, जिसे विशेष रूप से यह देखने के लिए डिज़ाइन किया गया है कि क्या वे ब्लॉकचेन पर वित्तीय लेनदेन को सुरक्षित रूप से संभाल सकते हैं।
यहाँ बताया गया है कि यह कैसे काम करता है, कुछ सरल उपमाओं का उपयोग करते हुए:
1. समस्या: "नकली" बनाम "असली"
पहले, लोग AI कोड को यह जाँचकर टेस्ट करते थे कि शब्द सही उत्तर के समान दिखते हैं या नहीं (जैसे एक शिक्षक स्पेलिंग टेस्ट ग्रेड करता है)।
- पुराना तरीका: यदि AI ने ऐसा कोड लिखा जो टोकन बदलने जैसा दिखता था, लेकिन गणित गलत था, तो उसे अभी भी उच्च ग्रेड मिल सकता था क्योंकि शब्द सही थे।
- वास्तविकता: ब्लॉकचेन में, यदि गणित गलत है, तो पैसा गायब हो जाता है।
- नया तरीका (EVM-QuestBench): केवल उत्तर को पढ़ने के बजाय, यह बेंचमार्क कोड को एक सुरक्षित, सिम्युलेटेड वातावरण में वास्तव में चलाता है। यह आपको एक वास्तविक कार में टेस्ट ड्राइव देने जैसा है (या एक बहुत ही यथार्थवादी सिम्युलेटर में) बजाय इसके कि केवल आपसे कार चलाने के तरीके का वर्णन करने के लिए कहा जाए।
2. टेस्ट संरचना: दो प्रकार की चुनौतियाँ
टेस्ट को दो स्तरों में विभाजित किया गया है, जैसे एक वीडियो गेम के अलग-अलग स्टेज:
स्तर 1: एटॉमिक टास्क (द "सिंगल शॉट")
- उपमा: AI से कहना कि "बॉब को $10 भेजें।"
- टेस्ट: AI को पता (address) सही होना चाहिए, राशि सही होनी चाहिए, और इकाइयाँ (units) सही होनी चाहिए (जैसे, यह जानना कि 1 ETH = 1,000,000,000,000,000,000 "wei" है)।
- लक्ष्य: क्या यह एक सरल कार्य पूरी तरह से कर सकता है?
स्तर 2: कंपोजिट टास्क (द "ऑब्स्टेकल कोर्स")
- उपमा: AI से कहना कि "$100 का ETH को USDT में बदलें, फिर उस USDT को लिक्विडिटी पूल में जोड़ें, और अंत में इसे स्टेक करें।"
- टेस्ट: इसके लिए एक योजना की आवश्यकता होती है। AI केवल स्वैप नहीं कर सकता; उसे पहले खर्च करने की अनुमति (approve) लेनी होगी, फिर स्वैप करना होगा, फिर लिक्विडिटी जोड़नी होगी, फिर स्टेक करना होगा। यदि वह पहले चरण को भूल जाता है, तो पूरा मामला विफल हो जाएगा।
- लक्ष्य: क्या वह बिना भटके एक बहु-चरणीय यात्रा की योजना बना सकता है?
3. डायनेमिक नंबरों का "जादू"
अधिकांश टेस्ट निश्चित नंबरों का उपयोग करते हैं (जैसे, "हमेशा 5 सिक्के भेजें")। यदि AI ने उत्तर "5" याद कर लिया, तो वह पास हो जाएगा।
- EVM-QuestBench की ट्रिक: हर बार जब टेस्ट चलता है, नंबर बेतरतीब ढंग से बदल जाते हैं। एक बार यह "0.37 सिक्के भेजें" हो सकता है, अगली बार "99.12 सिक्के भेजें।"
- क्यों? यह AI को वास्तव में गणित और तर्क को समझने के लिए मजबूर करता है, न कि केवल एक पैटर्न को याद करने के लिए। यह एक गणित शिक्षक की तरह है जो हर टेस्ट पर नंबर बदल देता है ताकि छात्र उत्तर रट न सकें।
4. "सेफ सैंडबॉक्स"
वे वास्तविक पैसा खोए बिना इसे कैसे टेस्ट करते हैं?
- वे एक फोर्क्ड चेन (Forked Chain) का उपयोग करते हैं। वास्तविक ब्लॉकचेन के एक आदर्श, डिजिटल जुड़वां की कल्पना करें। यह बिल्कुल असली चीज़ की तरह दिखता है और व्यवहार करता है, लेकिन यह एक सिमुलेशन है।
- वे AI द्वारा कार्य करने से पहले की स्थिति का एक "स्नैपशॉट" लेते हैं। यदि AI विफल हो जाता है या क्रैश हो जाता है, तो वे बस स्नैपशॉट को रिवाइंड करते हैं और फिर से प्रयास करते हैं। यह एक वीडियो गेम में "सेव स्टेट" की तरह है।
5. परिणाम: कौन पास हुआ?
उन्होंने 20 अलग-अलग AI मॉडल का परीक्षण किया। यहाँ उन्होंने क्या पाया:
- "प्रिसिजन" (सटीकता) वाले मॉडल: कुछ AI एकल कार्यों (स्तर 1) में बहुत अच्छे थे लेकिन लंबी योजनाओं (स्तर 2) में बहुत खराब थे। वे पैसे भेज सकते थे लेकिन जटिल निवेश रणनीति की योजना नहीं बना सकते थे।
- "प्लानर" (योजनाकार) मॉडल: कुछ AI लंबी, जटिल योजनाओं में बहुत अच्छे थे लेकिन साधारण गणित में मूर्खतापूर्ण गलतियाँ करते थे।
- "कोड स्पेशलिस्ट" (कोड विशेषज्ञ): दिलचस्प बात यह है कि विशेष रूप से कोडिंग पर प्रशिक्षित कुछ मॉडल प्लानिंग वाले हिस्सों में विफल रहे। उन्होंने ऐसा कोड लिखा जो दिखने में एकदम सही था लेकिन वे संचालन के क्रम (जैसे घर बनाने से पहले दरवाजा खोलने की कोशिश करना) को नहीं समझ सके।
मुख्य निष्कर्ष
यह पेपर केवल AI मॉडलों को रैंक करने के बारे में नहीं है; यह सुरक्षा के बारे में है।
यह दिखाता है कि केवल इसलिए कि एक AI ऐसा कोड लिख सकता है जो अच्छा दिखता है, इसका मतलब यह नहीं है कि वह वास्तविक धन को संभाल सकता है। हमें एक नए प्रकार के टेस्ट की आवश्यकता है—जो वास्तव में एक यथार्थवादी, बदलते परिवेश में कोड को चलाता है—यह सुनिश्चित करने के लिए कि ये रोबोट अनजाने में हमारे बैंक खातों को खाली न कर दें।
संक्षेप में: EVM-QuestBench क्रिप्टो की दुनिया में AI के लिए "ड्राइवर लाइसेंस परीक्षा" है, जो यह सुनिश्चित करती है कि वे आपके पैसे के साथ हाईवे पर उतरने से पहले वास्तव में कार चलाना जानते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।