SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers
यह शोध पत्र SCDBench प्रस्तुत करता है, जो एक व्यापक बेंचमार्क डेटासेट और मूल्यांकन पद्धति है जिसे LLM-आधारित स्मार्ट कॉन्ट्रैक्ट डीकंपाइलर्स का कठोरता से आकलन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि हालांकि फ्रंटियर मॉडल कंपाइलेबल कोड उत्पन्न कर सकते हैं, वे वर्तमान में सिमेंटिक निरंतरता (semantic consistency) प्राप्त करने में संघर्ष करते हैं, जिसमें सर्वश्रेष्ठ मॉडल केवल 600 वास्तविक दुनिया के कॉन्ट्रैक्ट्स में से 42 को सही ढंग से डीकंपाइल कर पाया।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक स्वादिष्ट, जटिल केक है (एक स्मार्ट कॉन्ट्रैक्ट) जिसे किसी ने बनाया है और एक सीलबंद, अपारदर्शी डिब्बे के अंदर बंद कर दिया है। आप डिब्बे को देख सकते हैं, और आप इसे हिलाकर भी सुन सकते हैं कि उसके अंदर सामग्री खड़खड़ा रही है (यह बाइटकोड है), लेकिन आप उसकी रेसिपी नहीं देख सकते।
ब्लॉकचेन की दुनिया में, यह "रेसिपी" डेवलपर द्वारा लिखा गया मूल कोड है। दुर्भाग्य से, ऐसे अधिकांश डिब्बे कभी खोले नहीं जाते, और रेसिपी खो जाती है। इस डिब्बे के अंदर क्या है या क्या यह केक खाने के लिए सुरक्षित है, यह समझने के लिए हमें इसे डीकंपाइल (decompile) करने की आवश्यकता है: यानी डिब्बे का रिवर्स-इंजीनियरिंग करना और रेसिपी को फिर से लिखना।
लंबे समय तक, हमने इसे पुराने, कठोर उपकरणों के साथ करने की कोशिश की जो अव्यवस्थित, पढ़ने में कठिन नोट्स तैयार करते थे। हाल ही में, हमने इन कामों को करने के लिए सुपर-स्मार्ट एआई असिस्टेंट (लार्ज लैंग्वेज मॉडल्स, या LLMs) का उपयोग करना शुरू किया है। ये एआई डिब्बे की "खड़खड़ाहट" को पढ़ने और एक ऐसी रेसिपी लिखने में माहिर हैं जो एकदम सही दिखती है और वास्तव में रसोई में काम भी करती है। लेकिन समस्या यह है: हम यह कैसे जानें कि क्या एआई ने वास्तव में बिल्कुल वही केक दोबारा बनाया है, या सिर्फ एक ऐसा केक बनाया है जो दिखने में असली जैसा लगता है?
यहीं पर SCDBench नाम का पेपर काम आता है।
समस्या: "नकली केक" का जाल
लेखक बताते हैं कि इन एआई डीकंपाइलर्स के लिए मौजूदा परीक्षण केवल केक की खुशबू से उसे आंकने जैसा है। वे एआई द्वारा लिखी गई रेसिपी को देख सकते हैं और कह सकते हैं, "अरे, यह तो एक वैध केक रेसिपी लग रही है!" लेकिन वे वास्तव में उसे बेक (bake) करके नहीं देखते कि क्या वह मूल से मेल खाती है।
इन नए, सुपर-स्मार्ट एआई के साथ, यह खतरनाक है। एक एआई ऐसी रेसिपी लिख सकता है जो:
- कागज पर एकदम सही दिखती है।
- जिसे बेक किया जा सकता है (कंपाइल हो सकती है)।
- जिसमें अंडे और आटे की सही मात्रा है (इंटरफेस से मेल खाती है)।
- लेकिन उसका स्वाद पूरी तरह से अलग है (लॉजिक/तर्क गलत है)।
यदि आप उस नकली रेसिपी पर भरोसा करते हैं, तो आप अपना पैसा या सुरक्षा खो सकते हैं। हमें यह परीक्षण करने के तरीके की आवश्यकता है कि क्या एआई की रेसिपी मूल के समान ही परिणाम देती है।
समाधान: SCDBench (अंतिम स्वाद परीक्षण)
लेखकों ने एक नया "स्वाद परीक्षण" बनाया है जिसे SCDBench कहा जाता है। यह एक मानकीकृत चुनौती है जिसमें 600 वास्तविक दुनिया के "डिब्बे" (स्मार्ट कॉन्ट्रैक्ट्स) हैं जिनकी रेसिपी वे पहले से जानते हैं।
उन्होंने एआई के प्रदर्शन को ग्रेड देने के लिए एक 4-चरणीय सीढ़ी (4-Step Ladder) बनाई है। एआई को पास होने के लिए हर पायदान पर चढ़ना होगा:
- फॉर्मेट चेक (क्या आपने निर्देशों का पालन किया?): क्या एआई ने रेसिपी सही प्रारूप में लिखी है? क्या इसमें ओवन का तापमान और केक का नाम शामिल है? यदि रेसिपी अव्यवस्थित है या इसके हिस्से गायब हैं, तो यह यहीं फेल हो जाता है।
- कंपिलेटैबिलिटी (क्या आप इसे बेक कर सकते हैं?): क्या रेसिपी वास्तव में एक असली रसोई में काम करती है? यदि आप इसे बेक करने की कोशिश करते हैं, तो क्या यह फट जाती है, या यह एक ठोस केक के रूप में निकलती है? कई एआई ऐसी रेसिपी लिखते हैं जो अच्छी दिखती हैं लेकिन उन्हें बेक करना असंभव होता है।
- इंटरफेस रिकवरी (क्या आपके पास सही सामग्री है?): क्या रेसिपी में ठीक उतनी ही सामग्री है जितनी मूल में थी? यदि मूल केक में "चॉकलेट" की एक परत थी और एआई की रेसिपी में वह छूट गई, या उसने एक "मसालेदार" परत जोड़ दी जो वहां नहीं थी, तो यह फेल हो जाता है।
- सिमेंटिक कंसिस्टेंसी (स्वाद परीक्षण): यह सबसे महत्वपूर्ण है। लेखक एआई की रेसिपी लेते हैं, केक को बेक करते हैं, और फिर मूल के विरुद्ध इसका स्वाद चखते हैं। वे दोनों केक पर विशिष्ट "स्वाद परीक्षण" (इनपुट) चलाते हैं। यदि एआई का केक अलग तरह से प्रतिक्रिया करता है (उदाहरण के लिए, मूल केक के सख्त रहने के दौरान एआई का केक पिघल जाता है), तो एआई फेल हो जाता है। यह सबसे कठिन चरण है।
परिणाम: एआई अच्छे हैं, लेकिन पूर्ण नहीं
लेखकों ने इस चुनौती पर तीन शीर्ष-स्तरीय एआई मॉडल (Claude Opus, GPT-5, और GLM-5) का परीक्षण किया। यहाँ उन्होंने क्या पाया:
- एआई रेसिपी लिखने में बेहतर हो रहे हैं: शीर्ष मॉडल ऐसी रेसिपी लिख सकते हैं जो एकदम सही दिखती हैं और अधिकांश समय उन्हें कंपाइल भी किया जा सकता है।
- "रिपेयर" (सुधार) का तरीका: जब एआई ने एक ऐसी रेसिपी लिखी जो लगभग काम कर रही थी लेकिन उसमें एक छोटी सी टाइपिंग त्रुटि थी, तो शोधकर्ताओं ने एआई को एक बार उसे ठीक करने का मौका दिया। इस "सेल्फ-रिपेयर" (स्वयं सुधार) चरण ने बहुत मदद की, जिससे कई टूटी हुई रेसिपी काम करने योग्य रेसिपी में बदल गईं।
- स्वाद परीक्षण अभी भी कठिन है: भले ही सबसे अच्छे एआई मॉडल अधिकांश कॉन्ट्रैक्ट्स के लिए अंतिम टेस्ट में फेल हो गए।
- 600 कॉन्ट्रैक्ट्स में से, सबसे अच्छे मॉडल ने केवल 42 के लिए लॉजिक को पूरी तरह से दोबारा बनाया (7% से भी कम)।
- सबसे कठिन कॉन्ट्रैक्ट्स के लिए, सफलता दर और भी कम थी।
मुख्य निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि हालांकि एआई स्मार्ट कॉन्ट्रैक्ट्स को सही दिखने और कंपाइल होने में सक्षम बनाने में अद्भुत है, लेकिन इसे ठीक उसी तरह काम करने वाले गहरे, छिपे हुए लॉजिक को समझने में संघर्ष करना पड़ता है जैसा कि मूल में था।
इसे इस तरह सोचें: एआई एक शानदार शेफ है जो किसी व्यंजन के दिखावट की नकल पूरी तरह से कर सकता है, लेकिन वह अभी भी एक गुप्त पारिवारिक रेसिपी के सटीक स्वाद को दोहराना सीख रहा है। जब तक एआई लगातार "स्वाद परीक्षण" (सिमेंटिक कंसिस्टेंसी) पास नहीं कर लेता, हम सुरक्षा या पारदर्शिता के लिए इन डिजिटल कॉन्ट्रैक्ट्स को रिवर्स-इंजीनियर करने के लिए इस पर पूरी तरह भरोसा नहीं कर सकते।
SCDBench वह नया मानक उपकरण है जो इन एआई को यह साबित करने के लिए मजबूर करता है कि वे केवल दिखावा नहीं कर रहे हैं, बल्कि उन्हें इस कठोर, चार-चरणीय स्वाद परीक्षण को पास करना होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।