← नवीनतम पेपर
🤖 AI

SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications

यह शोध पत्र SmartEval को प्रस्तुत करता है, जो 9,000 LLM-जनित सॉलिडिटी (Solidity) अनुबंधों के एक संग्रह, एक पांच-आयामी मूल्यांकन मानदंड और एक प्रमाणित पाइपलाइन से युक्त एक व्यापक बेंचमार्क है, जो विशिष्ट विफलता मोड को प्रकट करता है और यह प्रदर्शित करता है कि LLM-जनित अनुबंध कार्यात्मक अनुपालन में ग्राउंड-ट्रुथ कार्यान्वयन से बेहतर प्रदर्शन कर सकते हैं।

मूल लेखक: Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बॉस हैं जो केवल सरल अंग्रेजी बोलता है, और आप एक डिजिटल बैंक (जिसे "स्मार्ट कॉन्ट्रैक्ट" कहा जाता है) के नियम लिखने के लिए सुपर-स्मार्ट लेकिन शाब्दिक अर्थ समझने वाले रोबोटों को काम पर रखना चाहते हैं। आप रोबोटों से कहते हैं, "यदि कोई पैसा जमा करता है, तो उसे रसीद दें। यदि वे चोरी करने की कोशिश करते हैं, तो दरवाजा लॉक कर दें।"

समस्या यह है कि ये रोबोट निर्देशों का शब्द-दर-शब्द पालन करने में बहुत अच्छे हैं, लेकिन कभी-कभी वे नियमों की भावना (spirit) को समझने में चूक जाते हैं या छोटी-छोटी गलतियाँ कर देते हैं जिससे बैंक क्रैश हो सकता है। वास्तविक दुनिया में, एक बार जब एक डिजिटल बैंक बन जाता है, तो आप इसे बस पैच (सुधार) नहीं कर सकते; यह स्थायी होता है। इसलिए, आपको यह जांचने के लिए कि क्या रोबोटों ने अच्छा काम किया है, उन्हें काम शुरू करने से पहले टेस्ट करने के तरीके की आवश्यकता है।

यह पेपर SmartEval पेश करता है, जो एक विशाल "रिपोर्ट कार्ड" सिस्टम है जिसे इन रोबोट द्वारा लिखे गए डिजिटल कॉन्ट्रैक्ट्स को ग्रेड देने के लिए डिज़ाइन किया गया है।

यहाँ बताया गया है कि यह पेपर इसे सरल उपमाओं (analogies) का उपयोग करके कैसे तोड़ता है:

1. बड़ा टेस्ट (The Benchmark)

शोधकर्ताओं ने 9,000 विभिन्न डिजिटल कॉन्ट्रैक्ट्स वाला एक विशाल टेस्ट ड्राइव तैयार किया।

  • स्रोत (The Source): उन्होंने सरल अंग्रेजी में लिखे गए निर्देशों के 9,000 सेट लिए (जैसे "मुझे अपार्टमेंट के लिए एक रेंटल एग्रीमेंट चाहिए")।
  • रोबोट (The Robots): उन्होंने इन निर्देशों को एक शीर्ष-स्तरीय AI (GPT-4o-mini) को दिया ताकि वह वास्तविक कोड जेनरेट कर सके।
  • विशेषज्ञ (The Experts): उन्होंने मानव विशेषज्ञों से भी इन्हीं समान कॉन्ट्रैक्ट्स के "परफेक्ट" संस्करण लिखवाए।
  • लक्ष्य: यह देखने के लिए कि किसका काम बेहतर है, रोबोट के काम की तुलना विशेषज्ञ के काम से करना।

2. ग्रेडिंग सिस्टम (The Rubric)

केवल "पास" या "फेल" कहने के बजाय, SmartEval पाँच विशिष्ट चीजों पर कॉन्ट्रैक्ट्स को ग्रेड देने के लिए एक पाँच-सितारा रेटिंग सिस्टम का उपयोग करता है:

  1. क्या उन्होंने सब कुछ किया जो पूछा गया था? (Functional Completeness)
  2. क्या उन्होंने चीजों के लिए सही नामों का उपयोग किया? (Variable Fidelity)
  3. क्या लॉजिक (तर्क) सही ढंग से प्रवाहित हुआ? (State Machine Correctness) — इसे ऐसे समझें जैसे यह सुनिश्चित करना कि ट्रैफिक लाइट ग्रीन से येलो और फिर रेड पर जाए, न कि ग्रीन से सीधे रेड पर।
  4. क्या उन्होंने बिजनेस नियमों को सही ढंग से समझा? (Business Logic Fidelity) — यह सबसे महत्वपूर्ण हिस्सा है, जैसे यह सुनिश्चित करना कि किराया वास्तव में वसूला जा रहा है।
  5. क्या कोड साफ और अच्छी तरह से लिखा गया है? (Code Quality)

3. "सेफ्टी नेट" पाइपलाइन (The "Safety Net" Pipeline)

शोधकर्ताओं ने केवल AI से कोड लिखने और उम्मीद करने के बजाय कि सब ठीक होगा, एक "फैक्ट्री लाइन" बनाई जिसमें एक सुरक्षा निरीक्षक (safety inspector) भी शामिल था:

  • चरण 1: एक "अनुवादक" (Translator) आपके अंग्रेजी वाक्य को एक सख्त ब्लूप्रिंट में बदल देता है।
  • चरण 2: "बिल्डर" (Builder) AI उस ब्लूप्रिंट के आधार पर कोड लिखता है।
  • चरण 3: "निरीक्षक" (Inspector) AI सुरक्षा खामियों की जांच करता है (जैसे कोई चोर ताला खोलने की कोशिश कर रहा हो)।
  • जादुई गेट (The Magic Gate): यदि निरीक्षक को कोई गंभीर समस्या (मध्यम या उच्च गंभीरता वाली) मिलती है, तो कोड फैक्ट्री से बाहर नहीं जा सकता। इसे सुधारने के लिए एक "रिफाइनर" (Refiner) AI के पास वापस भेजा जाता है, और फिर इसे दोबारा चेक किया जाता है। यह लूप तब तक चलता रहता है जब तक कोड सुरक्षित न हो जाए।

4. आश्चर्यजनक परिणाम

जब उन्होंने रोबोट कॉन्ट्रैक्ट्स की तुलना मानव विशेषज्ञ कॉन्ट्रैक्ट्स से की, तो कुछ दिलचस्प हुआ:

  • रोबोट जीते (कागजों पर): AI-जेनरेटेड कॉन्ट्रैक्ट्स ने वास्तव में मानव-लिखित कॉन्ट्रैक्ट्स की तुलना में अधिक (लगभग 8 अंक) स्कोर किया।
  • क्यों? रोबोट अत्यधिक शाब्दिक (literal) थे। यदि आपने कहा "एक बटन जोड़ें," तो उन्होंने एक बटन जोड़ दिया। उन्होंने निर्देशों का पूरी तरह से पालन किया।
  • मानवीय बढ़त (The Human Edge): मानव विशेषज्ञ कभी-कभी कोड को तेज़ या सस्ता बनाने के लिए (गैस फीस बचाने के लिए) "शॉर्टकट" लेते हैं, या चीजों को अधिक व्यवस्थित करते हैं ताकि यह अधिक साफ दिखे। क्योंकि परीक्षण सटीक निर्देशों का पालन करने के बारे में सख्त था, इसलिए इंसानों ने बहुत अधिक रचनात्मक या कुशल होने के कारण अंक खो दिए।
  • पेंच (The Catch): रोबोट जटिल कार्यों में संघर्ष करते थे। जब निर्देश बहुत लंबे और जटिल हो जाते थे (जैसे 8+ अलग-अलग नियमों वाला कॉन्ट्रैक्ट), तो रोबोट गलतियाँ करने लगते थे, और कोड अक्सर फेल (compile failure) हो जाता था।

5. क्या ग्रेडिंग सिस्टम ने काम किया?

शोधकर्ता चिंतित थे: "क्या AI खुद को ही ग्रेड दे रहा है?" यह साबित करने के लिए कि वे धोखाधड़ी नहीं कर रहे थे, उन्होंने तीन जाँच कीं:

  1. मानव जाँच (Human Check): कोलंबिया यूनिवर्सिटी के तीन पीएचडी विशेषज्ञों ने 30 कॉन्ट्रैक्ट्स को ग्रेड दिया। उनके स्कोर AI के स्कोर से लगभग पूरी तरह मेल खा गए (0.34 अंक के भीतर)।
  2. टूल जाँच (Tool Check): उन्होंने कोड को एक मानक, गैर-AI सुरक्षा स्कैनर (Slither) के माध्यम से चलाया। AI ऑडिटर और टूल सुरक्षा मुद्दों पर 79% समय सहमत थे।
  3. "क्या होगा अगर" टेस्ट (The "What If" Test): उन्होंने अपनी फैक्ट्री लाइन के कुछ हिस्सों (जैसे सुरक्षा निरीक्षक) को बंद कर दिया और देखा कि गुणवत्ता गिर गई। इससे यह साबित हुआ कि उनके सिस्टम का हर हिस्सा वास्तव में आवश्यक था।

निष्कर्ष (The Bottom Line)

SmartEval यह परीक्षण करने का एक नया, विश्वसनीय तरीका है कि क्या AI सुरक्षित, काम करने वाले डिजिटल कॉन्ट्रैक्ट लिख सकता है। इसने पाया कि हालांकि AI निर्देशों का शाब्दिक रूप से पालन करने में अद्भुत है, फिर भी यह बहुत जटिल, बहु-चरणीय लॉजिक (logic) के साथ संघर्ष करता है। इस प्रणाली ने यह भी सिद्ध किया कि एक "सुरक्षा निरीक्षक" और एक "सुधार लूप" (fix-it loop) जोड़कर, आप एक अव्यवस्थित, त्रुटिपूर्ण AI को एक विश्वसनीय कोड जनरेटर में बदल सकते हैं जो अकेले काम करने वाले एकल मानव विशेषज्ञ की तुलना में अधिक सुरक्षित है।

महत्वपूर्ण नोट: पेपर स्वीकार करता है कि हालांकि कोड सही दिखता है और चलता है, लेकिन उन्होंने यह परीक्षण नहीं किया है कि क्या कॉन्ट्रैक्ट वास्तव में सही व्यवहार करते हैं जब वास्तविक पैसा एक लाइव वातावरण में घूम रहा होता है। वे यह भी नोट करते हैं कि AI अभी तक यह नहीं जानता कि मानव विशेषज्ञ की तरह पैसे (गैस फीस) कैसे बचाएं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →