← أحدث الأبحاث
🤖 AI

SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications

تقدم هذه الورقة SmartEval، وهو معيار شامل يتميز بمتن يضم 9,000 عقد Solidity من إنشاء النماذج اللغوية الكبيرة، ومعيار تقييم خماسي الأبعاد، ومسار عمل تم التحقق من صحته يكشف عن أنماط فشل مميزة بينما يوضح أن العقود التي أنشأتها النماذج اللغوية الكبيرة يمكن أن تتفوق على التنفيذات الحقيقية في الالتزام الوظيفي.

المؤلفون الأصليون: Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah

نُشر 2026-05-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك مدير يتحدث لغة إنجليزية بسيطة، وتريد توظيف فريق من الروبوتات فائقة الذكاء ولكنها حرفية للغاية لكتابة قواعد بنك رقمي (عقد ذكي). تخبر الروبوتات: "إذا أودع شخص ما مالاً، أعطه إيصالاً. إذا حاول السرقة، أغلق الباب".

المشكلة هي أن هذه الروبوتات بارعة جداً في اتباع التعليمات حرفياً، لكنها قد تغفل أحياناً عن "روح القواعد" أو ترتكب أخطاءً صغيرة قد تؤدي إلى انهيار البنك. في العالم الحقيقي، بمجرد بناء بنك رقمي، لا يمكنك مجرد إصلاحه؛ إنه أمر دائم. لذلك، أنت بحاجة إلى طريقة لاختبار ما إذا كانت الروبوتات قد قامت بعمل جيد قبل أن تتركها تدير المشهد.

تقدم هذه الورقة البحثية SmartEval، وهو نظام "تقرير درجات" ضخم مصمم لتقييم العقود الرقمية التي كتبتها الروبوتات.

إليك كيف تفصل الورقة ذلك، باستخدام تشبيهات بسيطة:

1. الاختبار الكبير (المعيار المرجعي)

أنشأ الباحثون تجربة قيادة ضخمة شملت 9,000 عقد رقمي مختلف.

  • المصدر: أخذوا 9,000 مجموعة من التعليمات المكتوبة بلغة إنجليزية بسيطة (مثل "أريد اتفاقية إيجار لشقة").
  • الروبوتات: قاموا بتغذية هذه التعليمات لنظام ذكاء اصطناعي رفيع المستوى (GPT-4o-mini) لتوليد الكود الفعلي.
  • الخبراء: جعلوا خبراً بشريين يكتبون النسخ "المثالية" لنفس هذه العقود.
  • الهدف: مقارنة عمل الروبوت بعمل الخبير لمعرفة من أدى بشكل أفضل.

2. نظام التقييم (المسطرة)

بدلاً من مجرد قول "ناجح" أو "راسب"، يستخدم SmartEval نظام تقييم بخمس نجوم لتقييم العقود بناءً على خمسة أشياء محددة:

  1. هل نفذوا كل ما طُلب منهم؟ (الاكتمال الوظيفي)
  2. هل استخدموا الأسماء الصحيحة للأشياء؟ (دقة المتغيرات)
  3. هل تدفقت المنطق بشكل صحيح؟ (صحة آلة الحالة) — فكر في هذا كالتأكد من أن إشارة المرور تنتقل من الأخضر إلى الأصفر ثم الأحمر، وليس من الأخضر إلى الأحمر مباشرة.
  4. هل أصابوا قواعد العمل؟ (دقة منطق العمل) — هذا هو الجزء الأهم، مثل التأكد من تحصيل الإيجار بالفعل.
  5. هل الكود نظيف ومكتوب جيداً؟ (جودة الكود)

3. خط إنتاج "شبكة الأمان"

لم يكتفِ الباحثون بسؤال الذكاء الاصطناعي لكتابة الكود والأمل في الأفضل. بل بنوا خط إنتاج مع مفتش سلامة:

  • الخطوة 1: يقوم "المترجم" بتحويل جملتك الإنجليزية إلى مخطط هندسي صارم.
  • الخطوة 2: يقوم الذكاء الاصطناعي "الباني" بكتابة الكود بناءً على هذا المخطط.
  • الخطوة 3: يقوم الذكاء الاصطناعي "المفتش" بالتحقق من الثغرات الأمنية (مثل لص يحاول فتح القفل).
  • البوابة السحرية: إذا وجد المفتش مشكلة خطيرة (بدرجة "متوسطة" أو "عالية")، لا يمكن للكود أن يغادر المصنع. يتم إرساله عائداً إلى ذكاء اصطناعي "مُحسِّن" لإصلاح الخطأ، ثم يتم فحصه مرة أخرى. تستمر هذه الحلقة حتى يصبح الكود آمناً.

4. النتائج المفاجئة

عندما قارنوا عقود الروبوتات بعقود الخبراء البشر، حدث شيء مثير للاهتمام:

  • الروبوتات فازت (على الورق): سجلت العقود التي أنشأها الذكاء الاصطناعي بالفعل درجات أعلى (بمقدار 8 نقاط تقريباً) من تلك التي كتبها البشر.
  • لماذا؟ كانت الروبوتات حرفية للغاية. إذا قلت لها "أضف زراً"، أضافت زراً. لقد اتبعت التعليمات بدقة.
  • التفوق البشري: الخبراء البشر أحياناً "يختصرون الطرق" لجعل الكود أسرع أو أرخص (لتوفير رسوم "الغاز/الوقود")، أو يعيدون تنظيم الأشياء لجعلها تبدو أكثر نظافة. ولأن الاختبار كان صارماً بشأن اتباع التعليمات بالضبط، فقد خسر البشر نقاطاً بسبب كونهم مبدعين أو فعالين للغاية.
  • العقبة: واجهت الروبوتات صعوبة في المهام المعقدة. عندما أصبحت التعليمات طويلة ومعقدة للغاية (مثل عقد يحتوي على 8 قواعد مختلفة أو أكثر)، بدأت الروبوتات في ارتكاب الأخطاء، وغالباً ما فشل الكود في العمل (الامتثال للترجمة البرمجية).

5. هل نجح نظام التقييم؟

كان الباحثون قلقين: "هل يقوم الذكاء الاصطناعي بتقييم نفسه؟" ولإثبات أنهم لم يغشوا، قاموا بثلاثة فحوصات:

  1. الفحص البشري: قام ثلاثة خبراء من حملة الدكتوراه من جامعة كولومبيا بتقييم 30 عقداً من العقود. تطابقت درجاتهم مع درجات الذكاء الاصطناعي بشكل شبه مثالي (في حدود 0.34 نقطة).
  2. فحص الأدوات: قاموا بتشغيل الكود عبر ماسح أمني قياسي غير معتمد على الذكاء الاصطناعي (يسمى Sliter). اتفق المدقق الآلي والأداة على المشكلات الأمنية بنسبة 79% من المرات.
  3. اختبار "ماذا لو": قاموا بإيقاف أجزاء من خط الإنتاج الخاص بهم (مثل مفتش السلامة) ورأوا كيف انخفضت الجودة. أثبت هذا أن كل جزء من نظامهم كان ضرورياً بالفعل.

الخلاصة

SmartEval هو طريقة جديدة وموثوقة لاختبار ما إذا كان بإمكان الذكاء الاصطناعي كتابة عقود رقمية آمنة وتعمل. وقد وجد أن الذكاء الاصطناعي، رغم براعته المذهلة في اتباع التعليمات حرفياً، لا يزال يعاني مع المنطق المعقد متعدد الخطوات. كما أثبت النظام أنه من خلال إضافة "مفتش سلامة" و"حلقة إصلاح"، يمكنك تحويل ذكاء اصطناعي فوضوي وكثير الأخطاء إلى مولد كود موثوق به وأكثر أماناً من خبير بشري واحد يعمل بمفرده.

ملاحظة هامة: تقر الورقة بأنه بينما يبدو الكود صحيحاً ويعمل برمجياً، إلا أنهم لم يختبروا ما إذا كانت العقود ستتصرف بشكل صحيح عند تحرك أموال حقيقية في بيئة حية. كما يشيرون أيضاً إلى أن الذكاء الاصطناعي لا يعرف بعد كيفية توفير المال (رسوم الغاز) مثل الخبير البشري.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →