SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers
تقدم هذه الورقة SCDBench، وهو عبارة عن مجموعة بيانات معيارية ومنهجية تقييم شاملة صُممت لتقييم أدوات إلغاء تجميع العقود الذكية القائمة على النماذج اللغوية الكبيرة (LLMs) بدقة، من خلال الكشف عن أنه في حين يمكن للنماذج الرائدة توليد كود قابل للتجميع، إلا أنها تعاني حالياً في تحقيق الاتساق الدلالي، حيث نجح أفضل نموذج في إلغاء تجميع 42 عقداً فقط من أصل 600 عقد من العقود الحقيقية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك كعكة لذيذة ومعقدة (عقد ذكي) قام شخص ما بخبزها وحبسها داخل صندوق معتم ومحكم الإغلاق. يمكنك رؤية الصندوق، ويمكنك حتى هزّه لتسمع صوت ارتطام المكونات ببعضها (الشيفرة البرمجية - Bytecode)، لكن لا يمكنك رؤية الوصفة.
في عالم البلوكشين، هذه "الوصفة" هي الكود الأصلي الذي كتبه المطور. لسوء الحظ، معظم هذه الصناديق لا تُفتح أبداً، وتضيع وصفاتها. لفهم ما بداخل الصندوق أو لمعرفة ما إذا كانت الكعكة آمنة للأكل، نحتاج إلى "إلغاء تجميع" (Decompile) الصندوق، أي هندسة عكسية للصندوق وكتابة الوصفة مرة أخرى.
لفترة طويلة، حاولنا القيام بذلك باستخدام أدوات قديمة وجامدة تنتج ملاحظات فوضوية وصعبة القراءة. مؤخراً، بدأنا في استخدام مساعدين أذكياء للغاية (نماذج اللغات الكبيرة - LLMs) للقيام بهذه المهمة. هذه الذكاءات الاصطناعية بارعة في قراءة "صوت الارتطام" داخل الصندوق وكتابة وصفة تبدو مثالية وتعمل بالفعل في المطبخ. ولكن تكمن المشكلة هنا: كيف نعرف ما إذا كان الذكاء الاصطناعي قد أعاد إنشاء نفس الكعكة تماماً، أم أنه صنع كعكة تشبهها فحسب؟
هنا يأتي دور ورقة بحثية تسمى SCDBench.
المشكلة: فخ "الكعكة المزيفة"
يوضح المؤلفون أن الاختبارات الحالية لهذه الأدوات التي تلغي التجميع بالذكاء الاصطناعي تشبه الحكم على الكعكة من خلال رائحتها فقط. قد ينظرون إلى الوصفة التي كتبها الذكاء الاصطناعي ويقولون: "مهلاً، تبدو هذه وصفة كعكة صالحة!". لكنهم لا يخبزونها فعلياً ويتذوقونها ليروا ما إذا كانت تطابق الأصل.
مع ظهور الذكاء الاصطناعي الفائق الذكاء، أصبح هذا الأمر خطيراً. يمكن للذكاء الاصطناعي كتابة وصفة:
- تبدو مثالية على الورق.
- يمكن خبزها (تُجمّع بنجاح).
- تحتوي على العدد الصحيح من البيض والدقيق (تطابق الواجهة البرمجية).
- لكن طعمها مختلف تماماً (المنطق البرمโปรجي خاطئ).
إذا وثقت بتلك الوصفة المزيفة، فقد تخسر أموالك أو أمنك. نحن بحاجة إلى طريقة لاختبار ما إذا كانت وصفة الذكاء الاصطناعي تنتج نفس النتيجة تماماً مثل الأصلية.
الحل: SCDBench (اختبار التذوق النهائي)
قام المؤلفون ببناء "اختبار تذوق" جديد يسمى SCDBench. وهو تحدٍ معياري يتكون من 600 "صندوق" من العالم الحقيقي (عقود ذكية) يعرفون وصفاتها مسبقاً.
لقد أنشأوا "سلماً من 4 خطوات" لتقييم أداء الذكاء الاصطناعي. يجب على الذكاء الاصطناعي تسلق كل درجة للحصول على درجة ناجحة:
- فحص التنسيق (هل اتبعت التعليمات؟): هل كتب الذكاء الاصطناعي الوصفة بالتنسيق الصحيح؟ هل تضمن درجة حرارة الفرن واسم الكعكة؟ إذا كانت الوصفة فوضوية أو ناقصة الأجزاء، فسيفشل هنا.
- قابلية التجميع (هل يمكنك الخبز؟): هل تعمل الوصفة فعلياً في مطبخ حقيقي؟ إذا حاولت خبزها، هل ستنفجر، أم ستخرج ككعكة متماسكة؟ العديد من نماذج الذكاء الاصطناعي تكتب وصفات تبدو جيدة ولكن يستحيل خبزها.
- استعادة الواجهة (هل لديك المكونات الصحيحة؟): هل تطلب الوصفة نفس المكونات الموجودة في الأصل تماماً؟ إذا كانت الكعكة الأصلية تحتوي على طبقة "شوكولاتة" ونسيت وصفة الذكاء الاصطناعي ذلك، أو أضافت طبقة "حارة" لم تكن موجودة، فستفشل.
- الاتساق الدلالي (اختبار التذوق): هذا هو الجزء الأهم. يأخذ المؤلفون وصفة الذكاء الاصطناعي، ويخبزون الكعكة، ثم يتذوقونها مقارنة بالأصلية. يقومون بتشغيل "اختبارات تذوق" محددة (مدخلات) على كلتا الكعكتين. إذا تفاعلت كعكة الذكاء الاصطناعي بشكل مختلف (على سبيل المثال، تذوب بينما تظل الأصلية متماسكة)، فإن الذكاء الاصطناعي يفشل. هذه هي الخطوة الأصعب.
النتائج: الذكاء الاصطناعي جيد، لكنه ليس مثالياً
اختبر المؤلفون ثلاثة من أفضل نماذج الذكاء الاصطناعي (Claude Opus، وGPT-5، وGLM-5) في هذا التحدي. وإليكم ما وجدوه:
- الذكاء الاصطناعي يتحسن في كتابة الوصفات: يمكن للنماذج الرائدة كتابة وصفات تبدو مثالية ويمكن حتى خبزها (تجميعها) في معظم الأوقات.
- خدعة "الإصلاح": عندما كتبت وصفة بها خطأ بسيط ولكنها كانت تعمل تقريباً، سمح الباحثون للذكاء الاصطناح بمحاولة إصلاحها مرة واحدة. ساعدت خطوة "الإصلاح الذاتي" هذه كثيراً، حيث حولت العديد من الوصفات المكسورة إلى وصفات تعمل.
- اختبار التذوق لا يزال صعباً: حتى أفضل نماذج الذكاء الاصطناعي فشلت في اختبار التذوق النهائي لمعظم العقود.
- من بين 600 عقد، نجح أفضل نموذج في إعادة إنشاء المنطق بدقة لـ 42 عقداً فقط (أقل من 7%).
- بالنسبة للعقود الأكثر تعقيداً، كان معدل النجاح أقل من ذلك بكثير.
الخلاصة الكبرى
تخلص الورقة البحثية إلى أنه بينما يبدع الذكاء الاصطناعي في جعل العقود الذكية تبدو وتُجمع بشكل صحيح، إلا أنه لا يزال يكافح لفهم المنطق العميق والخفي الذي يجعلها تعمل تماماً مثل الأصل.
فكر في الأمر على هذا النحو: الذكاء الاصطناعي هو طاهٍ بارع يمكنه نسخ مظهر الطبق بشكل مثالي، لكنه لا يزال يتعلم كيفية تكرار النكهة الدقيقة لوصفة عائلية سرية. وحتى يتمكن الذكاء الاصطناعي من اجتياز "اختبار التذوق" (الاتساق الدلالي) باستمرار، لا يمكننا الوثوق به تماماً لإجراء هندسة عكسية لهذه العقود الرقمية لأغراض الأمن أو الشفافية.
SCDB% هو الأداة المعيارية الجديدة التي تجبر هذه النماذج على إثبات أنها لا تكتفي بالتظاهر فقط، وذلك من خلال جعلها تجتاز اختبار التذوق الصارم المكون من أربع خطوات.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.