EVM-QuestBench: An Execution-Grounded Benchmark for Natural-Language Transaction Code Generation
تقدم هذه الورقة EVM-QuestBench، وهو معيار تقييم قائم على التنفيذ صُمم لتقييم سلامة ودقة توليد كود المعاملات من اللغة الطبيعية على السلاسل المتوافقة مع EVM بصرامة، وذلك من خلال اختبار ديناميكي قائم على التفرع (fork-based testing) لـ 107 مهمة ذرية ومركبة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك مساعداً آلياً ذكياً جداً، وكثير الكلام. يمكنك أن تطلب منه فعل أي شيء تقريباً: "اكتب قصيدة"، "خطط لرحلة عطلة"، أو "أصلح خطأً في الكود الخاص بي". ولكن ماذا يحدث إذا طلبت منه التعامل مع أموالك؟
في عالم البلوكشين (تحديداً إيثيريوم والشبكات المشابهة لها)، الخطأ الصغير ليس مجرد خطأ مطبعي؛ بل هو كأن ترسل مدخرات حياتك بالخطأ إلى الشخص الخطأ. وبمجرد ضياع هذا المال، فإنه يضيع للأبد. لا يوجد زر "تراجع".
تقدم هذه الورقة البحثية EVM-QuestBench، وهو "اختبار قيادة" جديد لهؤلاء المساعدين الآليين، مصمم خصيصاً لمعرفة ما إذا كان بإمكانهم التعامل بأمان مع المعاملات المالية على البلوكشين.
إليك تفصيل لكيفية عمله، باستخدام بعض التشبيهات البسيطة:
1. المشكلة: "الشكلي" مقابل "الحقيقي"
في السابق، كان الناس يختبرون كود الذكاء الاصطناعي من خلال التحقق مما إذا كانت الكلمات تبدو مشابهة للإجابة الصحيحة (مثل معلم يصحح اختبار إملاء).
- الطريقة القديمة: إذا كتب الذكاء الاصطناعي كوداً يبدو وكأنه يقوم بتبديل الرموز (tokens)، لكن الحسابات الرياضية كانت خاطئة، فقد يحصل على درجة عالية لأن الكلمات كانت صحيحة.
- الواقع: في البلوكشين، إذا كانت الرياضيات خاطئة، يختفي المال.
- الطريقة الجديدة (EVM-QuestBench): بدلاً من مجرد قراءة الإجابة، يقوم هذا الاختبار بتشغيل الكود فعلياً في بيئة محاكاة آمنة. الأمر يشبه إعطاء الذكاء الاصطناعي تجربة قيادة في سيارة حقيقية (أو محاكي واقعي جداً) بدلاً من مجرد سؤاله عن كيفية القيادة.
2. هيكل الاختبار: نوعان من التحديات
ينقسم الاختبار إلى مستويين، مثل ألعاب الفيديو ذات المراحل المختلفة:
المستوى 1: المهام الذرية (الطلقة الواحدة)
- التشبيه: طلب "أرسل 10 دولارات إلى بوب".
- الاختبار: يجب على الذكاء الاصطناعي ضبط العنوان الصحيح، والمبلغ الصحيح، والوحدات الصحيحة (على سبيل المثال، معرفة أن 1 ETH = 1,000,000,000,000,000,000 "wei").
- الهدف: هل يمكنه القيام بشيء واحد بسيط بإتقان تام؟
المستوى 2: المهام المركبة (مضمار العقبات)
- التشبيه: طلب "استبدل 100 دولار من ETH بـ USDT، ثم أضف ذلك الـ USDT إلى مجمع سيولة، وأخيراً قم بعملية الرهن (staking)".
- الاختبار: هذا يتطلب خطة. لا يمكن للذكاء الاصطناعي القيام بالتبديل فحسب؛ بل يجب عليه أولاً الموافقة على الإنفاق، ثم التبديل، ثم إضافة السيولة، ثم الرهن. إذا نسي الخطوة الأولى، سيفشل الأمر برمته.
- الهدف: هل يمكنه وضع خطة لرحلة متعددة الخطوات دون أن يضل الطريق؟
3. "سحر" الأرقام الديناميكية
معظم الاختبارات تستخدم أرقاماً ثابتة (مثلاً: "أرسل دائماً 5 عملات"). إذا حفظ الذكاء الاصطناعي الإجابة "5"، فسوف ينجح.
- خدعة EVM-QuestBench: في كل مرة يعمل فيها الاختبار، تتغير الأرقام عشوائياً. مرة قد يكون "أرسل 0.37 عملة"، وفي المرة التالية "أرسل 99.12 عملة".
- لماذا؟ هذا يجبر الذكاء الاصطناعي على فهم الرياضيات والمنطق فعلياً، بدلاً من مجرد حفظ نمط معين. إنه يشبه معلم الرياضيات الذي يغير الأرقام في كل اختبار حتى لا يتمكن الطلاب من حفظ الإجابات فقط.
4. "المنطقة الآمنة" (Sandbox)
كيف يختبرون هذا دون خسارة أموال حقيقية؟
- يستخدمون سلسلة منسوخة (Forked Chain). تخيل توأماً رقمياً مثالياً للبلوكشين الحقيقي. يبدو ويعمل تماماً مثل الشيء الحقيقي، لكنه مجرد محاكاة.
- يأخذون "لقطة" (snapshot) لحالة الشبكة قبل أن يحاول الذكاء الاصطناعي تنفيذ مهمة ما. إذا فشل الذكاء الاصطناعي أو تعطل، يقومون ببساطة بإعادة اللقطة وتجربة الأمر مجدداً. الأمر يشبه "حفظ الحالة" (Save State) في ألعاب الفيديو.
5. النتائج: من الذي نجح؟
قاموا باختبار 20 نموذجاً مختلفاً من نماذج الذكاء الاصطناعي. وإليكم ما وجدوه:
- نماذج "الدقة": بعض نماذج الذكاء الاصطناعي كانت رائعة في المهام الفردية (المستوى 1) ولكنها سيئة جداً في التخطيط للتسلسلات الطويلة (المستوى 2). كان بإمكانها إرسال الأموال ولكن لم يكن بإمكانها التخطيط لاستراتيجية استثمارية معقدة.
- نماذج "التخطيط": بعض نماذج الذكاء الاصطناعي كانت رائعة في الخطط الطويلة والمعقدة ولكنها ارتكبت أخطاءً سخيفة في الرياضيات البسيطة.
- متخصصو "الكود": من المثير للاهتمام أن بعض النماذج التي تم تدريبها خصيصاً على البرمجة فشلت في أجزاء التخطيط. لقد كتبوا كوداً يبدو مثالياً ولكنهم لم يستطيعوا فهم ترتيب العمليات (مثل محاولة فتح الباب قبل بناء المنزل).
الخلاصة الكبرى
هذه الورقة البحثية لا تتعلق فقط بتصنيف نماذج الذكاء الاصطناعي؛ بل تتعلق بـ الأمان.
إنها توضح أنه لمجرد قدرة الذكاء الاصطناعي على كتابة كود يبدو جيداً، لا يعني بالضرورة أنه يستطيع التعامل مع أموال حقيقية. نحن بحاجة إلى نوع جديد من الاختبارات—نوع يقوم بتشغيل الكود فعلياً في بيئة واقعية ومتغيرة—للتأكد من أن هذه الروبوتات لن تفرغ حساباتنا المصرفية عن طريق الخطأ.
باختصار: EVM-QuestBench هو "اختبار رخصة القيادة" للذكاء الاصطناعي في عالم الكريبتو، لضمان قدرتهم على قيادة السيارة فعلياً قبل السماح لهم بدخول الطريق السريع بأموالك.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.