← أحدث الأبحاث
🤖 AI

CrackMeBench: Binary Reverse Engineering for Agents

تقدم هذه الورقة CrackMeBench، وهو معيار مرجعي جديد مصمم لتقييم قدرات وكلاء النماذج اللغوية في إجراء الهندسة العكسية الثنائية بشكل مستقل لاستعادة منطق التحقق وتوليد مدخلات صالحة لتحديات نمط CrackMe التعليمية، مما يظهر مستويات متفاوتة من النجاح عبر النماذج المختلفة في كل من المهام العامة والمولدة.

المؤلفون الأصليون: Isaac David, Arthur Gervais

نُشر 2026-05-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Isaac David, Arthur Gervais

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك صندوقاً مغلقاً. لا تملك المفتاح، ولا تملك المخططات التي بُني بها القفل. ليس لديك سوى الصندوق نفسه. هدفك هو معرفة التشكيلة الدقيقة من الأرقام أو الكلمات أو الإجراءات التي ستجعل هذا الصندوق يفتح.

هذا هو التحدي الجوهري لـ الهندسة العكسية للبرامج الثنائية (Binary Reverse Engineering)، وهو المشكلة المحددة التي صُمم اختبار جديد يسمى CrackMeBench لحلها بالنسبة للذكاء الاصطناعي.

إليك شرح مبسط لما يدور حوله البحث، باستخدام تشبيهات من الحياة اليومية.

المشكلة: اختبار "الصندوق الأسود"

معظم اختبارات البرمجة للذكاء الاصطناعي اليوم تشبه إعطاء طالب وصفة (كود المصدر) وطلب إصلاح خطأ مطبعي أو إضافة مكون جديد. لكن في عالم الأمن السيبراني الحقيقي، غالباً لا تحصل على الوصفة، بل تحصل فقط على الكعكة الجاهزة (البرنامج المترجم/Compiled Program).

سأل الباحثون: هل يمكن للذكاء الاصطناعي أن ينظر إلى برنامج جاهز ومغلق، ويكتشف كيف يعمل هذا "القفل"، ثم يصنع المفتاح الدقيق لفتحه؟

ولاختبار ذلك، ابتكروا CrackMeBench. فكر فيه كأنه "غرفة هروب" (Escape Room) مؤتمتة وضخمة للذكاء الاصطناعي.

  • الغرفة: بيئة رقمية معزولة وآمنة (حاوية Docker) حيث لا يمكن للذكاء الاصطناعي التواصل مع الإنترنت الخارجي.
  • الأدوات: يُعطى الذكاء الاصطناعي صندوق أدوات محدد (مثل مفك براغي، عدسة مكبرة، أو مترجم أكواد) ويُخبر بدقة ما هي الأدوات التي يمتلكها. لا يمكنه التخمين؛ بل يجب عليه استخدام ما هو مدرج في القائمة فقط.
  • الهدف: يجب على الذكاء الاصطناعي إنتاج "مفتاح". قد يكون هذا المفتاح كلمة مرور، أو ملفاً، أو نصاً برمجياً (Script) يقوم بتوليد رقم تسلسلي.
  • الحكم: هناك "حكم" خفي (Oracle). لا يحصل الذكاء الاصطناعي على نقاط لكتابة مقال طويل يشرح فيه كيف يعتقد أن القفل يعمل، بل يحصل على النقاط فقط إذا فُتح القفل بالفعل عند تجربة مفتاحه.

الاختبار: 20 لغزاً مختلفاً

بنى الباحثون اختباراً يحتوي على 20 "قفلاً" (مهمة):

  1. 8 ألغاز عامة: وهي بمثابة ألغاز كلاسيكية معروفة تم حلها من قبل البشر سابقاً، وتعمل كأداة "معايرة" للتأكد من أن الاختبار عادل ومفهوم.
  2. 12 لغزاً جديداً: تم إنشاؤها حديثاً من قبل الباحثين. تتراوح هذه الألغاز من "سهلة" (مثل العثور على كلمة مخفية في ملف نصي) إلى "صعبة" (حيث يتغير شكل القفل أثناء النظر إليه، أو يخفي أسراره حتى يبدأ في العمل).

النتائج: من فاز في غرفة الهروب؟

وضع الباحثون ثلاثة نماذج مختلفة من الذكاء الاصطناعي في هذه الغرفة مع مهلة زمنية قدرها 5 دقائق. منحوا كل ذكاء اصطناعي ثلاث فرص لتقديم مفتاح.

إليكم كيفية أدائهم في الألغاز الـ 12 الجديدة والأكثر صعوبة:

  • GPT-5.5 (الأفضل أداءً): حل 11 من أصل 12 لغزاً. كان مثل صانع أقفال ماهر استطاع بسرعة فهم الآلية وفتح القفل.
  • Claude Opus 4.7 (المستوى المتوسط): حل 7 من أصل 12 لغزاً. كان جيداً، لكنه تعثر أحياناً في محاولة فهم المنطق الداخلي للقفل.
  • Kimi K2 (المتعثر): حل 5 من أصل 12 لغزاً. غالباً ما قضى وقتاً طويلاً في النظر إلى القفل دون أن يحاول أبداً تجربة المفتاح.

الألغاز "العامة" كانت أكثر صعوبة:
عندما حاول الذكاء الاصطناعي حل الألغاز الثمانية الكلاسيكية العامة، انخفضت الدرجات بشكل كبير للجميع. حتى أفضل ذكاء اصطناعي (GPT-5.5) حل 3 من أصل 8 فقط. وهذا يشير إلى أنه بينما يتحسن الذكاء الاصطناعي في هذه المهام، إلا أن الألغاز الواقعية والمعقدة لا تزال صعبة للغاية.

لماذا هذا مهم (وفقاً للورقة البحثية)

تسلط الورقة الضوء على بعض الاختلافات الرئيسية بين هذا الاختبار وغيره:

  • لا وجود لـ "الحشو": في العديد من الاختبارات، يمكن للذكاء الاصطناعي الحصول على درجة عالية عبر كتابة قصة مقنعة جداً عن كيفية حله للمشكلة، حتى لو كانت القصة خاطئة. هنا، إذا لم يفتح القفل، يفشل الذكاء الاصطناعي. الأمر كله يتعلق بالنتائج، وليس بالشروحات.
  • تحدي "مولد المفاتيح" (Keygen): بعض الألغاز لم تطلب مجرد كلمة مرور واحدة، بل طلبت من الذكاء الاصطناعي كتابة آلة يمكنها توليد كلمات مرور لأي مستخدم. هذا يشبه طلب بناء مصنع لصناعة المفاتيح من الذكاء الاصطناعي، وليس مجرد فتح قفل واحد. كان على الذكاء الاصطناعي فهم النمط، وليس مجرد حفظ إجابة واحدة.
  • عامل "الضجيج": تضمنت الألغاز الأصعب "ضجيجاً"، مثل تلميحات مزيفة أو أكواد تتغير أثناء التشغيل. وكان GPT-5.5 الأفضل في تجاهل الضجيج والتركيز على الآلية الحقيقية.

الخلاصة

CrackMeBench هو لوحة نتائج جديدة وصارمة للذكاء الاصطناعي. إنه يثبت أنه بينما يصبح الذكاء الاصطناعي بارعاً جداً في قراءة الأكواد وإصلاح البرمجيات، فإنه لا يزال يتعلم كيفية تفكيك برنامج جاهًا ومترجم وفهم كيفية كسر حمايته.

تخلص الورقة إلى أننا نحرز تقدماً، ولكن لا تزال هناك فجوة كبيرة بين ما يمكن للذكاء الاصطناء فعله مع "الوصفة" (كود المصدر) وما يمكنه فعله مع "الطبق الجاهز" (الملف التنفيذي الثنائي). ويوفر هذا الاختبار طريقة واضحة وقابلة للتكرار لقياس مدى سرعة إغلاق هذه الفجوة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →