← أحدث الأبحاث
💬 NLP

SecureVibeBench: Evaluating Secure Coding Capabilities of Code Agents with Realistic Vulnerability Scenarios

تقدم هذه الورقة SecureVibeBench، وهو معيار مرجعي واقعي مستمد من 41 مشروعًا من مشاريع OSS-Fuzz لتقييم وكلاء الكود البرمجي في البرمجة الآمنة بلغتي C/C++، كاشفةً أن حتى الوكلاء الأعلى أداءً لا يحققون سوى معدل نجاح قدره 23.8% في توليد كود صحيح وآمن في آن واحد.

المؤلفون الأصليون: Junkai Chen, Huihui Huang, Yunbo Lyu, Junwen An, Jieke Shi, Chengran Yang, Ting Zhang, Haoye Tian, Yikun Li, Zhenhao Li, Xin Zhou, Xing Hu, David Lo

نُشر 2026-04-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Junkai Chen, Huihui Huang, Yunbo Lyu, Junwen An, Jieke Shi, Chengran Yang, Ting Zhang, Haoye Tian, Yikun Li, Zhenhao Li, Xin Zhou, Xing Hu, David Lo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحث SECUREVIBEBENCH، مترجم إلى لغة بسيطة مع استخدام تشبيهات إبداعية.

الصورة الكبيرة: مشكلة "المتدرب الخطير"

تخيل أنك وظفت متدرباً ذكياً جداً وسريع التعلم (وهو وكيل برمجة يعمل بالذكاء الاصطناعي - AI Code Agent) لإصلاح الأخطاء البرمجية في برمجيات شركتك. أعطيته قائمة بالمهام، وبدأ هو بالكتابة بسرعة البرق.

ما هي المشكلة؟ بينما هم بارعون في جعل الأشياء تعمل، إلا أنهم سيئون بشكل مفاجئ في جعل الأشياء آمنة. في الواقع، غالباً ما يتسببون في ثغرات أمنية جديدة أثناء محاولتهم إصلاح الثغرات القديمة.

تقدم هذه الورقة البحثية "امتحاناً نهائياً" جديداً يسمى SECUREVIBEBENCH لاختبار هؤلاء المتدربين من الذكاء الاصطناعي. والهدف هو معرفة: إذا وضعنا ذكاءً اصطناعياً في نفس الموقف تماماً الذي ارتكب فيه مبرمج بشري خطأً ما، فهل سيرتكب الذكاء الاصطناعي نفس الخطأ، أم سيكون أفضل حالاً؟


لماذا لم تنجح الاختبارات القديمة (مشكلة "عجلات التدريب")

قبل هذه الورقة، كان الباحثون يختبرون مهارات البرمجة للذكاء الاصطناعي باستخدام سيناريوهات "عجلات التدريب".

  • الطريقة القديمة: كانوا يعطون الذكاء الاصطناعي لغزاً صغيراً ومعزولاً (مثل "أصلح هذا السطر الواحد من العمليات الحسابية"). كان الأمر يشبه مطالبة طاهٍ بتقطيع جزرة واحدة في مطبخ تجريبي.
  • الواقع: هندسة البرمجيات الحقيقية تشبه إدارة مطعم ضخم. عليك التعامل مع مئات المكونات (الملفات)، والتنسيق مع طهاة آخرين (أجزاء أخرى من الكود)، وإصلاح فرن معطل (خطأ برمجي) دون حرق المبنى بأكمله.

كانت الاختبارات القديمة بسيطة للغاية. لم تكن قادرة على كشف حقيقة أن وكلاء الذكاء الاصطناعي يعانون عندما يتعين عليهم تعديل ملفات متعددة في قاعدة بيانات برمجية ضخمة ومعقدة.

الامتحان الجديد: SECUREVIBEBENCH

قام المؤلفون ببناء امتحان واقعي عالي المخاطر باستخدام 105 سيناريو من العالم الحقيقي من مشاريع مفتوحة المصدر شهيرة (مثل OpenSSL). إليك كيف جعلوا هذا الامتحان مميزاً:

1. إعداد "الآلة الزمنية" (السياق الواقعي)

بدلاً من اختلاق مشاكل وهمية، عاد الباحثون بالزمن إلى الوراء. لقد وجدوا اللحظة الدقيقة في التاريخ التي تسبب فيها مبرمج بشري عن طريق الخطأ في إدخال ثغرة أمنية.

  • التشبيه: تخيل محققاً يجد اللحظة الدقيقة التي كسر فيها لص نافذة. بدلاً من أن يطلب من الذكاء الاصطناعي "إصلاح نافذة مكسورة"، يقول له: "هذه هي النافذة قبل أن تُكسر. أصلحها بحيث لا تنكسر مرة أخرى، ولكن لا تكسر أي شيء آخر".
  • التحول: استخدموا "آلة زمن" خاصة (مزيج من التحليل الساكن والديناميكي) لتحديد الموقع الدقيق الذي أدخل هذا الخطأ، مما يضمن مواجهة الذكاء الاصطناعي لنفس حالة الارتباك التي واجهها البشر.

2. تحدي "الملفات المتعددة"

لا يُسمح للذكاء الاصطناعي بمجرد إصلاح ملف واحد. بل يجب عليه التنقل عبر مكتبة ضخمة من الكود (بعض المشاريع تتجاوز 4 ملايين سطر!).

  • التشبيه: الأمر يشبه مطالبة المتدرب بإصلاح تسرب في غواصة. لا يمكنه مجرد رتق الثقب؛ بل يجب عليه فهم صمامات الضغط، وغرفة المحركات، ونظام الملاحة، كل ذلك أثناء تعديل ملفات عبر السفينة بأكملها.

3. نظام التصحيح "التحقق المزدوج"

الامتحان لا يسأل فقط "هل نجح الأمر؟" بل يسأل سؤالين:

  1. هل نجح الأمر؟ (الوظيفية)
  2. هل هو آمن؟ (الأمان)

يستخدم الباحثون نوعين من "المراقبين":

  • مجموعة الاختبار (Test Suite): تقوم بتشغيل الكود لمعرفة ما إذا كان سيتعطل أو يتصرف بشكل صحيح.
  • ماسح الأمان (SAST): وهو محقق آلي يمسح الكود الجديد بحثاً عن أي ثغرات جديدة قد يكون الذكاء الاصطناعي قد تسبب فيها بالخطأ.

النتائج: تقرير "الأخبار الجيدة، والأخبار السيئة"

اختبر الباحثون 5 وكلاء ذكاء اصطناعي مشهورين (مثل SWE-agent و OpenHands) مدعومين بـ 5 "أدمغة" مختلفة (نماذج لغوية كبيرة مثل Claude و GPT).

الأخبار السيئة:
وكلاء الذكاء الاصطناعي سيئون جداً في مسألة الأمان حالياً.

  • حتى أفضل تركيبة (SWE-agent + Claude Sonnet 4.5) حققت نسبة 23.8% فقط من المهام بشكل صحيح وآمن.
  • وهذا يعني أنه مقابل كل 100 مهمة، هناك 76 مهمة نتج عنها كود إما يعطل البرنامج، أو يدخل ثغرات أمنية جديدة، أو كلاهما معاً.
  • التشبيه: الأمر يشبه ميكانيكياً يصلح محرك سيارتك ولكنه ينسى إعادة تركيب المكابح. السيارة ستعمل بسرعة، لكنها ستكون خطيرة.

الأخبار الجيدة:

  • الذكاء الاصطناعي يتحسن في جعل الأشياء تعمل (الوظيفية)، لكنه لا يزال يعاني في جانب الأمان.
  • "شخصيات" الذكاء الاصطناوي المختلفة (النماذج) تفشل بطرق مختلفة. فبعضها جيد في المنطق ولكنه سيء في سلامة الذاكرة، والبعض الآخر عكس ذلك.

لماذا يهم هذا الأمر؟

هذه الورقة البحثية هي بمثابة جرس إنذار.

  • للمبرمجين: لا يمكنك الوثوق بالذكاء الاصطناعي لكتابة كود آمن بعد. أنت بحاجة لمراجعة عملهم، خاصة فيما يتعلق بالأمان.
  • لباحثي الذكاء الاصطناعي: يجب أن نتوقف عن اختبار الذكاء الاصطناعي على ألغاز بسيطة ونبدأ باختباره في الواقع الفوضوي والمعقد لهندسة البرمجيات الحقيقية.

ملخص في جملة واحدة

SECUREVIBEBENCH هو "اختبار ضغط" واقعي يثبت أن مساعدي البرمجة الحاليين من الذكاء الاصطناعي يشبهون المتدربين المتحمسين والمتهورين: يمكنهم إصلاح الأخطاء، لكنهم غالباً ما يكسرون أمن البرمجيات في العملية، ونحن بحاجة إلى طرق أفضل لتعليمهم كيف يكونون آمنين.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →