← أحدث الأبحاث
💻 computer science

Security-First Evaluation of Text-to-Terraform: Benchmarking LLMs and SLMs for Secure IaC Generation

تقوم هذه الورقة البحثية بقياس أداء سبعة نماذج لغوية كبيرة وصغيرة في توليد كود "Terraform" آمن لخدمات "AWS"، مما يكشف أن الصلاحية النحوية والامتثال الأمني هما خاصيتان متعامدتان إلى حد كبير، وأن الفحص الآلي متعدد الأدوات يظل ضرورياً بغض النظر عن أداء النموذج أو استراتيجيات هندسة الأوامر.

المؤلفون الأصليون: Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego Kreutz

نُشر 2026-08-05
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Francis Luis Santos Vargas, Rodrigo Brandão Mansilha, Diego Kreutz

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تبني مدينة ضخمة غير مرئية في السماء، مصنوعة بالكامل من طوب رقمي. في العالم الحقيقي، إذا بنيت منزلاً بأساس متذبذب أو تركت الباب الأمامي مفتوحاً على مصراعيه، فستكون الكارثة محققة. في العالم الرقمي، تُسمى هذه "المدينة" بالسحابة (The Cloud)، وتُكتب المخططات المستخدمة لبنائها بلغة خاصة تُسمى "البنية التحتية ككود" (Infrastructure-as-Code - IaC). فكر في الـ IaC كأنها وصفة دقيقة للغاية تخبر الحواسيب بالضبط كيفية إعداد الخوادم، والتخزين، وأقفال الأمان. لفترة طويلة، كان البشر هم من يكتبون هذه الوصفات، لكنهم غالباً ما ارتكبوا أخطاءً، مما ترك الأبواب الرقمية مفتوحة وسمح للأشرار بالتسلل.

مؤخراً، وصل نوع جديد من المساعدين: الذكاء الاصطناعي. وتحديداً، النماذج اللغوية الكبيرة (LLMs) وأقرباؤها الأصغر والأسرع، وهي النماذج اللغوية الصغيرة (SLMs). هذه النماذج تشبه روبوتات ذكية جداً يمكنها قراءة ملايين الوصفات ومحاولة كتابة وصفات جديدة لك في ثوانٍ معدودة. السؤال الكبير الذي يشغل بال الجميع هو: هل تستطيع روبوتات الذكاء الاصطناعي هذه كتابة وصفات ليست فقط "صحيحة" (لكي لا ينهار المبنى)، ولكن أيضاً "آمنة" (لكي لا يتمكن أحد من الاقتحام)؟ الأمر يشبه التساؤل عما إذا كان بإمكان طباخ آلي خبز كعكة مذاقها جيد وفي الوقت نفسه لا تحتوي بالخطأ على قنبلة مخفية. إذا ضبطت الآلة قواعد اللغة (Syntax) ولكنها نسيت وضع الأقفال، فإن المدينة بأكملها ستكون في خطر. هذا هو اللغز الذي سعى فريق من الباحثين من البرازيل لحله.

مسابقة الطاهي الآلي العظيم

قرر الباحثون وضع سبعة طهاة مختلفين من الذكاء الاصطناعي تحت الاختبار في مطبخ عملاق يسمى "السحابة". لم يطلبوا من الروبوتات مجرد كتابة وصفة؛ بل طلبوا منها كتابة 17 نوعاً مختلفاً من الوصفات لبناء هياكل رقمية آمنة باستخدام أداة تسمى "تيرارفورم" (Terraform). اختبروا ثلاثة نماذج من "الأدمغة الكبيرة" (النماذج المغلقة والمكلفة مثل Claude Opus 4، وGPT-5.4، وGemini 2.5 Pro) وأربعة نماذج من "الأدمغة الجيبية" (النماذج مفتوحة المصدر والأصغر مثل WizardCoder وCodeLlama).

ولمعرفة مدى جودة هذه الوصفات، لم يكتفِ الفريق بفحصها بأعينهم، بل بنوا خط تفتيش آلي صارم للغاية. أولاً، تحققوا مما إذا كانت الوصفة صحيحة لغوياً (الصلاحية النحوية/Syntactic Validity)؛ فإذا كانت الوصفة تحتوي على أخطاء إملائية، فلن يبدأ البناء أصلاً. لكن الاختبار الحقيقي جاء بعد ذلك: حيث قاموا بتشغيل ماسحين أمنيّين مختلفين، هما Checkov وTrivy، واللذان يعملان كحراس أمن رقميين يبحثون عن النوافذ المفتوحة، والأبواب غير المقفلة، والفخاخ المخفية. كما اختبروا ما إذا كان بإمكان الروبوتات إصلاح أخطائها عندما يُقال لها: "مهلاً، لقد تركت باباً مفتوحاً"، وما إذا كان إعطاؤها تعليمات أكثر تفصيلاً حول الأمان سيساعد فعلياً.

النتائج الصادمة: قواعد لغوية ممتازة، أقفال سيئة

هنا تكمن المفاجأة التي وجدها الباحثون، وهي بمثابة تحول في الحبكة: كتابة وصفة مثالية وكتابة وصفة آمنة هما مهارتان مختلفتان تماماً.

اكتشفوا أنه لمجرد أن الذكاء الاصطناعي يمكنه كتابة وصفة "تيرارفورم" سليمة لغوياً وتعمل دون أن تنهار، فهذا لا يعني بالضرورة أن الوصفة آمنة. في الواقع، المهاراتتان غير مرتبطتين ببعضهما تقريباً. أحد النماذج الأصغر، وهو WizardCoder-33B، كان بطلاً في القواعد؛ فقد كتب وصفات صالحة بنسبة 77.8% من المرات! ولكن عندما فحص حراس الأمن تلك الوصفات، فشل النموذج في كل اختبار أمني. كان الأمر أشبه بطاهٍ صنع كعكة جميلة وذات شكل مثالي، لكنه نسي وضع غطاء على جرة السم بداخلها.

من ناحية أخرى، قدمت "الأدمغة الكبيرة" أداءً أفضل بكثير، لكنها كانت لا تزال بحاجة إلى الكثير من المساعدة. فأفضل نموذج في الأداء، وهو Claude Opus 4، لم يتمكن من كتابة وصفة آمنة بالكامل إلا بنسبة 23% تقريباً عندما أُعطي تعليمات أساسية. ومع ذلك، عندما منح الباحثون النموذج قائمة مراجعة أمنية محددة ومفصلة (بإخباره بالضبط أي الأقفال يجب تركيبها وأي الإنذارات يجب ضبطها)، قفز أداؤه إلى 92.5% لأحد أنواع الماسحات الأمنية. أثبت هذا أنه رغم قدرة "الأدمغة الكبيرة" على القيام بالمهمة، إلا أنها لن تفعل الشيء الصحيح ما لم تخبرها بالضبط بما يجب فعله.

"الأدمغة الجيبية" تصطدم بالحائط

أما النماذج الأصغر (SLMs)، فقد اصطدمت بحائط صلب. فمهما حاول الباحثون إعطاءها تعليمات أمنية مفصلة، لم تستطع النماذج الصغيرة المضي قدماً في تنفيذها. فإما أن تكتب وصفة معطلة، أو تكتب وصفة صالحة ولكنها غير آمنة تماماً. وجد الباحثون أنه بالنسبة لهذه النماذج الصغيرة، لم تكن المشكلة في التعليمات، بل في أن هذه النماذج ببساطة لا تملك "القدرة الذهنية" لفهم القواعد الأمنية المعقدة. إنها بارعة في نسخ الأنماط، لكنها تعاني في ابتكار حلول آمنة من تلقاء نفسها.

هل يمكنهم إصلاح أخطائهم؟

اختبر الفريق أيضاً ما إذا كان بإمكان الروبوتات التعلم من أخطائها. تركوا الروبوتات تكتب وصفة، ثم قاموا بمسحها أمنياً، ثم أظهروا للروبوت قائمة بالأخطاء (مثل "لقد نسيت تشفير هذا الملف") وسألوه أن يحاول مرة أخرى.

  • الأخبار الجيدة: كانت الروبوتات جيدة بشكل مفاجئ في إصلاح الأخطاء البسيطة والمحددة التي اكتشفها ماسح Trivy (مثل نقص قفل في باب معين). بل وتحسن أداء العديد من النماذج بشكل ملحوظ بعد رؤية قائمة الأخطاء.
  • الأخبار السيئة: كانت الروبوتات سيئة جداً في إصلاح المشكلات الهيكلية الكبيرة التي اكتشفها ماسح Checkov. كانت هذه المشكلات تتعلق بأمور مثل "أنت بحاجة إلى بناء نظام أمني كامل لهذا المبنى". لم تستطع الروبوتات إعادة تصميم هيكلها العملي في خطوة واحدة. يمكنها شد برغي مرتخٍ، لكنها لا تستطيع إعادة تصميم الأساس.

الخلاصة

أهم استنتاج يمكن الخروج به من هذه الدراسة هو تحذير لأي شخص يفكر في السماح للذكاء الاصطناعي ببناء مدنه الرقمية: لا يمكنك الوثوق بالذكاء الاصطناعي ليكون هو حارس الأمن.

وجد الباحثون أنه بين عامي 2024 و2026، أصبح نماذج الذكاء الاصطناعي أفضل بكثير في كتابة كود "يبدو صحيحاً"، لكنها لم تصبح أفضل في كتابة كود "آمن". في الواقع، الفجوة بين "يبدو جيداً" و"هو آمن" قد اتسعت بالفعل.

تخلص الدراسة إلى أنه لا يمكنك مجرد سؤال الذكاء الاصطناعي "اجعل هذا آمناً" وتوقع الأفضل. حتى أذكى نماذج الذكاء الاصطناعي تحتاج إلى بشر (أو نظام آلي صارم للغاية) للتدقيق في عملها. يجب عليك تشغيل ماسحات أمنية متعددة على كل كود يولده الذكاء الاصطناعي، بغض النظر عن مدى جودة النموذج أو مدى تفصيل تعليماتك. الذكاء الاصطناعي مساعد قوي، ولكنه في عالم أمن السحابة، ليس بديلاً لمفتش السلامة بعد. إذا تخطيت مرحلة التفتيش، فقد ينتهي بك الأمر بمدينة رقمية جميلة ومبنية بإتقان، ولكن لا توجد أقفال على أبوابها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →