AgentPort-Bench: A Controlled Seven-Framework Evaluation of Agentic AI Security Portability
تقدم هذه الورقة تقييماً قائماً على سبعة أطر عمل مضبوطة يوضح أنه في حين أن نوع الهجوم واختيار النموذج يؤثران بشكل كبير على أمن وكلاء النماذج اللغوية الكبيرة (LLMs) المستخدمة للأدوات، فإن اختيار إطار عمل التنسيق لا يؤثر عموماً بشكل ملموس على الوضع الأمني، باستثناء حالة CrewAI التي تظهر ارتفاعاً طفيفاً ولكن ذا دلالة إحصائية في معدلات الفشل حتى بعد تصحيح عيب محدد في المهايئ.
تخيل عالماً لا يكتفي فيه الذكاء الاصطناعي بالإجابة على الأسئلة، بل يتخذ إجراءات فعلية: كحجز الرحلات الجوية، أو إدارة الحسابات المصرفية، أو تنظيم جداول زمنية معقدة عبر استخدام الأدوات الرقمية نيابة عنا. هذه هي الأنظمة "الوكيلة" (agentic)، وهي تزداد شيوعاً بشكل متزايد. ولبناء هذه الأنظمة، يعتمد المهندسون على أطر عمل برمجية — وهي في الأساس مجموعات أدوات تعمل كوسيط بين عقل الذكاء الاصطناعي والعالم الخارجي. ويبرز سؤال جوهري لأي شخص يقوم ببناء أو تدقيق هذه الأنظمة: هل يهم اختيار هذا الوسيط من أجل الأمن؟ إذا حاول مخترق خداع الذكاء الاصطناعي بأمر خبيث، فهل يغير نوع مجموعة الأدوات المستخدمة لتوصيل هذا الأمر طريقة استجابة الذكاء الاصطناعي؟ أم أن سلامة الذكاء الاصطناعي تتحدد بالكامل تقريباً من خلال النموذج نفسه وطبيعة الهجوم، بغض النظر عن الغلاف البرمجي المحيط به؟ هذا السؤال يقع في قلب تحقيق جديد واسع النطاق سعى لحسم الجدل بالبيانات الصلبة بدلاً من النظرية.
لق sense البحث من خلال إجراء تجربة محكومة ضخمة شملت تسعة آلاف وثلاثمائة وستين تجربة منفصلة. حيث وضعوا سبعة أطر عمل مختلفة وشائعة للذكاء الاصطناعي في مواجهة اتصال مباشر بالذكاء الاصطناعي، مما خلق ثماني حالات متميزة لمعرفة ما إذا كان إطار العمل سيحدث فرقاً. ولضمان اختبار عادل، استخدموا ستة نماذج ذكاء اصطناعي مختلفة من ثلاثة مزودين رئيسيين، وأخضعوها لخمس عائلات مختلفة من الهجمات، تتراوح من الخداع البسيط إلى المحاولات المعقدة لاختطاف أهداف النظام. ومن الأهمية بمكان أن الفريق لم يفترض فقط أن الهجمات يتم تسليمها بنفس الطريقة؛ بل تحققوا من كل رسالة "بايت ببايت" للتأكد من أن المحتوى الخبيث الذي وصل إلى عقل الذكاء الاصطناعي كان متطابقاً في كل سيناريو. سمحت هذه الدقة العالية بعزل إطار العمل كالمتغير الوحيد الذي يتغير، مما أزال أي ارتباك ناتج عن كيفية قيام البرمجيات بإعادة كتابة الهجوم عن طريق الخطأ.
كانت النتائج واضحة بشكل صارخ: لم يكن لاختيار إطار العمل أي تأثير يذكر على وقوع الذكاء الاصطناعي في فخ الهجوم. ووجد الباحثون أن نوع الهجوم ونموذج الذكاء الاصطناعي المحدد المستخدم كانا العاملين المهيمنين، حيث فسرا الغالبية العظمى من الاختلافات في النتائج. وفي المقابل، فسر اختيار إطار العمل حصة من النتائج صغيرة جداً لدرجة أنها لا يمكن تمييزها إحصائياً عن الصفر. وللتأكد من ذلك، طبق الفريق اختبارات إحصائية صارمة مصممة لإثبات أن أي اختلافات لم تكن مجرد غير مرئية، بل غير موجودة عملياً. وقد أكدوا أنه في معظم الحالات، فإن استبدال إطار عمل بآخر لن يغير بشكل ملموس الموقف الأمني للنظام. وهذا يشير إلى أن الفرق الأمنية يجب أن تركز طاقتها على فهم النماذج والتهديدات المحددة التي تواجهها، بدلاً من القلق بشأن مجموعة الأدوات البرمجية التي تستخدمها.
ومع ذلك، كشفت الدراسة عن استثناء واحد محدد تطلب عناية دقيقة. فقد أظهر أحد أطر العمل، وهو "CrewAI"، ميلاً صغيراً ولكنه حقيقي إحصائياً ليكون أقل أماناً بقليل من الآخرين، حتى بعد أن قام الباحثون بإصلاح خطأ معروف حيث كانت تعليماته الداخلية مختلفة عن البقية عن طريق الخطأ. كان هذا الفرق المتبقي ضئيلاً من الناحية المطلقة ولا يزال يقع ضمن النطاق الذي يعتبر مهملًا من الناحية العملية، ولكنه كان إطار العمل الوحيد الذي برز عن المجموعة. كما اكتشف الباحثون نمط فشل منفصل ومثير للاهتمام، حيث يقوم نموذج ذكاء اصطناعي معين، عند مواجهته لمطالبة (prompt) معقدة، باستهلاك جميع موارده الحوسبية المتاحة في التفكير الداخلي بصمت دون إنتاج أي مخرجات على الإطلاق. حدث هذا باستمرار عبر أطر عمل مختلفة، مما أثبت أنه سمة من سمات النموذج نفسه، وليس البرمجيات التي تغلفه.
في الختن، يقدم هذا العمل إجابة عالية الثقة لسؤال هندسي عملي. فهو يوضح أن أمن الوكيل الذكي لا يتشكل بشكل ملموس بواسطة إطار عمل التنسيق (orchestration framework) بالنسبة لأنواع الهجمات والأدوات التي تم اختبارها. وتؤكد الدراسة أن برنامج "الوسيط" شفاف إلى حد كبير أمام المخاطر الأمنية، وأن سلوك الذكاء الاصطناعي نفسه وطبيعة الهجوم هما المحركان الحقيقيان للسلامة. وبينما أظهر إطار عمل واحد خللاً طفيفاً ومستمراً، فإن الصورة العامة هي صورة استقرار: اختيار إطار العمل ليس قراراً أمنياً أساسياً. بدلاً من ذلك، فإن العمل الحقيقي المتمثل في الحفاظ على سلامة هؤلاء الوكلاء يكمن في فهم النماذج التي يشغلونها والطرق المحددة التي يمكن التلاعب بها، وهو استنتاج يقدم مساراً واضحاً للمطورين والمراجعين على حد سواء.
ملخص تقني: AgentPort-Bench
بيان المشكلة
تتناول الورقة البحثية سؤالاً حاسماً في أمن الذكاء الاصطناٍعي الوكيل (Agentic AI): هل يؤثر اختيار إطار عمل التنسيق (مثل LangChain أو CrewAI أو AutoGen) بشكل ملموس على الموقف الأمني لنموذج لغوي كبير (LLM) يستخدم الأدوات، بمعزل عن النموذج الأساسي والهجوم المحدد؟ في حين أن معايير التقييم الحالية مثل AgentDojo تقيس المتانة ضمن أطر عمل مفردة، إلا أنها لا تعزل إطار العمل نفسه كمتغير مستقل. وغالباً ما تفشل المقارنات السابقة بين أطر العمل (مثل Nguyen و Husain) في التحقق من تسليم حمولة الهجوم (attack payload) بشكل متطابق عبر طبقات التكيف (adapter layers) المختلفة، مما يترك الباب مفتوحاً لاحتمالية أن تكون الفوارق الأمنية الملحوظة مجرد نتاج لاختلافات في قوالب التلقين (prompt templating) بدلاً من كونها تأثيرات حقيقية ناتجة عن إطار العمل نفسه.
المنهجية
تستخدم الدراسة، AgentPort-Bench، تصميماً موحداً للتقييم لضبط متغير إطار العمل.
النطاق التجريبي: يشمل التقييم سبعة أطر عمل لتنسيق الوكلاء (LangChain، CrewAI، AutoGen، LlamaIndex، OpenAI Agents SDK، Google Agent Development Kit، Semantic Kernel) بالإضافة إلى خط أساس مباشر عبر واجهة برمجة التطبيقات (direct-API baseline)، بإجمالي ثمانية ظروف تنفيذ.
النماذج والهجمات: تختبر الدراسة ستة نماذج عبر ثلاثة مزودين (Anthropic، OpenAI، Google) وفئتين من القدرات (رخيصة ورائدة/frontier)، وتخضع لـ خمس عائلات من الهجمات مصنفة وفقاً لتصنيف مبادرة أمن الوكلاء (ASI) للتهديدات.
جمع البيانات: تتكون مجموعة البيانات من 9,36ó تجربة تم جمعها في جولتين: جولة أولية (7,020 تجربة، 5 أطر عمل) وجولة تمديد (2,340 تجربة، إطارا عمل إضافيان).
التحقق من تطابق الحمولة: الابتكار المنهجي الأساسي هو التحقق من الحمولة بايت مقابل بايت (byte-for-byte payload verification). يقوم النظام بتسجيل المحتوى الدقيق المرسل إلى واجهة برمجة تطبيقات النموذج ومقارنته بحمولة الهجوم الأصلية. أي اختلاف (مثل إعادة صياغة مطالبات النظام، أو إضافة تعليمات) يُعامل كعيب في "المُكيِّف" (adapter defect) يجب إصلاحه، وليس كخاصية لإطار العمل.
التحليل الإحصائي: تقدم الورقة معالجة إحصائية موحدة تجمع بين:
تفكيك التباين الكلاسيكي (Classical Variance Decomposition): اختبار ANOVA واختبارات التبديل (permutation tests) على مجموعة فرعية متوازنة.
النمذجة ذات التأثيرات المختلطة (Mixed-Effects Modeling): الانحدار اللوجستي الرتبي ونماذج التأثيرات الخطية المختلطة (مع فواصل التلقين العشوائية) المطبقة على مجموعة البيانات الكاملة لمراعاة القياسات المتكررة والنتائج الرتبية (نجاح/غير متأكد/فشل/ثغرة).
اختبار التكافؤ (Equivalence Testing): اختبار (TOST) محدد مسبقاً لتحديد ما إذا كانت تأثيرات إطار العمل ضئيلة عملياً (ضمن هامش تأثير صغير محدد بـ Cohen's d = 0.2)، بدلاً من مجرد كونها غير قابلة للتمييز إحصائياً عن الصفر.
المساهمات الرئيسية
أكبر تقييم مضبوط عابر لأطر العمل: تقدم الورقة أكبر مقارنة مضبوطة من نوعها، حيث توحد 9,360 تجربة عبر سبعة أطر عمل، ستة نماذج، وخمس عائلات هجمات في مجموعة بيانات واحدة.
التحقق من تطابق الحمولة كشرط مسبق: تثبت الدراسة ضرورة التحقق من الحمولة على مستوى البايت. اكتشفت هذه المنهجية وصححت عيباً في مُكيِّف CrewAI، حيث استخدم بناء الوكيل الافتراضي مطالبات نظام متباينة (تتضمن كلمة "safely" وشخصية أطول) مما أدى إلى تحيز النتائج. بعد التصحيح، تمت إعادة جمع 1,170 تجربة.
إطار إحصائي متقدم: تعد هذه الدراسة الأولى التي تطبق النمذجة ذات التأثيرات المختلطة واختبار التكافؤ الرسمي في هذا المجال. وهذا يسمح للمؤلف بالانتقال من مجرد "الفشل في رفض الفرضية الصفرية" إلى الادعاء الفعلي بأن تأثيرات إطار العمل ضئيلة عملياً.
استثناءات محددة النطاق بدقة: تحدد الورقة ارتفاعاً متبقياً ذا دلالة إحصائية في النتائج غير الناجحة (non-PASS) لـ CrewAI حتى بعد إصلاح عيب المُكيِّف. هذا التأثير صغير، ومنتظم عبر جميع الظروف، ولا يتفاعل مع إضافة أطر عمل جديدة.
اكتشاف أنماط فشل غير أمنية: كشف التقييم عن فشل حتمي في استنفاد رموز الاستدلال (reasoning-token-exhaustion) في النموذج الرائد gpt-5.5 ضد مطالبة معينة (استهلاك كامل ميزانية الرموز في الاستدلال غير المرئي) وعدم تطابق في وحدات محاسبة الرموز (token-accounting units mismatch) بين Google ADK وSemantic Kernel، مما قد يؤدي إلى مقارنات تكلفة زائفة إذا لم يتم تصحيحه.
النتائج
إسناد التباين: في اختبار ANOVA الكلاسيكي (المجموعة الفرعية المتوازنة)، تفسر عائلة الهجوم (Attack Family) الجزء الأكبر من تباين النتائج (28.0–28.7%)، يليه اختيار النموذج (Model Choice) (4.1%). أما اختيار إطار العمل (Framework Choice) فيفسر حصة لا يمكن تمييزها عن الصيد (0.05%).
اختبار التكافؤ: تقع جميع التباينات الثنائية البالغ عددها 28 بين ظروف التنفيذ الثمانية ضمن هامش التأثير الصغير المحدد مسبقاً. وهذا يدعم الادعاء بأن اختيار إطار العمل ضئيل عملياً فيما يتعلق بالنتائج الأمنية في نموذج التهديد هذا.
بقايا CrewAI: بينما التأثير الإجمالي لإطار العمل ضئيل، يظل CrewAI استثناءً خاصاً. فحتى بعد إصلاح عيب المُكيِّف، فإنه يحتفظ بارتفاع صغير ولكن ذي دلالة إحصائية في النتائج غير الناجحة مقارنة بجميع الظروف الأخرى. ومع ذلك، فإن هذا التأثير صغير بما يكفي للبقاء ضمن هامش التكافؤ.
أنماط الفشل: أظهر نموذج gpt-5.5 معدل فشل بنسبة 100% (استنفاد رموز الاستدلال) تجاه مطالبة معينة عبر أطر العمل المضافة حديثاً، مما يشير إلى ثغرة خاصة بالنموذج بدلاً من خلل في تنفيذ إطار العمل.
الأهمية والادعاءات
تدعي الورقة أنه بالنسبة لنموذج التهديد، والنماذج، وأطر العمل التي تم تقييمها، فإن الموقف الأمني للوكيل لا يتحدد بشكل ملموس من خلال اختيار إطار عمل التنسيق، بشرط التحقق من تسليم الحمولة والتحكم فيه.
الآثار العملية: يجب توجيه جهود التقييم والتخفيف الأمنية لوكلاء LLM الذين يستخدمون الأدوات نحو تغطية فئات الهجمات وسلوك النموذج بدلاً من اختيار إطار العمل.
الدقة بشأن أطر العمل: بينما التأثير الإجمالي لإطار العمل ضئيل، تؤكد الورقة أن CrewAI يتطلب اهتماماً خاصاً بسبب تأثيره المتبقي، والذي قد ينبع من الاختلافات الهيكلية في كيفية تقديمه لمطالبات النظام (قوالب لعب الأدوار) مقارنة بأطر العمل الأخرى.
الصرامة المنهجية: تثبت الدراسة أنه بدون التحقق من الحمولة على مستوى البايت، ستكون ادعاءات الأمن عبر أطر العمل مختلطة بعوامل ناتجة عن طبقات التكيف. كما توضح أن اختبار التكافؤ الرسمي ضروري لإثبات الضآلة العملية، وهي خطوة لم تستطع الدراسات السابقة التي اعتمدت فقط على قيم p غير المعنوية تحقيقها.
يحافظ المؤلف على نطاق متواضع، مشيراً إلى أن هذه النتائج تنطبق على الظروف الثمانية وعائلات الهجمات الخمس المحددة التي تم اختبارها تحت تصميم لا يختبر استدعاء الأدوات أثناء التشغيل، ولا تشكل ادعاءً عاماً حول جميع تصميمات التنسيق أو سيناريوهات النشر الممكنة.