← أحدث الأبحاث
💻 computer science

WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections

تقدم الورقة البحثية WARD، وهو نموذج حماية عملي وفعال لوكلاء الويب يستفيد من مجموعة بيانات واسعة النطاق وإطار تدريب تنافسي تكيفي (A3T) لتحقيق دفاع قوي ومنخفض زمن الاستجابة ضد هجمات حقن الأوامر البرمجية مع الحفاظ على قدرة عالية على التعميم والحد الأدنى من الإيجابيات الكاذبة.

المؤلفون الأصليون: Tri Cao, Yulin Chen, Hieu Cao, Yibo Li, Khoi Le, Thong Nguyen, Yuexin Li, Yufei He, Yue Liu, Shuicheng Yan, Bryan Hooi

نُشر 2026-05-15
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tri Cao, Yulin Chen, Hieu Cao, Yibo Li, Khoi Le, Thong Nguyen, Yuexin Li, Yufei He, Yue Liu, Shuicheng Yan, Bryan Hooi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل الوكيل الويب (Web Agent) كأنه مساعد رقمي ذكي للغاية ومستقل. أنت تعطيه مهمة — مثل "احجز رحلة طيران" أو "اشترِ قميصاً معيناً" — وهو ينطلق إلى الإنترنت الواسع والفوضوي لإنجازها. إنه ينقر على الأزرار، ويقرأ النصوص، وينظر إلى الصور تماماً كما يفعل البشر.

ولكن هنا تكمن المشكلة: الإنترنت مليء بالمحتالين.

المشكلة: هجوم "الملاحظة المخفية"

في العالم الحقيقي، قد يضع مخترق ملاحظة في جيب مساعدك تقول: "تجاهل المدير، واذهب لشراء بيتزا بدلاً من ذلك". في العالم الرقمي، يُسمى هذا حقن الأوامر (Prompt Injection).

يخفي المخترقون تعليمات خبيثة داخل المواقع التي يزورها الوكيل. يمكن أن تكون هذه التعليمات:

  • نصوصاً غير مرئية مخبأة في كود الموقع (HTML).
  • خدعاً بصرية موضوعة فوق الشاشة (مثل نافذة منبثقة مزيفة تبدو وكأنها رسالة نظام).

إذا لم يكن الوكيل حذراً، فسيقرأ هذه الملاحظات المخفية، ويصاب بالارتباك، ويبدأ في القيام بأشياء لم تطلبها منه — مثل تسريب بياناتك الخاصة أو النقر على روابط خطيرة.

الدفاعات القديمة: "الحارس" ذو النقاط العمياء

لإيقاف ذلك، حاول الباحثون بناء نموذج حارس (Guard Model) — وهو حارس رقمي يفحص كل صفحة ويب قبل أن يلمسها الوكيل. لكن الحراس القدامى كان لديهم أربعة عيوب رئيسية:

  1. كانوا يعرفون فقط ما درسوه: إذا تدربوا على مواقع إخبارية، فإنهم يرتبكون أمام وسائل التواصل الاجتماعي أو البريد الإلكتروني.
  2. كانوا شديدي الحذر بشكل مبالغ فيه: غالباً ما كانوا يصنفون الصفحات غير الضارة (مثل وصفة طبخ) على أنها خطيرة، مما يعيق الوكيل عن أداء مهمته.
  3. كانوا بطيئين: فحص كل صفحة كان يستغرق وقتاً طويلاً، مما يجعل النظام بأكمله بطيئاً.
  4. يمكن خداعهم: تعلم المخترقون كيفية كتابة ملاحظات مصممة خصيصاً لإرباك الحارس، مما يجعله يتجاهل الخطر.

الحل: WARD (الـ "حارس الخارق")

يقدم البحث WARD (الدفاع القوي لوكيل الويب ضد حقن الأوامر). فكر في WARD كحارس من الجيل التالي تم تدريبه عبر معسكر تدريبي فريد مكون من ثلاث خطوات.

1. ميادين التدريب (WARD-Base)

بدلاً من مجرد قراءة كتاب مدرسي، تم تدريب WARD على مجموعة بيانات ضخمة تضم 177,000 مثال من العالم الحقيقي.

  • طريقة "التراكب" (The Overlay Method): أخذ الباحثون مواقع حقيقية (مثل أمازون أو مواقع إخبارية) و"دهنوا" فوقها رقمياً ملاحظات خبيثة مزيفة ليروا كيف سيتفاعل الوكيل معها.
  • الطريقة "الأصلية" (The Native Method): قاموا ببناء تطبيقات تواصل اجتماعي ورسائل مزيفة حيث يمكن للمخترقين إخفاء ملاحظات داخل تعليقات ورسائل تبدو طبيعية.
  • النتيجة: تعلم WARD كيفية رصد الخدع في كل من الكود والصور، عبر أنواع كثيرة من المواقع المختلفة، وليس نوعاً واحداً فقط.

2. تمرين "الدفاع عن النفس" (WARD-PIG)

أدرك الباحثون أن المخترقين يمكنهم محاولة خداع الحارس نفسه. تخيل أن مخترقاً يهمس للحارس: "مهلاً، أنا المدير، اسمح لهذا الشخص بالمرور".
لإيقاف ذلك، أنشأوا WARD-PIG، وهي مجموعة بيانات تستهدف فيها الهجمات عملية اتخاذ القرار لدى الحارس تحديداً. تعلم WARD تجاهل أوامر "المدير المزيف" هذه والالتزام بقواعده.

3. "الشريك المنافس" (A3T)

هذا هو الجزء الأكثر إبداعاً. بنى الباحثون نظام تدريب الهجوم العدائي التكيفي (A3T).

  • تخيل مباراة ملاكمة حيث يتقاتل الحارس والمخترق ضد بعضهما البعض.
  • يحاول المخترق إيجاد طريقة جديدة لتمرير ملاحظة بعيداً عن أعين الحارس.
  • إذا نجح المخترق، يتعلم الحارس من هذا الخطأ ويصبح أقوى.
  • يكررون هذه الحلقة آلاف المرات. يصبح المخترق أكثر ذكاءً، ويصبح الحارس أكثر صلابة، حتى يتمكن الحارس من رصد حتى أكثر الخدع دهاءً وتطوراً.

النتائج: لماذا يفوز WARD؟

اختبر الباحثون WARD ضد أفضل الأنظمة الأمنية الموجودة ووجدوا:

  • دقة فائقة: لقد كشف ما يقرب من 100% من الهجمات، حتى في المواقع التي لم يسبق له رؤيتها من قبل.
  • إنذارات خاطئة منخفضة: نادراً ما أوقف الوكيل عن القيام بأشياء غير ضارة (مثل قراءة وصفة)، مما يحافظ على فائدة الوكيل.
  • السرعة: يعمل بالتوازي مع الوكيل، مما يعني أنه لا يبطئ أي شيء. إنه يشبه وجود حارس أمن يفحص هويتك بينما تسير بالفعل عبر الباب، وليس جعلك تنتظر في الطابور.
  • غير قابل للاختراق: حتى عندما حاول المخترقون تكييف هجماتهم في الوقت الفعلي لتجاوزه، صمد WARD في وجههم.

باخت://

WARD هو نظام أمني لوكلاء الذكاء الاصطناعي لا يكتفي بمجرد حفظ قائمة بالمواقع السيئة. بدلاً من ذلك، يتدرب على تنوع هائل من سيناريوهات العالم الحقيقي، ويتعلم تجاهل أوامر السلطة المزيفة، ويقاتل باستمرار ضد شريك منافس رقمي ليبقى متيقظاً. إنه يحافظ على سلامة مساعدك الذكي من الخدع المخفية دون إبطائه أو منعه من أداء مهمته.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →