← أحدث الأبحاث
💻 computer science

Can It Reach the Generator? Investigating the Survival of Prompt-Injection Attacks in Realistic RAG Settings

تُثبت هذه الورقة أنه في أنظمة استرجاع المعلومات المعزز بالتوليد (RAG) الواقعية، تفشل معظم هجمات حقن الأوامر (prompt-injection) في الوصول إلى النموذج المولد بسبب مرشحات الاسترجاع وإعادة التصنيف، وأن تلك التي تنجح في العبور يتم اكتشافها بسهولة بواسطة نماذج حماية خفيفة الوزن، مما يبالغ بشكل كبير في تقدير المخاطر الأمنية الفعلية للدراسات السابقة.

المؤلفون الأصليون: Yu Yin, Shuai Wang, Bevan Koopman, Guido Zuccon

نُشر 2026-05-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yu Yin, Shuai Wang, Bevan Koopman, Guido Zuccon

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مكتبة ذكية للغاية وعالية التقنية. عندما يسأل أحد الزوار: "ما هي أفضل آلة لصنع القهوة؟"، لا تكتفي المكتبة بمنحه قائمة من الكتب فحسب، بل لديها فريق مكون من ثلاث خطوات يقرر ما سيظهره له:

  1. الأمين (المسترجع - Retriever): يمسح المكتبة بأكملها للعثور على أفضل 10 كتب قد تكون ذات صلة.
  2. الناقد الخبير (إعادة الترتيب - Reranker): يقرأ تلك الكتب العشرة بعناية ويعيد ترتيبها للتأكد من أن الأفضل منها على رأس القائمة تماماً.
  3. المضيف (المولد - Generator): يأخذ أفضل 5 كتب من الناقد ويكتب رسالة توصية نهائية للزائر.

المشكلة: هجوم "الكتاب المزيف"
مؤخراً، اكتشف الباحثون خدعة تسمى "تحسين محركات التوليد" (GEO). الأمر يشبه محاولة شخص ما تهريب كتاب مزيف يروج لنفسه داخل المكتبة لخداع المضيف ليوصي به كأفضل آلة لصنع القهوة، حتى لو كان سيئاً للغاية.

ادعت دراسات سابقة أن هذه الخدعة كانت نجاحاً هائلاً، قائلة إن المهاجمين يمكنهم إيصال كتابهم المزيف إلى أعلى القائمة بنسبة 80% من الوقت. لقد جعلوا الأمر يبدو وكأن المكتبة مفتوحة تماماً للتخريب.

فحص الواقع: اكتشاف الورقة البحثية
تقول هذه الورقة البحثية: "مهلاً لحظة، تلك الدراسات السابقة كانت تغش".

في تلك الدراسات القديمة، افترضوا أن الكتاب المزيف موجود بالفعل على مكتب الناقد، متجاوزين الأمين والناقد تماماً. لقد سألوا المضيف فقط: "إليك كتاباً مزيفاً؛ هل يمكنك التوصية به؟".

لكن في العالم الحقيقي، يجب أن ينجو الكتاب المزيف من الأمين والناقد أولاً. اختبر المؤلفون هذا السيناريو الواقعي ووجدوا أن الهجوم أضعف بكثير مما كان يُعتقد.

إليكم ما وجدوه، باستخدام تشبيهات بسيطة:

1. الأمين يصفي الكتب المزيفة

عندما يحاول مهاجم كتابة كتاب مزيف لخداع النظام، فإنه غالباً ما يضطر لكتابته بطريقة غريبة أو آلية (مثل إضافة رموز سرية أو تعليمات غريبة).

  • النتيجة: الأمين، الذي يبحث عن كتب تبدو طبيعية، غالباً لا يلتقط الكتاب المزيف. يتركه على الرف.
  • الإحصائية: حوالي 20% من الكتب المزيفة لا تصل أبداً إلى الناقد، بل تبقى عالقة عند الأمين.

2. الناقد يرفض الأشياء الغريبة

حتى لو تجاوز الكتاب المزيف مرحلة الأمين، فعليه مواجهة الناقد الخبير. الناقد يقرأ المحتوى ليرى ما إذا كان يجيب فعلياً على السؤال.

  • النتيعة: العديد من الهجمات التي بدت قوية في الاختبارات القديمة "المغشوشة" تنهار هنا. يدرك الناقد أن الكتاب يحاول جاهداً خداعه، فيدفعه إلى أسفل القائمة.
  • الإحصائية: الهجمات التي تعتمد على الرياضيات "القائمة على التدرج" (Gradient-based) (أي الأكواد المعقدة والآلية) تفشل تماماً تقريباً. تنخفض نسبة نجاحها من كونها تبدو كتهديد إلى أقل من 2%. ببساطة، لا يمكنها الصمود أمام الناقد.

3. فقط "المتحدثون اللبقون" ينجون

هناك نوع واحد من الهجمات لا يزال يعمل: الهجمات المدفوعة بالنماذج اللغوية الكبيرة (LLM-driven attacks). هذه هي الكتب المزيفة التي يكتبها ذكاء اصطناعي آخر وتبدو طبيعية ومقنعة للغاية.

  • النتيجة: هؤلاء "المتحدثون اللبقون" يمكنهم خداع الأمين والناقد لأنهم يبدون كتوصيات حقيقية ومفيدة.
  • الإحصائية: هذه الهجمات لا تزال تنجح بنسبة 40-50% تقريباً. هم الوحيدون الذين يصلون في النهاية إلى المضيف.

4. "كاشف الدخان" يعمل

اختبرت الورقة البحثية أيضاً ما إذا كان بإمكاننا كشف هؤلاء المهاجمين.

  • الاكتشاف: قاموا ببناء "حارس أمن" صغير وخفيف الوزن (نموذج ذكاء اصطناعي صغير) تم تدريبه على نماذج قليلة فقط من هذه الهجمات.
  • النتيجة: أمسك هذا الحارس بكل هجوم نجح في عبور المسار، بما في ذلك المتحدثون اللبقون. إنه يشبه امتلاك كاشف دخان يشم رائحة الدخان فوراً، بغض النظر عن مدى جودة إخفاء النار.

الخلاصة الكبرى

تخلص الورقة البحثية إلى أن سيناريو "نهاية العالم" حيث يتم اختطاف توصيات الذكاء الاصطناعي بسهولة هو أمر مبالغ فيه.

  • النظرة القديمة: "المخترقون يمكنهم بسهولة إجبار الذكاء الاصطناعي على التوصية بأي شيء!" (بناءً على اختبارات تخطت خطوات الأمان).
  • النظرة الجديدة: "يمكن للمخترقين المحاولة، لكن خطوات الأمان الطبيعية في المكتبة (الأمين والناقد) تصفي معظمهم. أما القلة الذين ينجحون في العبور، فيمكن كشفهم بسهولة باستخدام كاشف بسيط."

باخت-صار، النظام أكثر قوة مما كنا نخشى، ولكن لا يزال يتعين علينا إبقاء "كواشف الدخان" الخاصة بنا (حراس الأمن) قيد التشغيل.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →