← أحدث الأبحاث
🤖 machine learning

Semantic Chameleon: Corpus-Dependent Poisoning Attacks and Defenses in RAG Systems

تقدم هذه الورقة البحثية "Semantic Chameleon"، وهو هجوم تسميم للمجموعات النصية موجّه بالتدرج يعمل على التلاعب بمخرجات أنظمة استرجاع المعلومات المعززة بالتوليد (RAG) عبر تحسين مستندات مزدوجة لاختطاف عملية الاسترجاع، مما يثبت أنه في حين أن الاسترجاع الهجين يخفف بفعالية من حدة الهجمات على الأنظمة التي تعتمد على المتجهات فقط، فإن الحمولات المحسنة بشكل مشترك لا تزال قادرة على تجاوز هذه الدفاعات جزئياً، مع تفاوت معدلات النجاح بشكل كبير عبر عائلات النماذج اللغوية الكبيرة ومجموعات البيانات المختلفة.

المؤلفون الأصليون: Scott Thornton

نُشر 2026-03-20
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Scott Thornton

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً ذكياً ومفيداً للغاية (ذكاء اصطناعي) بارع في الإجابة على الأسئلة، لكنه لا يعرف كل شيء عن العالم. ولإصلاح ذلك، تمنحه مكتبة ضخمة من الكتب ("المتن" أو الـ corpus) للبحث عن المعلومات فيها قبل الإجابة. تُسمى هذه العملية RAG (التوليد المعزز بالاسترجاع).

ورقة بحثية بعنوان "الحرباء الدلالية" (Semantic Chameleon) هي تقرير أمني حول كيفية تسلل الأشرار إلى تلك المكتبة، وإخفاء كتب مزيفة، وخداع المساعد لتقديم إجابات خطيرة. ولكن الأهم من ذلك، أنها تكتشف أن نوع المكتبة التي تمتلكها يهم بقدر أهمية حارس الأمن الذي توظفه.

إليك التفاصيل بتبسيط شديد:

1. الهجوم: كتب "حصان طروادة"

وجد الباحثون طريقة تمكن المخترقين من حقن نوعين محددين من الكتب "المسمومة" داخل المكتبة:

  • النائم (The Sleeper): كتاب يبدو طبيعياً ومملاً تماماً. يتحدث عن مواضيع مشروعة ولكنه يحتوي على "خطافات" مخفية (مثل عبارات معينة) تجعله يبدو مشابهاً لهدف المخترق في عقل الكمبيوتر.
  • المُحفّز (The Trigger): كتاب يبدو طبيعياً في البداية، ولكنه يحتوي على التعليمات الخبيثة الفعلية (مثل "كيفية تجاوز الأمن") مخبأة في الداخل.

كيف يعمل الأمر: عندما يطرح المستخدم سؤالاً محدداً، يجد محرك بحث الذكاء الاصطناعي الكتاب "النائم" أولاً لأنه يبدو مشابهاً للموضوع. ثم يقرأ الذكاء الاصطناعي "المُحفّز" المرتبط به ويتبع التعليمات السيئة عن طريق الخطأ.

2. الاكتشاف الكبير: المكتبة هي الأهم (تأثير "الحرباء")

كانت المفاجأة الكبرى في الورقة البحثية هي أن أين تضع هذه الكتب المزيفة يغير كل شيء. لقد اختبروا ذلك في نوعين مختلفين من "المكتبات":

  • المكتبة العامة (ويكيبيديا): تخيل مكتبة تحتوي على كتب عن كل شيء—الطبخ، التاريخ، الفضاء.
    • النتيجة: إذا حاول مخترق إدخال كتاب عن "الاختراق"، فسيبرز كعلامة نيون ساطعة. سيقوم محرك البحث فوراً بتمييزه كشيء غريب لأن كلمة "اختراق" نادراً ما تظهر في كتاب طبخ. يفشل الهجوم لأن الكتاب المزيف يُكشف فوراً.
  • المكتبة التقنية (Security Stack Exchange): تخيل مكتبة مليئة بكتيبات الكمبيوتر المعقدة ووثائق الأمن.
    • النتيجة: هنا، كلمات مثل "تجاوز" (bypass)، "حقن" (injection)، و"ثغرة" (exploit) هي كلمات شائعة. الكتاب المزيف يندمج هناك بشكل مثالي، مثل حرباء تغير لونها لتتطابق مع أوراق الشجر. لا يستطيع محرك البحث التمييز بين دليل أمني حقيقي ودليل مزيف. ينجح الهجوم هنا بشكل أفضل.

الدرس المستفاد: الدفاع الذي يعمل على مكتبة عامة قد يفشل تماماً أمام مكتبة تقنية. لا يمكنك استخدام قاعدة أمنية واحدة تناسب الجميع.

‌3. الحل: نظام "التحقق المزدوج" (الاسترجاع الهجين)

اختبر الباحثون حلاً بسيطاً: الاسترجاع الهجين (Hybrid Retrieval).

تخيل محرك البحث كأنه أمين مكتبة.

  • الطريقة القديمة (البحث المتجهي - Vector Search): أمين المكتبة ينظر فقط إلى "جوهر" أو "معنى" الكلمات. "هل يشعر أن هذا الكتاب ينتمي للمكان؟" إذا نجح المخترق في تقليد "الجوهر" بدقة، فسيسمح له بالدخول.
  • الطريقة الجديدة (البحث الهجين - Hybrid Search): أصبح أمين المكتبة الآن يستخدم طريقتين:
    1. فحص الجوهر (Vibe Check): هل يبدو الشعور العام صحيحاً؟ (البحث المتجهي)
    2. فحص الكلمات المفتاحية: هل يحتوي الكتاب فعلياً على الكلمات المحددة التي طلبها المستخدم؟ (بحث BM25)

النتيجة: كان المخترقون بارعين في تقليد "الجوهر"، لكنهم لم يستطيعوا مطابقة الكلمات المفتاحية المحددة بدقة دون جعل الكتاب يبدو مريباً. من خلال إجبار أمين المكتبة على استخدام كلا الطريقتين، تم رفض الكتب المزيفة بنسبة 100% ضد الهجمات القياسية.

4. المخترق الذكي مقابل التحقق المزدوج

سأل الباحثون: "ماذا لو كان المخترق ذكياً جداً وحاول التلاعب بكلا النظامين؟"

  • حاولوا كتابة كتب تبدو صحيًا في الجوهر وتحتوي أيضاً على الكلمات المفتاحية الصحيحة.
  • النتيجة: استطاعوا إدخال الكتب إلى المكتبة بنسبة تتراوح بين 20 إلى 44% تقريباً. لم يكن دفاعاً مثالياً، لكنه جعل المهمة أصعب بكثير على المخترق. لقد رفع "سقف الهجوم" بشكل كبير.

5. شخصية الذكاء الاصطناعي تهم أيضاً

اختبروا هذا ضد خمسة نماذج مختلفة من الذكاء الاصطناعي (مثل شخصيات مختلفة للمساعدين):

  • الذكاء الاصطناعي "الصارم" (Claude): حتى لو وجد الكتاب السيئ، فإنه يرفض اتباع التعليمات السيئة. إنه مثل كلب حراسة ينبح على المتسلل لكنه لا يهاجم صاحب المنزل.
  • الذكاء الاصطناعي "المتساهل" (Llama): هذا النوع كان من السهل جداً خداعه. إذا وجد الكتاب السيئ، فإنه يتبع التعليمات بسعادة.
  • الذكاء الاصطناعي "الجديد" (GPT-5.3): أفضل من النماذج القديمة، لكنه لا يزال يُخدع في نصف الحالات تقريباً.

الخلاصة: لا يمكنك الاعتماد فقط على كون الذكاء الاصطناعي "آمناً". أنت بحاجة لتأمين المكتبة (البحث) وتدريب الذكاء الاصطناعي أيضاً.

ملخص للشخص العادي

  1. يمكن للمخترقين إخفاء تعليمات سيئة داخل وثائق تبدو طبيعية في قاعدة معرفة الذكاء الاصطناعي الخاص بك.
  2. السياق هو الملك: إذا كان الذكاء الاصطناعي الخاص بك يعمل مع مصطلحات تقنية، فمن الصعب اكتشاف هذه الاختراقات لأن الكلمات السيئة تبدو طبيعية. أما إذا كان يعمل مع مواضيع عامة، فستبرز الكلمات السييرة بوضوح.
  3. أفضل دفاع: لا تعتمد على نوع واحد من البحث فقط. استخدم نظاماً هجيناً يتحقق من كل من المعنى والكلمات الدقيقة. هذا التغيير البسيط أوقف جميع الهجمات القياسية تقريباً في الدراسة.
  4. الدفاع متعدد الطبقات: حتى مع وجود نظام بحث جيد، تحتاج لمعرفة أي نموذج ذكاء اصطناعي تستخدم، حيث أن بعض النماذج أسهل بكثير في الخداع من غيرها.

باختختصار: للحفاظ على سلامة الذكاء الاصطناعي الخاص بك، تحتاج إلى أمين مكتبة ذكي يتحقق من كل من "الجوهر" و"الكلمات المفتاحية"، وعليك أن تدرك أن بعض المكتبات أصعب في الحماية من غيرها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →