← أحدث الأبحاث
💻 computer science

One Shot Dominance: Knowledge Poisoning Attack on Retrieval-Augmented Generation Systems

تقدم هذه الورقة البحثية AuthChain، وهو هجوم خفي لتسميم المعرفة يستهدف تقويض أنظمة التوليد المعزز بالاسترجاع (RAG) عبر حقن وثيقة خبيثة واحدة تنجح في التلاعب بالاستجابات المتعلقة بالاستعلامات المعقدة متعددة الخطوات، متفوقاً بذلك على الأساليب الحالية في كل من الفعالية والقدرة على التملص من الدفاعات.

المؤلفون الأصليون: Zhiyuan Chang, Mingyang Li, Xiaojun Jia, Junjie Wang, Yuekai Huang, Ziyou Jiang, Yang Liu, Qing Wang

نُشر 2026-04-10
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zhiyuan Chang, Mingyang Li, Xiaojun Jia, Junjie Wang, Yuekai Huang, Ziyou Jiang, Yang Liu, Qing Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً ذكياً ومطلعاً للغاية (النموذج اللغوي الكبير - LLM)، يعرف الكثير عن العالم ولكنه ينسى أحياناً الأخبار الحديثة أو يختلق أموراً من خياله. ولإصلاح ذلك، تمنحه مكتبة من الكتب ليتأكد منها قبل الإجابة على أسئلتك. هذا الإعداد يسمى RAG (التوليد المعزز بالاسترجاع).

ما المشكلة؟ المكتبة مفتوحة للجمهور. يمكن لأي شخص أن يدخل ويزرع كتاباً مزيفاً على الرف.

تقدم هذه الورقة البحثية طريقة جديدة وماكرة لخداع المساعد باستخدام كتاب مزيف واحد فقط، حتى عندما يكون المساعد ذكياً جداً والمكتبة ضخمة. يطلق الباحثون على طريقتهم اسم AuthChain.

إليك كيف تعمل، مقسمة إلى تشبيهات بسيطة:

المشكلة: لماذا يفشل الكتاب المزيف الواحد عادةً؟

تخيل أنك تسأل مساعدك: "من فاز في انتخابات 2024؟"

  • المكتبة: تحتوي على 1,000 كتاب حقيقي تقول "المرشح أ"، وكتاب واحد مزيف يقول "المرشح ب".
  • عادة المساعد: إذا رأى 1,000 كتاب تقول "أ" وكتاباً واحداً فقط يقول "ب"، فإنه يفترض أن هذا الكتاب هو خطأ أو دعابة. كما أنه يتذكر من ذاكرته الخاصة أن "المرشح أ" هو الفائز المرجح.
  • النتيجة: يتجاهل المساعد الكتاب المزيف. حاولت الهجمات السابقة إدخال العديد من الكتب المزيفة لإغراق الحقيقة، لكن ذلك يشبه محاولة إخفاء كذبة واحدة في بحر من الحقائق؛ الأمر يصبح واضحاً ويتم كشفه.

الحل: AuthChain (الكتاب المزيف "المثالي")

أدرك الباحثون أنه لكي ينجحوا باستخدام كتاب مزيف واحد فقط، يجب أن يكون هذا الكتاب مقنعاً للغاية لدرجة تجعل المساعد يتجاهل الـ 1,000 كتاب الأخرى وذاكرته الخاصة. لقد بنوا هذا "الكتاب المزيف المثالي" عبر ثلاث خطوات:

1. "المطابقة المثالية" (المحتوى القائم على القصد)

التشبيه: تخيل أنك تبحث عن مفتاح محدد في درج فوضوي. إذا رفعت مفتاحاً يشبه تماماً المفتاح الذي تحتاجه، فستلتقطه على الفور.

  • كيف يعمل: يتم كتابة الكتاب المزيف ليتناسب مع سؤالك تماماً. فهو لا يذكر الموضوع فحسب، بل يحاكي المنطق والهيكل الدقيق لسؤالك. هذا يجعل محرك بحث المكتبة (المسترجع - Retriever) يختار هذا الكتاب تحديداً كأول نتيجة، متفوقاً على جميع الكتب الحقيقية.

2. "القصة المتكاملة" (سلسلة الأدلة - CoE)

التشبيه: تخيل محققاً يحاول حل جريمة. إذا وجد ملاحظة تقول "الخادم هو الفاعل"، فقد يتجاهلها. ولكن إذا وجد مذكرات مفصلة تشرح كيف فعل الخادم ذلك، ومتى حدث، ولماذا كان لديه دافع، فسيصدقها.

  • كيف يعمل: الكتاب المزيف ليس مجرد جملة عشوائية. إنه يبني قصة كاملة ومنطقية (سلسلة أدلة - Chain of Evidence) تربط جميع النقاط ببعضها. يبدو كأنه إثبات كامل ومستقل بذاته. حتى لو رأى المساعد كتباً أخرى بمعلومات ناقصة أو مجزأة، فإن هذا الكتاب سيبدو وكأنه "الحقيقة الكاملة".

3. "ختم الموافقة" (محتوى السلطة/المرجعية)

التشبيه: تخيل شخصين يرويان لك قصة. أحدهما رجل عابر في الشارع. والآخر عالم مشهور يرتدي معطف المختبر، ويمسك بلوحة عليها تاريخ اليوم، ويقول: "لقد تحققت من هذا للتو". من ستصدق؟

  • كيف يعمل: يضيف الكتاب المزيف "إشارات سلطة". فهو يتظاهر بأنه مكتوب من قبل مؤسسة موثوقة (مثل جامعة أو وكالة حكومية) ويتضمن تاريخاً حديثاً جداً. هذا يخدع المساعد ليعتقد: "يجب أن يكون هذا صحيحاً لأنه قادم من خبير وهو جديد تماماً"، مما يلغي ذاكرة المساعد القديمة.

النتائج: عملية سطو بارعة

اختبر الباحثون هذا "الكتاب المزيف المثالي" ضد ستة مساعدين أذكياء مختلفين (نماذج لغوية كبيرة) باستخدام ثلاث مكتبات مختلفة.

  • الطريقة القديمة: كانت الطرق السابقة (مثل PoisonedRAG) تشبه رمي حفنة من قصاصات الورق الملونة على المساعد. كانت تنجح أحياناً، ولكن في الأسئلة البسيطة فقط، وكان من السهل كشف الخدعة.
  • طريقة AuthChain: باستخدام كتاب واحد مثالي الصنع، خدعوا المساعدين بنسبة 87% في الأسئلة المعقدة.
  • التخفي: حتى عندما كان لدى المساعدين "حراس أمن" (أنظمة دفاعية) يحاولون رصد الكتب المزيفة، كان كتاب AuthChain مكتوباً بشكل جيد ومنطقي للغاية لدرجة أن الحراس لم يلاحظوه.

لماذا يجب أن تهتم؟

هذه الورقة البحثية هي جرس إنذار. فهي توضح أنه إذا اعتمدنا على الذكاء الاصطناعي للتحقق من "الحقائق" من الإنترنت، وكان بإمكان التلاعب بالإنترنت بسهولة من خلال كذبة واحدة مكتوبة بذكاء، فإن الذكاء الاصطناعي سيصدق تلك الكذبة.

الخلاصة:
مجرد كون المصدر يبدو موثوقاً، ولديه قصة منطقية، ويتطابق تماماً مع بحثك، لا يعني بالضرورة أنه حقيقي. في المستقبل، نحتاج إلى طرق أفضل للتحقق من الحقائق، وليس فقط الوثوق في "أفضل كتاب يبدو مقنعاً" في المكتبة.

ملاحظة أخلاقية:
المؤلفون لا يحاولون كسر الإنترنت؛ بل يوضحون لنا الثغرة الموجودة في السياج حتى نتمكن من إصلاحها. هم يقترحون أننا بحاجة إلى بناء أنظمة ذكاء اصطناعي تتحقق من الأدلة وراء الادعاء، وليس فقط من السلطة أو المرجعية التي يمتلكها الشخص الذي يطرح الادعاء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →