← أحدث الأبحاث
💬 NLP

ToolFlood: Beyond Selection -- Hiding Valid Tools from LLM Agents via Semantic Covering

تقدم هذه الورقة البحثية ToolFlood، وهو هجوم مبتكر على طبقة الاسترجاع يستهدف استهداف وكلاء النماذج اللغوية الكبيرة (LLMs) المعززة بالأدوات عبر حقن مجموعة صغيرة من الأدوات المصممة خصيصاً بأسلوب عدائي لتغطي دلالياً استعلامات مستخدم متنوعة بهدف السيطرة على نتائج الاسترجاع لأعلى (top-k) وإزاحة جميع الأدوات السليمة، محققةً نسبة نجاح في الهجوم تصل إلى 95% مع أدنى معدلات الحقن.

المؤلفون الأصليون: Hussein Jawad, Nicolas J-B Brunel

نُشر 2026-03-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Hussein Jawad, Nicolas J-B Brunel

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً فائق الذكاء (عميل ذكاء اصطناعي - AI Agent) يمكنه القيام بأشياء مذهلة مثل حجز الرحلات الجوية، أو تحليل الأسهم، أو كتابة الأكواد البرمجية. لكن هذا الروبوت لا يمكنه فعل كل شيء بمفرده؛ فهو يحتاج إلى استعارة أدوات من صندوق أدوات رقمي ضخم.

للحفاظ على السرعة، لا يبحث الروبوت في كل أداة في الكون بأكم، بل لديه "أمين مكتبة" (نظام استرجاع) يستمع إلى طلبك ويقوم بسرعة بسحب أفضل 5 أدوات أكثر صلة ليعرضها على الروبوت. ثم يختار الروبوت واحدة من هذه الأدوات الخمس للقيام بالمهمة.

المشكلة: هجوم "فيضان الأدوات" (ToolFlood)
تصف ورقة بحثية بعنوان "ToolFlood" طريقة جديدة وماكرة لاختراق هذا النظام. فبدلاً من محاولة خداع الروبوت ليختار أداة سيئة من قائمة الخمسة، يقوم المهاجم بخداع أمين المكتبة بحيث تحتوي قائمة الخمسة فقط على أدوات سيئة.

إليك كيف يعمل الأمر، باستخدام تشبيه بسيط:

التشبيه: "فيضان المطاعم المزيفة"

تخيل أنك في مدينة بها 10,000 مطعم حقيقي وصادق (الأدوات السليمة). تسأل دليلاً عن "أفضل مكان للأكل الإيطالي"، فينظر الدليل في الخريطة ويحضر لك أفضل 5 مطاعم إيطالية. تختار واحداً منها وتذهب لتأكل.

الآن، تخيل أن مجموعة إجرامية تريد إجبارك على الأكل في مطعمهم السيئ وبأسعار باهظة.

  • الهجوم القديم (أسلوب "الرشوة"): يحاول المجرم جعل مطعمه يبدو أفضل قليلاً من المطاعم الأخرى في القائمة. يغيرون اللافتة لتصبح "أفضل إيطالي في المدينة!" على أمل أن يختاره الدليل بدلاً من الأماكن الحقيقية.
  • هجوم "فيضان الأدوات" (أسلوب "السرب المزيف"): يدرك المجرمون أنه لا يمكنهم مجرد التفوق على الآخرين؛ بل يحتاجون إلى إزاحتهم تماماً.
    1. يقومون بتجنيد جيش من الروبوتات لإنشاء 100 مطعم مزيف.
    2. هذه المطاعم المزيفة تحمل أسماءً وأوصافاً تتعلق بشكل غامض بالطعام الإيطالي، ولكنها مكتوبة بطريقة تجعلها تبدو كأنها تطابق تماماً أي شخص يسأل عن الطعام الإيطالي.
    3. يقومون بإغراق خريطة الدليل بهذه الأماكن المزيفة المئة.
    4. عندما تسأل عن "الطعام الإيطالي"، تصبح خريطة الدليل الآن مليئة جداً بهذه الأماكن المزيفة لدرجة أن أفضل 5 نتائج هي كلها مزيفة. المطاعم الحقيقية والصادقة قد تم دفعها بعيداً جداً في أسفل القائمة بحيث لا تُرى أبداً.
    5. أنت مُجبر على الاختيار من بين الخيارات المزيفة الخمسة.

كيف يفعلون ذلك (السر الخفي)

تشرح الورقة البحثية أن المهاجمين يستخدمون عملية من خطوتين لإنشاء هذا "السرب" من الأدوات المزيفة:

  1. المرحلة الأولى: مرحلة "الحلم" (توليد مونت كارلو - Monte Carlo Generation)
    يطلب المهاجمون من الذكاء الاصطناعي تخيل آلاف الأدوات المزيفة. هم لا يطلبون أداة واحدة محددة؛ بل يطلبون من الذكاء الاصطناعي إنشاء أدوات يمكنها الإجابة على العديد من الأسئلة المختلفة في آن واحد. الأمر يشبه طلب ابتكار قائمة طعام من قبل شيف تبدو جيدة لوجبات "الإفطار"، و"الغداء"، و"العشاء" في نفس الوقت. هذا يخلق كومة ضخمة من الأدوات المزيفة "العامة ولكن ذات صلة".

  2. المرحلة الثانية: مرحلة "القناص" (الاختيار الجشع - Greedy Selection)
    من تلك الكومة الضخمة، يستخدم المهاجمون خوارزمية ذكية لاختيار أفضل 100 أداة مزيفة. يختارون الأدوات التي هي الأقرب رياضياً لأكثر الأسئلة شيوعاً التي يطرحها الناس. إنهم يلعبون لعبة "تغطية أكبر مساحة بأقل عدد من البلاطات".

لماذا هذا الأمر مخيف

  • يتجاوز ضوابط السلامة: معظم أنظمة الأمان تتحقق من قائمة الأدوات الخمسة النهائية للتأكد من أنها ليست خطيرة. لكن في هذا الهجوم، لا يرى نظام الأمان الأدوات الحقيقية لأنها لم تُدعَ للحفلة أصلاً. يرى الحارس فقط الأدوات المزيفة الخمسة ويعتقد: "أوه، تبدو هذه جيدة"، ويسمح للروبوت باستخدامها.
  • غير مرئي: لا يحتاج المهاجم إلى اختراق عقل الروبوت أو كود أمين المكتبة. يحتاج فقط إلى إضافة بضع مئات من المدخلات المزيفة إلى قاعدة البيانات العامة.
  • يعمل في كل مكان: اختبرت الورقة البحثية هذا الهجوم على قاعدتي بيانات ضخمتين للأدوات (MetaTool و ToolBench). وبالرغم من أن المهاجمين أضافوا حوالي 1% فقط من الأدوات المزيفة (قطرة صغيرة في المحيط)، إلا أنهم نجحوا في حجب الأدوات الحقيقية بنسبة 95% من الوقت.

الخلاصة

تحذر هذه الورقة البحثية من أنه مع زيادة انتشار وكلاء الذكاء الاصطناعي، فإن "محرك البحث" الذي يمثل جزءاً من عقلهم هو نقطة ضعف. إذا تمكن المهاجمون من إغراق نتائج البحث بأدوات مزيفة مموهة بذكاء، فيمكنهم التحكم فيما يفعله الذكاء الاصطناعي دون المساس بالذكاء الاصطناعي نفسه.

الحل؟ نحن بحاجة إلى "أمناء مكتبة" أفضل يمكنهم رصد متى تكون قائمة النتائج مزدحمة بشكل مريب بعناصر متشابهة (مثل سرب من المطاعم المزيفة) وتصفيتها قبل عرضها على الروبوت.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →