DarkLLM: Learning Language-Driven Adversarial Attacks with Large Language Models
تقدم الورقة البحثية DarkLLM، وهو إطار عمل مبتكر يستفيد من نموذج لغوي كبير بمليار معلمة لترجمة التعليمات باللغة الطبيعية إلى اضطرابات تنافسية متعددة الاستخدامات وعالية الفعالية، مما يوحد ويوسع نطاق الهجمات عبر مختلف النماذج التأسيسية للرؤية والنماذج متعددة الوسائط.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك روبوتًا فائق الذكاء يمكنه "رؤية" العالم. يمكنه تحديد الأشياء، ووصف المشاهد، وحتى رسم خطوط حول الأشياء في صورة ما. هذا هو بالضبط ما تفعله نماذج الذكاء الاصطناعي الحديثة (مثل CLIP أو SAM أو ChatGPT).
لسنوات، حاول باحثو الأمن خداع هذه الروبوتات عن طريق إضافة "ضجيج" (noise) دقيق وغير مرئي للصور — مثل ذرات الغبار على عدسة الكاميرا — وهي ذرات صغيرة جدًا لدرجة أن البشر لا يستطيعون رؤيتها، لكنها تجعل الروبوت مرتبكًا تمامًا.
المشكلة في الحيل القديمة
في السابق، كان إنشاء هذه "الذرات الغبارية" يشبه امتلاك مفتاح رئيسي مختلف لكل قفل على حدة. إذا كنت تريد خداع روبوت يتعرف على السيارات، فأنت بحاجة إلى مفتاح محدد. وإذا كنت تريد خداع روبوت يرسم الخطوط العريضة، فستحتاج إلى مفتاح مختلف تمامًا. وإذا كنت تريد خداع روبوت يتحدث الإنجليزية، فستحتاج إلى مفتاح آخر. كان الأمر بطيئًا، جامدًا، ولا يمكنه التكيف بسهولة مع أنواع جديدة من الروبوتات.
الحل الجديد: DarkLLM
تقدم هذه الورقة البحثية DarkLLM، وهي طريقة جديدة لمهاجمة نماذج الذكاء الاصطناعي هذه. بدلاً من استخدام معادلات رياضية معقدة لحساب "ذرات الغبار"، قام الباحثون بتعليم نموذج لغوي كبير (LLM) — وهو ذكاء اصطناعي يفهم اللغة البشرية — ليكون هو "صانع المفاتيح الرئيسية".
إليك كيف يعمل الأمر، باستخدام تشبيه بسيط:
1. "المترجم السحري" (متحكم الـ LLM)
تخيل مترجمًا ماهرًا للغاية يتحدث لغتين: "اللغة البشرية" و"لغة تخريب الروبوتات".
- الطريقة القديمة: كان عليك كتابة معادلة رياضية معقدة لكل روبوت محدد تريد خداعه.
- طريقة DarkLLM: يمكنك ببساطة التحدث إلى المترجم بلغة إنجليزية بسيطة.
- أنت تقول: "اجعل هذا الروبوت يعتقد أن صورة القطة هي في الواقع كلب".
- أو: "اجعل هذا الروبوت يفشل في رؤية أي شيء في هذه الصورة".
- أو: "اجعل هذا الروبوت يفشل في رسم الخطوط العريضة للقطة، واجعله يعتقد أيضًا أن القطة هي كلب في نفس الوقت".
المترجم (الـ LLM) يفهم نيتك ويحول كلماتك فورًا إلى "مخطط" سري للهجوم.
2. "الرسام الخفي" (مولد الاضطراب - Perturbation Generator)
بمجرد أن ينشئ المترجم المخطط، يعمل جزء ثانٍ من النظام كرسام خفي. يأخذ هذا الرسام المخطط ويرسم "ذرات الغبار" الدقيقة وغير المرئية على الصورة.
- نظرًا لأن المترجم فهم تعليماتك المحددة (مثل "اجعله يفشل في التجزئة/Segmentation")، فإن الرسام يعرف بالضبط نوع الغبار الذي يجب تطبيقه لتحقيق تلك النتيجة المحددة.
3. "جهاز التحكم الشامل"
الجزء الأكثر قوة في DarkLLM هو أنه يعمل مثل جهاز التحكم عن بعد الشامل (Universal Remote).
- تعليمات واحدة، أهداف متعددة: يمكنك إعطاء نفس التعليمات لخداع روبوت يتعرف على الصور، أو روبوت يرسم الخطوط العريضة، أو حتى روبوت يتحدث إليك.
- سحر النماذج المتعددة: تُظهر الورقة أن "ذرة غبار" واحدة أنشأها DarkLLM يمكنها خداع روبوت تدرب على التعرف على السيارات، وروبوت تدرب على رسم الخطوط العريضة، وروبوت للدردشة، وكل ذلك في وقت واحد. لقد وجد النظام "نقطة ضعف" موجودة في جميعها.
ماذا أثبتوا؟
اختبر الباحثون هذا النظام على 13 مجموعة بيانات مختلفة و15 نموذج ذكاء اصطناعي مختلفًا (بما في ذلك نماذج شهيرة مثل CLIP وSAM، ونماذج تجارية مثل GPT-4o وGemini).
- إنه يعمل: أظهروا أنه بمجرد كتابة جملة مثل "اجعل الروبوت يفشل في التعرف على هذه الصورة"، نجح النظام في إنشاء صورة أربكت الروبوت.
- إنه مرن: استطاعوا طلب حيل محددة (مثل "تظاهر بأن هذا كلب") أو حيل عامة (مثل "أعطل الروبوت")، وتعامل النظام مع كليهما.
- إنه أمر مخيف (بطريقة جيدة للأمن): حقيقة أن تعليمات لغوية بسيطة واحدة يمكن أن تكسر أنواعًا مختلفة من الذكاء الاصطناعي المتقدم تشير إلى أن هذه النماذج القوية تشترك في ثغرة أمنية واحدة.
الخلاصة
DarkLLM هو أداة تحول اللغة الطبيعية إلى سلاح ضد رؤية الذكاء الاصطناعي. بدلاً من الحاجة إلى دكتوراه في الرياضيات لاختراق الذكاء الاصطناعي، تحتاج فقط إلى معرفة كيفية طرح السؤال. توضح الورقة أنه إذا كان بإمكانك وصف ما تريد حدوثه للذكاء الاصطناعي باللغة الإنجليزية، فيمكنك على الأرجب إجباره على فعل ذلك بالضبط، حتى لو كان ذكاءً اصطناعيًا مختلفًا تمامًا عن ذاك الذي دربت الأداة عليه.
يؤكد المؤلفون أن هذا أداة سلامة. تمامًا كما تحتاج إلى معرفة كيفية كسر القفل لبناء قفل أفضل، يساعد هذا البحث المطورين على فهم مدى سهولة خداع أنظمة الذكاء الاصطناعي القوية هذه، حتى يتمكنوا من بناء دفاعات أقوى.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.