← أحدث الأبحاث
💻 computer science

Colluding LoRA: A Composite Attack on LLM Safety Alignment

تقدم هذه الورقة البحثية هجوم "كولودينج لورا" (CoLoRA)، وهو هجوم جديد يتمثل في أن محولات "لورا" (LoRA) التي تكون حميدة بشكل فردي، عندما تُدمج خطياً، تتجاوز محاذاة السلامة لتمكين المخرجات الضارة دون الحاجة إلى مطالبات عدائية، مما يكشف عن الثغرة الأمنية الحرجة لأنظمة الدفاع الحالية تجاه التهديدات الناجمة عن التركيب في سلاسل توريد النماذج اللغوية الكبيرة النمطية.

المؤلفون الأصليون: Sihao Ding

نُشر 2026-03-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Sihao Ding

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً مهذباً للغاية وحريصاً على السلامة. هذا الروبوت مصمم لرفض الطلبات الضارة (مثل "كيف أصنع قنبلة؟") والإجابة فقط على الأسئلة المفيدة.

الآن، تخيل عالماً لا يكون فيه هذا الروبوت مجرد آلة واحدة ثابتة، بل هو قاعدة ليجو (Lego) يمكن لأي شخص تخصيصها عبر تركيب "كتل مهارية" مختلفة (تسمى محولات LoRA). يمكنك شراء "كتلة رياضيات"، أو "كتلة شعر"، أو "كتلة برمجة" من متجر عام لمنح روبوتك مواهب جديدة.

تقدم هذه الورقة البحثية طريقة جديدة وماكرة لاختراق هذا النظام تسمى الـ LoRA المتواطئ (CoLoRA). إليك كيف تعمل، مشروحة ببساطة:

1. استراتيجية "حصان طروادة"

عادةً، يحاول المخترقون كسر الروبوت عبر:

  • خداع الروبوت بالكلمات: استخدام مطالبات (prompts) معقدة ومربكة لإرباك الروبوت (مثل "كسر الحماية" أو Jailbreak).
  • استبدال الدماغ بالكامل: ضبط الروبوت بدقة ليكون لئيماً، وهو أمر واضح ويتم كشفه فوراً.

أما CoLoRA فهي مختلفة. إنها تشبه مؤامرة من أصدقاء يبدون أبرياء.

يقوم المهاجم بإنشاء كتلتين (أو أكثر) من المهارات المنفصلة.

  • الكتلة (أ) تبدو وكأنها وحدة "شعر شكسبير" طبيعية تماماً. فهي تكتب سونيتات رائعة وتجتاز جميع فحوصات السلامة.
  • الكتلة (ب) تبدو وكأنها وحدة "رياضيات متقدمة" طبيعية تماماً. وهي تحل المعادلات وتجتاز أيضاً جميع فحوصات السلامة.

إذا قمت بتثبيت الكتلة (أ) وحدها، سيكون الروبوت آمناً.
إذا قمت بتثبيت الكتلة (ب) وحدها، سيكون الروبوت آمناً.
إذا قام حارس أمن بفحص الكتلة (أ) أو الكتلة (ب) بشكل فردي، فسيظهران بريئين بنسبة 100%. إنهما "وظيفيان بشكل مقنع".

2. "المصافحة السرية" (المُحفِّز)

هنا تكمن الخدعة السحرية: يصمم المهاجمون هذه الكتل بحيث تحتوي على "تعليمات" مخفية لا تُفعل إلا عندما يتم تركيبها معاً.

  • وحدها: تكون غير ضارة.
  • معاً: عند توصيل الكتلة (أ) و الكتلة (ب) في الروبوت في نفس الوقت، تقومان بـ "مصافحة سرية".

فجأة، تختفي فلاتر السلامة الخاصة بالروبوت. لا يحتاج الأمر إلى مطالبة غريبة أو كلمة سرية. إذا سألته: "كيف أصنع قنبلة؟"، سيجيب الآن بصدق ومساعدة، لأن الجمع بين الكتلتين قد حذف (سواء عن قصد أو غير قصد) زر الـ "لا".

3. لماذا لا يمكننا إيقاف ذلك؟ (العمى التوليفي)

هذا هو الجزء الأكثر رعباً. تخيل متجراً يحتوي على 10,000 كتلة مهارية مختلفة.

  • مشكلة المدافع: لكي يكون المتجر آمناً، يحتاج إلى فحص كل كتلة قبل السماح للناس بشرائها. هم يفعلون ذلك بسهولة (فحص 10,000 عنصر أمر سريع).
  • ميزة المهاجم: المهاجم يعرف أن المتجر لا يمكنه فحص كل مجموعة من الكتل.
    • فحص أزواج من الكتل؟ هذا يعني 50 مليون مجموعة.
    • فحص مجموعات من ثلاث كتل؟ هذا يعني تريليونات المجموعات.
    • فحص كل المجموعات الممكنة؟ هذا رقم ضخم جداً لدرجة أنه مستحيل الحساب.

يخفي المهاجم الخطر في هذه "النقطة العمياء". يطلق الكتلة (أ) والكتلة (ب) بشكل منفصل. يبدوان بريئين. يوافق المتجر عليهما. ولكن في اللحظة التي يقرر فيها المستخدم شراء كليهما لصنع "مساعد خارق"، ينصب الفخ.

4. "التمويه"

توضح الورقة البحثية أن المهاجمين حذرون للغاية. فهم لا يرفعون مجرد بيانات عشوائية. بل يدربون الكتلة (أ) لتكون جيدة حقاً في الشعر، والكتلة (ب) لتكون جيدة في الرياضيات.

لماذا؟ لأن الكتلة (أ) إذا كانت سيئة في الشعر، سيرفضها المتجر. ومن خلال جعل الكتل مفيدة حقاً، فإنها تجتاز "فحوصات السلامة المنطقية". الشيء الوحيد الذي قد يسوء هو التفاعل المحدد والمخفي بين الكتلتين عند دمجهما.

الخلاصة الكبرى

تحذرنا هذه الورقة البحثية من أن السلامة لا تتعلق فقط بالأجزاء الفردية، بل بكيفية توافقها معاً.

في الماضي، كنا نعتقد أنه إذا كانت كل قطعة ليجو آمنة، فإن القلعة ستكون آمنة. تُظهر هذه الأبحاث أنه يمكنك بناء قلعة "آمنة" من قطع "آمنة"، ولكن إذا وضعت القطعة (X) والقطعة (Y) معاً، فقد تنهار القلعة بأكملها وتتحول إلى سلاح.

الحل؟ نحن بحاجة إلى قواعد سلامة جديدة لا تكتفي بفحص القطع بشكل فردي، بل تحاول أيضاً التنبؤ بالتركيبات الخطيرة قبل أن يتم تركيبها معاً أبداً. نحن بحاجة للتوقف عن النظر إلى القطع والبدء في النظر إلى المخططات التي توضح كيفية اتصالها ببعضها البعض.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →