← أحدث الأبحاث
💬 NLP

MANATEE: Inference-Time Lightweight Diffusion Based Safety Defense for LLMs

تقترح الورقة البحثية MANATEE، وهي آلية دفاع في وقت الاستدلال تستفيد من تقدير الكثافة القائم على الانتشار لإسقاط الحالات الخفية الشاذة إلى مناطق آمنة، مما يخفف بفعالية من هجمات كسر الحماية دون الحاجة إلى بيانات تدريب ضارة أو تعديلات هيكلية مع الحفاظ على فائدة النموذج.

المؤلفون الأصليون: Chun Yan Ryan Kan, Tommy Tran, Vedant Yadav, Ava Cai, Kevin Zhu, Ruizhe Li, Maheep Chaudhary

نُشر 2026-02-24
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Chun Yan Ryan Kan, Tommy Tran, Vedant Yadav, Ava Cai, Kevin Zhu, Ruizhe Li, Maheep Chaudhary

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً جداً ومدرباً جيداً (نموذج لغوي كبير، أو LLM). لقد علمته أن يكون مفيداً، ولطيفاً، وآمناً. لكن، وجد بعض الأشرار الأذكياء طرقاً لخداع هذا الروبوت لجعله يقوم بأشياء خطيرة، مثل كتابة رسائل بريد إلكتروني احتيالية، أو صنع وصفات طبية مزيفة، أو تقديم تعليمات حول كيفية ارتكاب الجرائم. تُسمى هذه الحيل "كسر الحماية" (Jailbreaks).

في الوقت الحالي، الطريقة التي نحاول بها منع هذه الحيل تشبه وضع لوحة "ممنوع الدخول". إذا رأى الروبوت طلباً يبدو سيئاً، فإنه يقول "لا". لكن الأشرار الأذكياء بارعون في التمويه، حيث يمكنهم جعل طلباتهم السيئة تبدو كأنها طلبات عادية، مما يسمح لها بالتسلل عبر اللوحة.

إليك MANATEE: "فلتر السلامة" لعقل الروبوت.

يقدم البحث وسيلة دفاع جديدة تسمى MANATEE. بدلاً من مجرد التحقق مما إذا كان الطلب يبدو سيئاً، يقوم MANATEE بالتحقق مما إذا كانت "عملية التفكير" لدى الروبوت تبدو "غير طبيعية".

إليك كيف يعمل، باستخدام بعض التشبيهات البسيطة:

1. "الخريطة الذهنية" للأفكار الجيدة

تخيل أن عقل الروبوت يحتوي على خريطة ضخمة وغير مرئية لكل الأفكار "الجيدة" و"الآمنة" التي يُفترض أن تكون لديه. لنطلق عليها اسم المجال الآمن (Benign Manifold).

  • عندما يُسأل الروبوت سؤالاً عادياً (مثل "ما هي حالة الطف؟")، فإن فكرته الداخلية تستقر في منتصف هذه الخريطة الآمنة تماماً.
  • عندما يخدع شخص شرير الروبوت، يتم دفع فكرة الروبوت الداخلية إلى حافة هذه الخريطة، أو حتى إلى منطقة غريبة وغير معروفة حيث لا توجد "أفكار جيدة".

2. "كلب الشم" (كشف الشذوذ)

يعمل MANATEE ككلب شم فائق الذكاء يراقب أفكار الروبوت في الوقت الفعلي.

  • هو لا يقرأ الكلمات التي كتبها المستخدم. بدلاً من ذلك، ينظر إلى "هالة" أو "جو" الروبوت الداخلي (حالته الخفية).
  • إذا استقرت الفكرة في المنطقة الآمنة، يقول الكلب: "كل شيء آمن!"
  • إذا استقرت الفكرة في المنطقة الغريبة والخطيرة، ينبح الكلب: "هناك خطب ما هنا! هذا لا ينتمي إلى خريطتنا!"

3. "المغناطيس" (توجيه الانتشار)

هذا هو الجزء السحري. في الماضي، إذا نبح الكلب، كان الروبوت ببساطة يرفض الإجابة (مثل أسطوانة مكسورة تقول "لا يمكنني فعل ذلك").

MANATEE مختلف. فهو يستخدم نموذج الانتشار (Diffusion Model) (وهو نوع من الذكاء الاصطناعي الشهير بتحويل الضجيج العشوائي إلى صور واضحة) ليعمل مثل المغناطيس.

  • عندما يمتلك الروبوت فكرة "سيئة" منحرفة قليلاً عن المسار، يقوم MANATEE بسحب تلك الفكرة بلطف للعودة إلى مركز الخريطة الآمنة.
  • الأمر يشبه إذا كنت تمشي على حبل مشدود وبدأت تترنح؛ فبدلاً من مجرد إيقافك، تقوم شبكة أمان بدفعك بلطف للعودة إلى المركز لتتمكن من مواصلة المشي بأمان.
  • بمجرد سحب الفكرة إلى المنطقة الآمنة، يقوم الروبوت بإنشاء إجابة مفيدة وآمنة.

4. "التوقف القسري" (الرفض)

إذا كانت فكرة الروبوت بعيدة جداً عن الخريطة لدرجة أنها تائهة تماماً في البرية (هجوم متطور للغاية)، فإن قوة المغناطيس لن تكون كافية لسحبها. في هذه الحالة، يفعل MANATEE "لا" قاطعة ويرفض الإجابة. هذا هو خطة الطوارئ.

لماذا يعد هذا أمراً مهماً؟

  • لا حاجة لإعادة التدريب: لا يتعين عليك إعادة تعليم الروبوت من الصفر. أنت فقط تضيف نظام "المغناطيس" هذا فوقه.
  • يعمل على الروبوتات القديمة: يعمل على أنواع مختلفة من الروبوتات (Mistral, Llama, Gemma) دون الحاجة لمعرفة شفراتها البرمجية الخاصة.
  • يحافظ على ذكاء الروبوت: لأن MANATEE يقوم فقط بتعديل الأفك "السيئة" ويترك الأفك "الجيدة" كما هي، يظل الروبوت ذكياً ومفيداً للمستخدمين العاديين. لا يصبح عابساً أو عديم الفائدة.

باختصار:
تخيل حارسًا عند مدخل ملهى ليلي. الحراس القدامى يكتفون بالنظر إلى هويتك ويقولون "لا" إذا بدوت مريباً. MANATEE هو حارس يراقب طريقة مشيك عند دخول الملهى. إذا تعثرت وبدوت وكأنك على وشك افتعال شجار، فإنه يوجهك بلطف للعودة إلى ساحة الرقص. أما إذا كنت تحاول بوضوح إثارة أعمال شغب، فعندئذٍ يطردك. إنه يحافظ على المتعة والأمان دون إفساد الأجواء على الضيوف الجيدين.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →