← أحدث الأبحاث
🤖 machine learning

Pruning Unsafe Tickets: A Resource-Efficient Framework for Safer and More Robust LLMs

تقدم هذه الورقة إطار عمل للتقليم (pruning) كفؤاً في استهلاك الموارد وخالياً من التدرج (gradient-free)، يحدد ويزيل "التذاكر غير الآمنة" (المعلمات التي تسبب سلوكيات ضارة) من النماذج اللغوية الكبيرة لتعزيز السلامة والمتانة ضد عمليات الاختراق (jailbreaks) مع الحفاظ على الفائدة بأقل تكلفة حوسبية.

المؤلفون الأصليون: Wai Man Si, Mingjie Li, Michael Backes, Yang Zhang

نُشر 2026-04-20
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Wai Man Si, Mingjie Li, Michael Backes, Yang Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً (روبوت) موهوباً للغاية وذكياً جداً. لقد قمت بتدريبه ليكون مفيداً، مبدعاً، وجيداً في كتابة القصص. لكن هناك مشكلة: نظرًا لأنه تعلم من الإنترنت بأكمله، فقد اكتسب أيضاً بعض "العادات السيئة". إذا سألته بالطريقة الصحيحة (أو الخاطئة)، فقد يخبرك بالخطأ بكيفية صنع قنبلة، أو يكتب خطاب كراهية، أو يقدم نصيحة طبية خطيرة.

الطريقة القياسية الحالية لإصلاح ذلك هي مثل إعادة تدريب الروبوت. تجلس معه وتعرض عليه آلاف الأمثلة للإجابات "الجيدة" مقابل الإجابات "السيئة"، وتأمل أن يتعلم أن يكون مهذباً. لكن هذا مكلف، ويستغرق وقتاً طويلاً، وأحياناً ينسى الروبوت عاداته السيئة القديمة عندما لا تكون موجوداً، أو يصبح خائفاً جداً من ارتكاب الأخطاء لدرجة أنه يرفض الإجابة على أي شيء (حتى الأسئلة الآمنة).

يقترح هذا البحث حلاً أذكى، أخف، وأسرع بكثير. يطلقون عليه اسم "تقليم التذاكر غير الآمنة" (Pruning Unsafe Tickets).

إليك كيف يعمل الأمر، باستخدام بعض التشبيهات البسيطة:

1. تشبيه "تذكرة اليانصيب"

تخيل أن عقل الروبوت عبداً عن قاعة يانصيب ضخمة مليئة بالملايين من التذاكر الصغيرة والمخفية.

  • التذاكر الآمنة: هي الخلايا العصبية (الروابط في الدماغ) التي تساعد الروبوت على كتابة قصيدة، أو حل مسألة رياضية، أو قول "لا يمكنني المساعدة في ذلك".
  • التذاكر غير الآمنة: هي روابط محددة ومخفية، إذا تم تفعيلها، تجعل الروبوت يقول شيئاً خطيراً.

يجادل المؤلفون بأنه حتى بعد محاولتنا "ضبط" (align) الروبوت، فإن هذه التذاكر غير الآمنة لا تزال موجودة هناك، كامنة ولكنها مستعدة للاندفاع إذا خدع شخص ما الروبوت بـ "مطالبة اختراق" (jailbreak prompt).

2. استراتيجية "تعشيب الحديقة"

بدلاً من إعادة زراعة الحديقة بأكملها (إعادة التدريب)، يقترح المؤلفون نهج "التعشيب الجراحي".

  • الخطوة 1: إيجاد الأعشاب الضارة (توصيف السلوك): يسألون الروبوت مجموعة من الأسئلة الماكرة لمعرفة متى وكيف يبدأ في التصرف بشكل سيء بالضبط.
  • الخطوة 2: تتبع الجذور (الإسناد): يستخدمون أداة خاصة لمعرفة أي الروابط الصغيرة (الخلايا العصبية) التي تضيء بالضبط عندما يوشك الروبوت على قول شيء سيء. إنهم يتجاهلون الأجزاء من الدماغ المستخدمة للتفكير في المواضيع الآمنة.
  • الخطوة 3: قص الجذور (التقليم): يقومون فعلياً بقطع (تقليم) تلك الروابط المحددة. هم لا يكتفون بإيقاف تشغيلها فحسب؛ بل يزيلونها من دماغ الروبوت تماماً.

3. النتيجة: "تذكرة السلامة"

بمجرد قطع كل "التذاكر غير الآمنة"، يحدث شيء سحري. هيكل الدماغ المتبقي — "تذكرة السلامة" — يكون بطبيعته أكثر أماناً.

  • لا يزال يعرف كيفية كتابة الكود، وإلقاء النكات، والإجابة على الأسئلة (لم يفقد ذكاءه).
  • ولكن الآن، إذا حاولت خداعه لقول شيء خطير، فإن "المسار" نحو تلك الإجابة السيئة قد اختفى حرفياً. الروبوت ببساطة لا يستطيع توليد تلك الجملة الضارة.
  • بدلاً من إعطاء إجابة خطيرة، يعود طبيعياً إلى قول "لا يمكنني القيام بذلك"، لأن المسار العصبي للإجابة السيئة قد تمت إزالته.

لماذا يعد هذا أفضل من الطرق القديمة؟

الطريقة القديمة (إعادة التدريب) الطريقة الجديدة (التقليم)
مثل إعادة بناء منزل: تحتاج إلى طاقم ضخم، الكثير من المال، وأشهر من العمل. مثل إصلاح تسريب: تجد الأنبوب المحدد وتصلحه في بضع ساعات.
ثقيلة: تتطلب أجهزة كمبيوتر ضخمة وذاكرة هائلة. خفيفة: يمكن تشغيلها على أجهزة الكمبيوتر القياسية، بل وتوفر المساحة أيضاً.
هشة: قد ينسى الروبوت القواعد أو يصبح حذراً للغاية (يرفض الإجابة على أي شيء). قوية: يظل الروبوت ذكياً ومفيداً ولكنه غير قادر مادياً على توليد المخرجات السيئة.
بطيئة: تستغرق أياماً للتدريب. سريعة: يظهر البحث أنهم قاموا بذلك في أقل من 10 دقائق لنموذج كبير!

تشبيه "قاطع التيار"

فكر في دماغ الروبوت مثل منزل به توصيلات كهربائية.

  • الطريقة القديمة: تحاول إقناع الكهرباء بالتدفق بشكل مختلف من خلال الصراخ في صندوق المصهرات (الفيوزات). أحياناً ينجح الأمر، وأحياناً لا.
  • طريقة هذا البحث: تجد السلك المحدد الذي يشغل "الجهاز الخطير" وتقطع السلك. الآن، مهما حاولت تشغيل المفتاح، لا يمكن للجهاز أن يعمل ببساطة. بقية أجزاء المنزل (الأجزاء المفيدة) تعمل بشكل مثالي.

الملخص

يقدم هذا البحث طريقة لجعل الذكاء الاصطناعي أكثر أماناً عن طريق إزالة الأجزاء المحددة من دماغه التي تسبب الضرر، بدلاً من محاولة تعليمه قواعد جديدة. إنه يشبه أخذ سكين من يد طفل بدلاً من مجرد إخباره "لا تجرح نفسك". إنه أسرع، وأرخص، ويجعل من الصعب جداً خداع الذكاء الاصطناعي، مع الحفاظ على ذكائه وفائدته.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →