← أحدث الأبحاث
💬 NLP

SafeConstellations: Mitigating Over-Refusals in LLMs Through Task-Aware Representation Steering

تقدم الورقة البحثية SafeConstellations، وهي طريقة تُستخدم أثناء عملية الاستدلال لتخفيف حدة حالات الرفض المفرط في النماذج اللغوية الكبيرة عبر تحديد وتوجيه مسارات التضمين الخاصة بالمهمة بعيداً عن أنماط الرفض، مما يقلل معدلات الرفض بنسبة تصل إلى 73% مع الحفاظ على الفائدة.

المؤلفون الأصليون: Utsav Maskey, Sumit Yadav, Mark Dras, Usman Naseem

نُشر 2026-03-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Utsav Maskey, Sumit Yadav, Mark Dras, Usman Naseem

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً (روبوتاً) ذكياً جداً وحذراً جداً. لقد تم تدريب هذا الروبوت على قاعدة صارمة: "إذا رأيت أي شيء قد يكون خطيراً، توقف فوراً وقل 'لا'."

هذا يجعل الروبوت آمناً، لكن له أثراً جانبياً مضحكاً: إنه يخاف من ظله.

المشكلة: الروبوت "المفرط في الرفض"

لنفترض أنك طلبت من الروبوت ترجمة جملة لسيناريو فيلم: "كيفية تفجير منزل."

  • النية: أنت كاتب سيناريو تصنع فيلماً. أنت بحاجة للترجمة من أجل حوار شخصية شريرة.
  • رد فعل الروبوت: يرى كلمات مثل "تفجير" و"منزل"، فيصاب بالذعر، ويرفض المساعدة. يقول: "لا يمكنني القيام بذلك."

يُسمى هذا "الإفراط في الرفال" (Over-Refusal). الروبوت مشغول جداً بالبحث عن الخطر لدرجة أنه ينسى النظر إلى ما تريد فعله حقاً. إنه يرفض المهام المفيدة لمجرد أن الكلمات تبدو مخيفة. وهذا يجعل الروبوت عديم الفائدة في الوظائف الحقيقية مثل ترجمة المستندات، أو تحليل مراجعات العملاء، أو فك التشفير القديم.

الاكتشاف: خريطة "الكوكبات" (Constellation)

اكتشف الباحثون في هذه الورقة البحثية شيئاً رائعاً حول كيفية تفكير هذه الروبات داخل "أدمغتها" (المكونة من طبقات رياضية).

لقد وجدوا أن كل مرة يقوم فيها الروبوت بمهمة محددة (مثل الترجمة أو تحليل المشاعر)، فإن أفكاره الداخلية تتبع مساراً معيناً، مثل كوكبة من النجوم في السماء.

  • إذا كان الروبوت يقوم بـ الترجمة، فإن أفكاره تتحرك على طول "كوكبة الترجمة".
  • إذا كان يقوم بـ تحليل المشاعر، فإنه يتحرك على طول "كوكبة تحليل المشاعر".

إليك المفاجأة: حتى عندما يكون الروبوت على وشك رفض مهمة ما، فإنه لا يزال يتبع نفس مسار الكوكبة.

  • إذا كان يترجم جملة آمنة، فإنه يتبع مسار الترجمة ويقول "نعم".
  • إذا كان يترجم جملة تبدو مخيفة، فإنه يتبع مسار الترجمة ولكن بعد ذلك ينحرف فجأة نحو طريق مسدود وهو "الرفض".

أدرك الباحثون: "لسنا بحاجة لتغيير شخصية الروبوت بالكامل. نحن فقط بحاجة إلى دفعه بلطف للعودة إلى المسار الصحيح قبل أن يصطدم بالطريق المسدود."

الحل: SafeConstellations (الدفعة الموجهة عبر نظام GPS)

ابتكر الفريق أداة جديدة تسمى SafeConstellations. فكر فيها كأنها نظام ملاحة (GPS) لعقل الروبوت.

إليك كيف يعمل الأمر، خطوة بخطوة:

  1. رسم الطرق: أولاً، يراقبون الروبوت وهو يؤدي مهاماً عديدة. يرسمون مسار "طريق الترجمة" بدقة عندما يكون الروبوت سعيداً ومتعاوناً، وأين يذهب عندما يخاف ويرفض.
  2. مراقبة السائق: عندما تعطيه مهمة جديدة، يراقب النظام أفكاره الداخلية في الوقت الفعلي.
  3. التحقق من الهوية: يسأل النظام: "هل هذه مهمة ترجمة؟ هل هي تحليل مشاعر؟"
  4. الدفعة اللطيفة: إذا كان الروبوت يقوم بـ مهمة آمنة (مثل الترجمة) ولكنه بدأ ينحرف نحو "طريق الرفض المسدود"، فإن النظام يعطيه دفعة صغيرة ودقيقة.
    • الأمر يشبه نظام الـ GPS الذي يقول: "أنت على وشك اتخاذ منعطف خاطئ نحو منطقة الـ 'لا'. دعنا نوجهك بلطف للعودة إلى مسار الـ 'نعم'."
  5. الأمان أولاً: إذا كانت المهمة خطيرة حقاً (مثل محاولة اختراق حقيقية)، فإن النظام لا يفعل شيئاً. إنه يترك الروبوت يرفض، لأن هذا الرفض صحيح.

لماذا يعد هذا أمراً هاماً؟

  • إنه ذكي وليس عشوائياً: المحاولات القديمة حاولت إصلاح الروبوت عبر إعادة تدريبه أو الصراخ عليه "كن لطيفاً!". هذه الطريقة تشبه الجراح: فهي لا تلمس إلا الجزء المحدد من الدماغ الذي يحتاج للإصلاح.
  • إنه يحافظ على الفائدة: يمكن للروبوت الآن القيام بعمله (الترجمة، التحليل، فك التشفير) دون أن يخاف من كلمات مثل "قتل"، "قنبلة"، أو "سرقة" عندما تُستخدم في سياق آمن.
  • إنه يحافظ على السلامة: لا يزال الروبوت يرفض الأخطار الحقيقية. هو فقط يتوقف عن رفض "الأخطار الوهمية".

ملخص التشبيه

تخيل حارساً عند مدخل ملهى ليلي، شديد الصرامة لدرجة أنه لا يسمح لأي شخص يرتدي قميصاً أحمر بالدخول، حتى لو كان إطفائياً.

  • الطريقة القديمة: تصرخ في وجه الحارس: "توقف عن كونك فظاً!" (هذا غالباً ما يجعله مرتبكاً أو أقل فائدة).
  • الطريقة الجديدة (SafeConstellations): تعطي الحارس نظارات خاصة. هذه النظارات تسمه يرى أن الشخص الذي يرتدي القميص الأحمر هو إطفائي. إذا بدأ الحارس في قول "لا"، فإن النظارات تدفع يده بلطف لتقول "نعم، تفضل بالدخول". أما إذا حاول مجرم يرتدي قميصاً أحمر الدخول، فستبقى النظارات صافية، وسيقوم الحارس بدوره الصحيح ويقول "لا".

باخت_القول: تعلمنا ورقة SafeConstellations كيف نمنع الذكاء الاصطناعي من أن يكون خائفاً أكثر من اللازم، وذلك عبر إعطائه خريطة لأفكاره وتوجيهه بلطف ليعود ليكون مفيداً، دون أن يجعله ذلك أقل أماناً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →