← أحدث الأبحاث
💻 computer science

Pref-CTRL: Preference Driven LLM Alignment using Representation Editing

يُعد Pref-CTRL إطار عمل مبتكر للمحاذاة أثناء وقت الاختبار، وهو يحسن أساليب تحرير التمثيل الحالية باستخدام دالة قيمة متعددة الأهداف مصممة لالتقاط بنية بيانات التفضيلات البشرية بشكل أفضل.

المؤلفون الأصليون: Imranul Ashrafi, Inigo Jauregi Unanue, Massimo Piccardi

نُشر 2026-04-28
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Imranul Ashrafi, Inigo Jauregi Unanue, Massimo Piccardi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً آلياً ذكياً للغاية، وسريعاً بشكل مذهل، ولكنه "مشاكس" أحياناً. هذا الروبوت يعرف كل شيء تقريباً، ولكن بما أنه تعلم من الإنترنت الواسع، الفوضوي، والسام أحياناً، فإنه قد يقول أحياناً أشياء وقحة، أو خطيرة، أو حتى خاطئة تماماً.

ولإصلاح ذلك، يستخدم معظم الناس "أسلوب التمدرس" (الضبط الدقيق - Fine-tuning). هذا يشبه إرسال الروبوت للعودة إلى المدرسة لعدة أشهر ليعيد تعلم كيفية التصرف. هذا الأسلوب فعال، لكنه مكلف للغاية، ويستهلك كمية هائلة من الطاقة، وهو بطيء جداً.

يقترح مؤلفو هذه الورقة البحثية طريقة مختلفة: "أسلوب عجلة القيادة" (Pref-CTRL).

الفكرة الجوهرية: التوجيه، وليس إعادة التدريب

بدلاً من إعادة تدريب دماغ الروبوت بالكامل (وهو ما يفعله معظم الناس)، قرر الباحثون ترك دماغ الروبوت كما هو تماماً. بدلاً من ذلك، أضافوا "آلية توجيه" صغيرة وخفيفة الوزن تعمل في الوقت الفعلي أثناء حديث الروبوت.

فكر في الأمر على هذا النحو: الروبوت عبارة عن سيارة سريعة الحركة. وبدلاً من إعادة بناء المحرك بالكامل لجعله يقود بشكل أكثر أماناً (الضبط الدقيق)، قاموا ببساطة بتركيب نظام GPS ومساعد توجيه عالي التقنية (تعديل التمثيل - Representation Editing) يقوم بدفع السيارة بلطف للعودة إلى المسار كلما بدأت تنحرف نحو الخندق.

المشكلة في التوجيه القديم (RE-Control)

قبل هذه الورقة، كان هناك أسلوب توجيه يسمى RE-Control. كان يعمل بشكل جيد نوعاً ما، لكن كان به عيب. فقد كان ينظر فقط إلى ما إذا كانت جملة واحدة "جيدة" أو "سيئة" بشكل منعزل.

تخيل مدرب قيادة ينظر إلى سيارتك في لحظة واحدة فقط ويقول: "هذا وضع جيد" أو "هذا وضع سيء". هذا المدرب لا يعلمك حقاً كيفية التنقل في مضمار سباق معقد؛ هو فقط يتفاعل مع لقطات ثابتة.

الحل: Pref-CTRL (مدرب القيادة "المحترف")

ابتكر الباحثون Pref-CTRL. إن "المدرب" الخاص بهم (دالة القيمة - Value Function) أكثر ذكاءً لأنه يفهم التفضيلات.

بدلاً من مجرد النظر إلى طريقة واحدة للقيادة، شاهد المدرب آلاف الفيديوهات لـ:

  1. السائق المحترف (الاستجابة المفضلة)
  2. السائق المتهور (الاستجابة المرفوضة)

من خلال المقارنة بينهما، يتعلم المدرب الفروق الدقيقة التي تجعل الاستجابة "الجيدة" تختلف عن الاستجابة "السيئة". وقد أضافوا "قاعدتين تدريبيتين" لهذا المدرب:

  1. قاعدة الفجوة (خسارة الهامش - Margin Loss): تخبر هذه القاعدة المدرب: "لا تلاحظ فقط أن السائق المحترف أفضل من السائق المتهور؛ بل لاحظ بالضبط مدى تفوقه. تأكد من وجود فجوة واضحة بينهما".
  2. قاعدة البقاء على المسار (المنظم - Regularizer): تمنع هذه القاعدة التوجيه من أن يكون عدوانياً للغاية. إذا دفع التوجيه السيارة بقوة كبيرة، فقد تنقلب السيارة أو تتصرف بشكل غريب. تقول هذه القاعدة: "ادفع السيارة نحو السائق المحترف، ولكن لا تجعلها تنحرف بعيداً عن مسارها الأصلي لدرجة تجعلها تفقد المعنى" .

لماذا يهم هذا؟ (النتائج)

عندما اختبروا هذا "المدرب المحترف" على الروبوت، حدثت ثلاثة أشياء مذهلة:

  • إنه أكثر أماناً: في أمثلة الورقة البحثية، عندما سُئل الروبوت عن كيفية القيام بشيء غير قانوني (مثل كيفية تسميم شخص ما)، فإن أسلوب التوجيه القديم قد يقدم نصيحة مفيدة عن طريق الخطأ. أما طريقة Pref-CTRL الجديدة فتدرك فوراً "المسار السيئ" وتوجه الروبوت نحو الرفض المهذب والآمن.
  • إنه أكثر ذكاءً: هو لا يتجنب الأشياء السيئة فحسب؛ بل يصبح في الواقع أفضل في كونِهِ مفيداً ومتماسكاً.
  • إنه متعدد الاستخدامات: حتى عندما سُئل الروبوت عن مواضيع لم يدرسها المدرب خصيصاً، ظل التوجيه يعمل. لقد تعلم مفهوم كونه مساعداً جيداً، وليس مجرد قائمة من القواعد.

باختكم: بدلاً من محاولة إعادة كتابة شخصية الروبوت بالكامل، يمنح Pref-CTRL الروبوت "بوصلة أخلاقية" ذكية تعمل في الوقت الفعلي، تدفعه نحو أن يكون مفيداً وآمناً دون الحاجة إلى تغيير دماغه الأساسي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →