Subspace Inference Enables Efficient Active Reward Learning from Preferences
تقدم هذه الورقة البحثية PreferenceEKF، وهي طريقة تعلم نشط ذات كفاءة في استخدام العينات تستفيد من مرشح كالمان الموسع ضمن فضاء فرعي للمعلمات منخفض الأبعاد لتمكين التقييم الكمي القابل للتوسع لعدم اليقين في نماذج مكافأة الشبكات العصبية، مما يؤدي إلى تحسين كفاءة وأداء التعلم التعزيزي من التغذية الراجعة البشرية.
في عالم الذكاء الاصطناعي، هناك تحدٍ مستمر يُعرف باسم "عدم كفاءة العينات" في التعلم من التغذية الراجعة البشرية. تخيل تعليم برنامج كمبيوتر معقد كيف يتصرف بما يتماشى مع القيم البشرية. تتضمن الطريقة الأكثر قوة المتاحة حاليًا طلب مقارنة نتيجتين مختلفتين من البشر — مثل حركتين مختلفتين لروبوت أو استجابتين مكتوبتين — وتحديد أيهما يفضلون. ورغم أن تقديم هذه التفضيلات أمر سهل للبشر، إلا أنها شحيحة للغاية؛ فالتفضيل الواحد لا يقدم سوى جزء ضئيل جدًا من المعلومات. لبناء نموذج موثوق لما يريده البشر، يجب على الخوارزمية طرح آلاف الأسئلة من هذا النوع. وإذا طرح الكمبيوتر الأسئلة الخاطئة، فإنه يهدر الوقت والمال. أما إذا طرح الأسئلة الصحيحة، فإنه يتعلم بسرعة أكبر بكثير. تكمن الصعوبة في معرفة أي الأسئلة ستكون الأكثر إفادة. وللقيام بذلك، يحتاج الكمبيوتر إلى فهم ما لا يعرفه بعد، وهو مفهوم يُسمى "عدم اليقين". ومع ذلك، فإن حساب عدم اليقين هذا للشبكات العصبية الضخمة والحديثة أمر صعب للغاية ومكلف حاسوبيًا، وغالبًا ما يتطلب تدريب عشرات النماذج المنفصلة لمجرد الحصول على تقدير تقريبي.
لقد طور فريق من الباحثين في جامعة جنوب كاليفورنيا نهجًا جديدًا لحل هذه العقبة، مما يسمح لأجهزة الكمبيوتر بالتعلم من التفضيلات البشرية بسرعة وكفاءة أكبر بكثير. فقد قدموا طريقة تسمى "PreferenceEKF"، والتي تعامل عملية تعلم التفضيلات كمسألة ترشيح مستمرة وخطوة بخطوة بدلاً من كونها عملية حسابية ضخمة تُجرى لمرة واحدة. وبدلاً من محاولة رسم خريطة لكل التباينات الممكنة لشبكة عصبية عملاقة في وقت واحد، أدرك الباحثون أنه يمكن تتبع سلوك الشبكة بدقة ضمن مساحة أصغر بكثير ومنخفضة الأبعاد. ومن خلال تركيز حساباتهم على هذا الفضاء الفرعي المدمج، تمكنوا من استخدام أداة رياضية كلاسيكية، وهي "مرشح كالمان الموسع"، لتحديث فهم النموذج في الوقت الفعلي مع وصول إجابات جديدة. سمحت هذه التقنية بتوليد آلاف النسخ المختلفة من نموذج المكافأة فورًا، دون التكلفة الحسابية الثقيلة لتدريب شبكات مستقلة متعددة.
اختبر الباحثون طريقتهم مقابل عدة تقنيات موجودة باستخدام مجموعة متنوعة من المعايير القياسية للتحكم الروبوتي واتخاذ القرار. ووجدوا أن نهجهم لم يكن أسرع بشكل ملحوظ فحسب — حيث يعمل بسرعة تصل إلى أربعين ضعفًا مقارنة ببعض البدائل الأكثر تقدمًا — بل كان أيضًا أكثر دقة في تنبؤاته. وفي التجارب التي كان الهدف منها تعلم نموذج مكافأة من عدد محدود من المقارنات البشرية، تعلمت الطريقة الجديدة التفضيلات الصحيحة باستمرار باستخدام عدد أقل من الأسئلة مقارنة بالطرق الأخرى. علاوة على ذلك، كانت النماذج التي أنتجتها أكثر ضبطًا، مما يعني أن ثقة الكمبيوتر في إجاباته كانت تتطابق مع الدقة الفعلية لتلك الإجابات بشكل أوثق. هذه الدقة حيوية للتعلم النشط، حيث يجب على النظام تحديد السؤال التالي الذي سيطرحه؛ فإذا كان النظام غير متأكد، فإنه يطرح سؤالًا لحسم عدم اليقين هذا، وإذا كان واثقًا، فإنه يمضي قدمًا. وقد تفوقت الطريقة الجديدة في عملية التوازن هذه، مما أدى إلى نماذج مكافأة يمكنها تدريب السياسات الروبوتية لأداء مهام معقدة، لتطابق أداء السياسات التي تم تدريبها باستخدام طرق أكثر تكلفة واستهلاكًا للوقت.
أحد الجوانب الأكثر لفتا للنظر في هذا العمل هو كيفية تغييره لسير عمل التدريب لهذه الأنظمة. غالبًا ما تتطلب الطرق التقليدية من الكمبيوتر إعادة تدريب أو إعادة تقييم فهمه الكامل للعالم في كل مرة يتلقى فيها قطعة جديدة من التغذية الراجعة، وهي عملية تصبح أبطأ كلما كبر النظام. وفي المقابل، يقوم النهج الجديد بتحديث معرفته بشكل تسلسلي، حيث يدمج فقط أحدث قطعة من المعلومات مع الحفاظ على تقدير مستمر لما تعلمه حتى الآن. وهذا يسمح للنظام بالتوسع بكفاءة، والتعامل مع شبكات عصبية أكبر وتوليد المزيد من العينات لنماذج المكافأة الممكنة دون نفاد الذاكرة أو الوقت. كما أظهر الباحثون أن هذا النهج يعمل حتى عند البدء بدون بيانات أولية، باستخدام تقنية الإسقاط العشوائي لبناء الفضاء الفرعي اللازم من الصفر، وأظهر وعودًا عند تطبيقه على المهام القائمة على الصور حيث تكون البيانات المدخلة أكثر تعقيدًا من مجرد أرقام بسيطة.
بينما يظهر هذا الأسلوب وعودًا كبيرة، يوضح الباحثون حدود عملهم بعناية. يفترض الإطار الرياضي الذي استخدموه أن التفضيلات التي يتم تعلمها تأتي من مصدر واحد ثابت. وعندما اختبروا النظام باستخدام بيانات من عدة معلقين بشريين قد تكون لديهم آراء متضاربة، واجهت الطريقة صعوبة في استيعاب التعقيد الكامل لتلك الآراء المختلفة. وهذا يشير إلى أنه بينما يعد هذا النهج أداة قوية لتبسيط عملية التعلم، فإنه الأنسب للسيناريوهات التي يتم فيها نمذجة مجموعة واحدة متماسكة من التفضيلات. ومع ذلك، تشير النتائج إلى خطوة كبيرة للأمام في جعل الذكاء الاصطناعي أكثر قدرة على التكيف مع النوايا البشرية. فمن خلال جعل عملية التعلم من التغذية الراجعة أسرع وأكثر كفاءة، يزيل هذا العمل حاجزًا رئيسيًا أمام نشر الأنظمة الذكية في بيئات العالم الحقيقي، من التوصيات الشخصية إلى الروبوتات المستقلة، حيث تكون تكلفة وقت الإنسان عالية والحاجة إلى التعلم السريع والدقيق أمرًا بالغ الأهمية.
ملخص تقني: الاستدلال في الفضاء الجزئي يُمكّن من التعلم النشط الفعال للمكافآت من التفضيلات
بيان المشكلة
يُعد التعلم التعزيزي من التغذية الراجعة البشرية (RLHF) تقنية مهيمنة لمواءمة الوكلاء مع النوايا البشرية، ومع ذلك فإنه يعاني من ضعف كفاءة العينات. ونظرًا لأن التغذية الراجعة للتفضيلات البشرية توفر بتًا واحدًا على الأكثر لكل استعلام، فإن تعلم نموذج المكافأة (RM) غالبًا ما يتطلب آلاف المقارنات، وهو أمر غير قابل للتوسع. يعالج التعلم النشط هذه المشكلة من خلال اختيار الاستعلامات بحكمة لتعظيم كسب المعلومات. ومع ذلك، يتطلب التعلم النشط الفعال تقديرًا قويًا لعدم اليقين (UQ) لنموذج المكافأة.
بينما توفر الطرق البايزية تمثيلاً مبدئيًا لعدم اليقين، إلا أنها تواجه صعوبة في التوسع لتشمل نماذج المكافأة ذات الشبكات العصبية (NN) الضخمة بسبب عدم القدرة الحسابية على إجراء الاستدلال البعدي فوق مساحات المعلمات عالية الأبعاد. وفي المقابل، فإن البدائل الشائعة مثل طرق التجميع (Ensemble methods) أو تقنية "الانسحاب" (Dropout) إما أن تكون مكلفة حاسوبيًا (تتطلب تدريب نماذج مستقلة متعددة) أو توفر تقريبات بعدية ضعيفة. ويتمثل التحدي الجوهري في تطوير طريقة تُمكّن من تعلم نشط للنماذج ذات الكفاءة في العينات لنماذج مكافأة الشبكات العصبية دون الأعباء الإضافية لتدريب المجموعات (Ensembles).
المنهجية: PreferenceEKF
يقترح المؤلفون PreferenceEKF، وهو نهج فعال في العينات يضع التعلم النشط للتفضيلات في إطار مشكلة تصفية بايزية متسلسلة. تعتمد الطريقة على رؤيتين أساسيتين:
التصفية المتسلسلة: بدلاً من التدريب بالدفعات (Batch training)، تقوم الطريقة بتحديث البعدي لنموذج المكافأة بشكل متسلسل مع وصول استعلامات تفضيل جديدة، باستخدام مرشح كالمان الموسع (EKF).
الاستدلال في الفضاء الجزئي (Subspace Inference): من خلال إدراك أن الشبكات العصبية مفرطة في التخصيص (Overparameterized) وأن الحلول غالبًا ما تكمن في فضاء جزئي منخفض الأبعاد، تقوم الطريقة بإجراء استدلال EKF داخل هذا الفضاء الجزئي بدلاً من فضاء المعلمات الكامل.
سير العمل التقني
بناء الفضاء الجزئي:
تُستخدم مجموعة بيانات أولية لتشغيل خوارزمية الانحدار الاشتقاقي العشوائي (SGD) لبضع دورات.
تُستخدم تكرارات المعلمات الناتلة لبناء فضاء جزئي منخفض الأبعاد. يتم ذلك عبر تفكيك القيم المفردة (SVD) لتكرارات SGD للحصول على مصفوفة إسقاط A، أو عبر عمليات إسقاط عشوائية بديلة.
يتم تقريب فضاء المعلمات الكامل θ عبر رسم خرائط تآلفي θ(z)=Az+θ∗، حيث تمثل z معلمات الفضاء الجزئي منخفض الأبعاد (∣z∣≪∣θ∣).
التصفية البايزية المتسلسلة (EKF):
تعامل الطريقة معلمات الشبكة العصبية كحالات خفية تتطور بمرور الوقت.
نموذج الديناميكيات: يفترض دالة هوية مع ضوضاء غاوسية مضافة (p(θi∣θi−1)=N(θi∣θi−1,U)).
نموذج القياس: يستخدم نموذج برادلي-تيلي (BT) للتنبؤ بملصقات التفضيل بناءً على أزواج المسارات. يتم خطية نموذج احتمالية BT حول المتوسط البعدي الحالي ليتناسب مع إطار عمل EKF.
خطوة التحديث: عند استقبال زوج جديد من الاستعلام والاستجابة (Qi,yi)، يقوم EKF بتحديث التوزيع البعدي لمعلمات الفضاء الجزئي z في شكل مغلق. يظل التوزيع البعدي توزيعًا غاوسيًا: bi=N(μi′,Σi′).
حلقة التعلم النشط:
تقوم الطقة بأخذ عينات من أي عدد من النماذج من التوزيع البعدي للفضاء الجزئي.
يتم إسقاط هذه العينات مرة أخرى إلى الفضاء الكامل لحساب دوال الاستحواذ (Acquisition functions). يستخدم المؤلفون تحديدًا InfoGain (المعلومات المتبادلة بين ملصق الاستعلام ومعلمات النموذج) لاختيار الاستعلام الأكثر إخبارًا.
على عكس طرق التجميع التي تعيد التدريب على جميع البيانات، يقوم PreferenceEKF بالتحديث فقط بناءً على الاستعلام الأخير، مما يجعله فعالاً حاسوبيًا.
المساهمات الرئيسية
أول تصفية في الفضاء الجزئي لنماذج مكافأة الشبكات العصبية: تزعم الورقة أنها الأولى التي تستخدم التصفية في الفضاء الجزئي لتدريب نماذج مكافأة الشبكات العصبية من التغذية الراجعة للتفضيلات.
استدلال بايزي قابل للتوسع: من خلال قصر الاستدلال على فضاء جزئي منخفض الأبعاد، تجعل الطريقة مرشح كالمان الموسع (EKF) قابلاً للتطبيق على الشبكات العصبية العميقة، متجنبة تعقيد O(∣θ∣2) لمصفوفات التباين الكاملة.
حساب فعال لدالة الاستحواذ: تتيح القدرة على أخذ عدد غير محدود من العينات من التوزيع البعدي للفضاء الجزئي الحساب القابل للتوسع لـ InfoGain، وهي دالة استحواذ متطورة كانت مقيدة سابقًا بالنماذج منخفضة الأبعاد.
لا يوجد عبء تدريب إضافي للمجموعات (Ensemble): على عكس DeepEnsembles، لا يتطلب PreferenceEKF تدريب نماذج مستقلة متعددة، مما يقلل بشكل كبير من وقت التشغيل واستخدام الذاكرة.
النتائج التجريبية
قيم المؤلفون PreferenceEKF على معايير D4RL و V-D4RL عبر 12 مهمة تتضمن حركة MuJoCo، والتحكم في Adroit، والملاحة في Maze2D. وقارنوه بأربعة خطوط أساس (Baselines): DeepEnsemble، وDropout، وLaplace Approximation، وLast-Layer MCMC (LLMCMC).
كفاءة العينات: أظهر PreferenceEKF أداءً يضاهي أو يتفوق على جميع خطوط الأساس للتعلم العميق البايزي من حيث كفاءة العينات واللوغاريتم النهائي للاحتمالية (log-likelihood) على استعلامات الاختبار المحجوزة.
وقت التشغيل والقابلية للتوسع:
حقق PreferenceEKF تسريعًا بنحو 5 أضعاف مقارنة بـ DeepEnsemble وأكثر من 40 ضعفًا مقارنة بـ LLMCMC.
تتوسع الطريقة بسلاسة مع كل من عدد عينات التوزيع الخلفي (M) وحجم بنية الشبكة العصبية، بينما تعاني الخطوط الأساسية (خاصة المجموعات) من قيود الذاكرة أو مشاكل التوسع الخطي.
المعايرة (Calibration): أظهر PreferenceEKF معايرة فائقة، محققًا أدنى خطأ معايرة متوقع (ECE) بين جميع الطرق وثاني أدنى درجة في مقياس Brier.
تحسين السياسة (Policy Optimization): عندما استُخدمت نماذج المكافأة المتعلمة في التعلم التعزيزي غير المتصل (عبر Implicit Q-Learning)، حققت السياسات الناتلة أداءً تنافسيًا مع تلك المدربة باستخدام نماذج مكافأة من طرق أخرى، وغالبًا ما طابقت أو قللت قليلاً عن سياسة المكافأة الحقيقية.
المتانة: ظلت الطريقة فعالة حتى بدون مجموعة بيانات إحماء أولية (باستخدام الإسقاطات العشوائية)، وأظهرت إمكانات في حالات التغذية الراجعة الشحيحة (بيانات الروبوت الحقيقية) والمهام القائمة على البكسل (باستخدام تضمينات الصور سابقة التدريب).
الأهمية والادعاءات
تضع الورقة PreferenceEKF كحل قابل للتوسع للتعلم العميق البايزي لنماذج مكافأة الشبكات العصبية الضخمة في RLHF. يزعم المؤلفون أن نهجهم يوازن بنجاح بين الحاجة إلى تمثيل مبدئي لعدم اليقين وبين القابلية للتطبيق حاسوبيًا.
الكفاءة: المساهمة الأساسية هي تحسين كفاءة العينات لتعلم المكافأة القائم على التفضيل مع تقليل التكلفة الحسابية للتدريب والاستدلال بشكل جذري مقارنة بالطرق البايزية الموجودة.
العملية: تمكن الطريقة من استخدام دوال استحواذ عالية الأبعاد مثل InfoGain للشبكات العصبية، وهو أمر كان غير ممكن سابقًا.
القيود: يقر المؤلفون بتواضع بأن الافتراض الغاوسي لـ EKF يحد من قدرة الطريقة على التعامل مع إعدادات الموضح الواحد (التوزيعات البعدية أحادية المنوال)، وأن توسيعها لتشمل نماذج مكافأة بمقياس النماذج التأسيسية (Foundation models) أو التفضيلات متعددة الأنماط (مثل تنوع الموضحين البشر) يظل تحديًا مفتوحًا. كما يشيرون إلى أنه بينما تؤدي نماذج المكافأة الخاصة بهم إلى سياسات تنافسية، فإن الارتباط المباشر بين لوغاريتم احتمالية نموذج المكافأة وأداء السياسة النهائي معقد وليس مضمون التحسن بمجرد تحسين تعلم المكافأة.
في الختام، تثبت الورقة أن الاستدلال في الفضاء الجزئي عبر EKF يقدم بديلًا قابلًا للتوسع، وفعالًا، ومعايرًا جيدًا لطرق التجميع وغيرها من طرق التعلم العميق البايزي للتعلم النشط من التفضيلات البشرية.