← أحدث الأبحاث
🤖 machine learning

Subspace Inference Enables Efficient Active Reward Learning from Preferences

تقدم هذه الورقة البحثية PreferenceEKF، وهي طريقة تعلم نشط ذات كفاءة في استخدام العينات تستفيد من مرشح كالمان الموسع ضمن فضاء فرعي للمعلمات منخفض الأبعاد لتمكين التقييم الكمي القابل للتوسع لعدم اليقين في نماذج مكافأة الشبكات العصبية، مما يؤدي إلى تحسين كفاءة وأداء التعلم التعزيزي من التغذية الراجعة البشرية.

المؤلفون الأصليون: Yutai Zhou, Erdem Bıyık

نُشر 2026-09-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yutai Zhou, Erdem Bıyık

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الذكاء الاصطناعي، هناك تحدٍ مستمر يُعرف باسم "عدم كفاءة العينات" في التعلم من التغذية الراجعة البشرية. تخيل تعليم برنامج كمبيوتر معقد كيف يتصرف بما يتماشى مع القيم البشرية. تتضمن الطريقة الأكثر قوة المتاحة حاليًا طلب مقارنة نتيجتين مختلفتين من البشر — مثل حركتين مختلفتين لروبوت أو استجابتين مكتوبتين — وتحديد أيهما يفضلون. ورغم أن تقديم هذه التفضيلات أمر سهل للبشر، إلا أنها شحيحة للغاية؛ فالتفضيل الواحد لا يقدم سوى جزء ضئيل جدًا من المعلومات. لبناء نموذج موثوق لما يريده البشر، يجب على الخوارزمية طرح آلاف الأسئلة من هذا النوع. وإذا طرح الكمبيوتر الأسئلة الخاطئة، فإنه يهدر الوقت والمال. أما إذا طرح الأسئلة الصحيحة، فإنه يتعلم بسرعة أكبر بكثير. تكمن الصعوبة في معرفة أي الأسئلة ستكون الأكثر إفادة. وللقيام بذلك، يحتاج الكمبيوتر إلى فهم ما لا يعرفه بعد، وهو مفهوم يُسمى "عدم اليقين". ومع ذلك، فإن حساب عدم اليقين هذا للشبكات العصبية الضخمة والحديثة أمر صعب للغاية ومكلف حاسوبيًا، وغالبًا ما يتطلب تدريب عشرات النماذج المنفصلة لمجرد الحصول على تقدير تقريبي.

لقد طور فريق من الباحثين في جامعة جنوب كاليفورنيا نهجًا جديدًا لحل هذه العقبة، مما يسمح لأجهزة الكمبيوتر بالتعلم من التفضيلات البشرية بسرعة وكفاءة أكبر بكثير. فقد قدموا طريقة تسمى "PreferenceEKF"، والتي تعامل عملية تعلم التفضيلات كمسألة ترشيح مستمرة وخطوة بخطوة بدلاً من كونها عملية حسابية ضخمة تُجرى لمرة واحدة. وبدلاً من محاولة رسم خريطة لكل التباينات الممكنة لشبكة عصبية عملاقة في وقت واحد، أدرك الباحثون أنه يمكن تتبع سلوك الشبكة بدقة ضمن مساحة أصغر بكثير ومنخفضة الأبعاد. ومن خلال تركيز حساباتهم على هذا الفضاء الفرعي المدمج، تمكنوا من استخدام أداة رياضية كلاسيكية، وهي "مرشح كالمان الموسع"، لتحديث فهم النموذج في الوقت الفعلي مع وصول إجابات جديدة. سمحت هذه التقنية بتوليد آلاف النسخ المختلفة من نموذج المكافأة فورًا، دون التكلفة الحسابية الثقيلة لتدريب شبكات مستقلة متعددة.

اختبر الباحثون طريقتهم مقابل عدة تقنيات موجودة باستخدام مجموعة متنوعة من المعايير القياسية للتحكم الروبوتي واتخاذ القرار. ووجدوا أن نهجهم لم يكن أسرع بشكل ملحوظ فحسب — حيث يعمل بسرعة تصل إلى أربعين ضعفًا مقارنة ببعض البدائل الأكثر تقدمًا — بل كان أيضًا أكثر دقة في تنبؤاته. وفي التجارب التي كان الهدف منها تعلم نموذج مكافأة من عدد محدود من المقارنات البشرية، تعلمت الطريقة الجديدة التفضيلات الصحيحة باستمرار باستخدام عدد أقل من الأسئلة مقارنة بالطرق الأخرى. علاوة على ذلك، كانت النماذج التي أنتجتها أكثر ضبطًا، مما يعني أن ثقة الكمبيوتر في إجاباته كانت تتطابق مع الدقة الفعلية لتلك الإجابات بشكل أوثق. هذه الدقة حيوية للتعلم النشط، حيث يجب على النظام تحديد السؤال التالي الذي سيطرحه؛ فإذا كان النظام غير متأكد، فإنه يطرح سؤالًا لحسم عدم اليقين هذا، وإذا كان واثقًا، فإنه يمضي قدمًا. وقد تفوقت الطريقة الجديدة في عملية التوازن هذه، مما أدى إلى نماذج مكافأة يمكنها تدريب السياسات الروبوتية لأداء مهام معقدة، لتطابق أداء السياسات التي تم تدريبها باستخدام طرق أكثر تكلفة واستهلاكًا للوقت.

أحد الجوانب الأكثر لفتا للنظر في هذا العمل هو كيفية تغييره لسير عمل التدريب لهذه الأنظمة. غالبًا ما تتطلب الطرق التقليدية من الكمبيوتر إعادة تدريب أو إعادة تقييم فهمه الكامل للعالم في كل مرة يتلقى فيها قطعة جديدة من التغذية الراجعة، وهي عملية تصبح أبطأ كلما كبر النظام. وفي المقابل، يقوم النهج الجديد بتحديث معرفته بشكل تسلسلي، حيث يدمج فقط أحدث قطعة من المعلومات مع الحفاظ على تقدير مستمر لما تعلمه حتى الآن. وهذا يسمح للنظام بالتوسع بكفاءة، والتعامل مع شبكات عصبية أكبر وتوليد المزيد من العينات لنماذج المكافأة الممكنة دون نفاد الذاكرة أو الوقت. كما أظهر الباحثون أن هذا النهج يعمل حتى عند البدء بدون بيانات أولية، باستخدام تقنية الإسقاط العشوائي لبناء الفضاء الفرعي اللازم من الصفر، وأظهر وعودًا عند تطبيقه على المهام القائمة على الصور حيث تكون البيانات المدخلة أكثر تعقيدًا من مجرد أرقام بسيطة.

بينما يظهر هذا الأسلوب وعودًا كبيرة، يوضح الباحثون حدود عملهم بعناية. يفترض الإطار الرياضي الذي استخدموه أن التفضيلات التي يتم تعلمها تأتي من مصدر واحد ثابت. وعندما اختبروا النظام باستخدام بيانات من عدة معلقين بشريين قد تكون لديهم آراء متضاربة، واجهت الطريقة صعوبة في استيعاب التعقيد الكامل لتلك الآراء المختلفة. وهذا يشير إلى أنه بينما يعد هذا النهج أداة قوية لتبسيط عملية التعلم، فإنه الأنسب للسيناريوهات التي يتم فيها نمذجة مجموعة واحدة متماسكة من التفضيلات. ومع ذلك، تشير النتائج إلى خطوة كبيرة للأمام في جعل الذكاء الاصطناعي أكثر قدرة على التكيف مع النوايا البشرية. فمن خلال جعل عملية التعلم من التغذية الراجعة أسرع وأكثر كفاءة، يزيل هذا العمل حاجزًا رئيسيًا أمام نشر الأنظمة الذكية في بيئات العالم الحقيقي، من التوصيات الشخصية إلى الروبوتات المستقلة، حيث تكون تكلفة وقت الإنسان عالية والحاجة إلى التعلم السريع والدقيق أمرًا بالغ الأهمية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →