Provable Pluralistic Alignment: Multi-Party RLHF under Offline Human Feedback
تقترح هذه الورقة إطار عمل موحداً للتعلم التعزيزي من التغذية الراجعة البشرية (RLHF) غير المتصل (offline) من أجل المحاذاة التعددية، والذي يقوم بتقدير المكافآت الخاصة بكل طرف بشكل مشترك تحت نموذج خطي منخفض الرتبة ويقوم بتحسين السياسات لأهداف ناش (Nash)، والنفعية (Utilitarian)، والمساواتية (Egalitarian)، مع معالجة التفضيلات الدورية العامة أيضاً عبر فائز "فون نيومان" متشائم، وكل ذلك مع ضمانات أداء غير تقاربية راسخة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الذكاء الاصطناعي، هناك اعتراف متزايد بأن الآلات لا تتحدث بصوت بشري واحد. فعندما نطلب من الحاسوب كتابة قصة، أو تلخيص مقال إخباري، أو تقديم نصيحة، غالبًا ما يرغب أشخاص مختلفون في أشياء مختلفة. فقد يقدّر شخص ما الإيجاز والمباشرة، بينما يفضل آخر التفاصيل الدقيقة والعمق العاطفي. وقد يعطي ثالث الأولوية للسلامة فوق كل شيء، بينما يسعى رابع وراء الإبداع. لسنوات، كانت الطريقة القياسية لتعليم هذه الآلات هي جمع كل هذه الآراء المختلفة، وخلطها معًا في كومة واحدة كبيرة، وتدريب النظام على إرضاء "المتوسط". يفترض هذا النهج أن الخلاف البشري ليس سوى ضجيج، أو ارتباك مؤقت سيزول إذا جمعنا قدرًا كافيًا من البيانات. ولكن في الواقع، غالبًا ما تكون هذه الاختلافات عميقة، ومستمرة، وجوهرية؛ فهي تمثل صراعات حقيقية في القيم، وليس مجرد أخطاء عشوائية. لم يعد التحدي الذي يواجه العلماء مجرد صنع آلة ترضي الأغلبية، بل بناء واحدة يمكنها التعلم من حشد من وجهات النظر المتميزة والمتعارضة أحيانًا، ومع ذلك تصل إلى قرار واحد عادل يحترم هيكل ذلك الخلاف.
هذه هي المشكلة المركزية التي يتصدى لها فريق من الباحثين من مؤسسات تشمل معهد ماساتشوستس للتكنولوجيا (MIT)، وجامعة نورث كارولينا، وجامعة كارنيجي ميلون. لقد وضعوا نصب أعينهم حل لغز محدد في مجال تعلم الآلة يُعرف باسم "المواءمة التعددية" (pluralistic alignment). تخيل غرفة مليئة بالناس يحاولون اتخاذ قرار بشأن مسار عمل واحد، لكنهم لا يستطيعون الاتفاق على ماهية النتيجة الأفضل. في الماضي، كان علماء الكمبيوتر ببساطة يطلبون من الجميع التصويت على كل خيار ممكن، ثم يحصون الأصوات، ويختارون الفائز. ويجادل النهج الجديد الموصوف في هذا العمل بأن هذه الطريقة تتخلص من الكثير من المعلومات. فإذا خلطت أصوات مجموعة تحب الطعام الحار مع مجموعة تكرهه، قد ينتهي بك الأمر إلى تسوية باهتة وغير مرضية لا ترضي أحدًا. وبدلاً من ذلك، يقترح الباحثون طريقة تحافظ على المجموعات منفصلة أثناء عملية التعلم، وتفهم بالضبط ما يريده كل طرف، ثم تطبق قاعدة محددة وشفافة لدمج تلك الرغبات في قرار نهائي واحد.
ركز الباحثون على بيئة تتعلم فيها الحواسب من بيانات "خارج الخط" (offline data). وهذا يعني أن الآلة لا تتحدث مع الناس في الوقت الفعلي؛ بل تنظر إلى مجموعة ضخمة وموجودة مسبقًا من السجلات. في هذه السجلات، قام الناس بمقارنة خيارين مختلفين وذكروا أيهما فضلوا. ومن الأهمية بمكان أن الباحثين ضمنوا أن البيانات تتبع من قام بكل مقارنة؛ فهم لم يكتفوا بتسجيل أن "الخيار (أ) كان أفضل من الخيار (ب)"، بل سجلوا أن "المجموعة (أ) فضلت الخيار (أ)، بينما فضلت المجموعة (ب) الخيار (ب)". ومن خلال الحفاظ على هذه الهويات، استطاع الحاسوب تعلم التفضيلات المحددة لكل مجموعة متميزة بدلاً من دمجها في متوسط واحد مشوش.
وللتعامل مع هذا التعقيد، طور الفريق إطارًا رياضيًا يعمل في مرحلتين رئيسيتين. أولاً، يتعلم النظام القواعد الخفية التي تحرك تفضيلات كل مجموعة. وقد اكتشفوا أنه على الرغم من أن المجموعات المختلفة تريد أشياءً مختلفة، إلا أن تفضيلاتها غالبًا ما تشترك في بنية أساسية واحدة، تمامًا كما تشترك اللغات المختلفة في قواعد لغوية مشتركة. ومن خلال التعرف على هذه البنية المشتركة، يمكن للحاسوب تعلم الرغبات المحددة للعديد من المجموعات المختلفة باستخدام بيانات أقل بكثير مما لو حاول تعلم كل منها بشكل مستقل. هذه الخطوة حيوية لأنها تسمح للنظام بأن يكون دقيقًا حتى عندما تكون البيانات الخاصة بأي مجموعة واحدة ضئيلة أو غير مكتملة.
بمجرد أن يفهم النظام ما تريده كل مجموعة، ينتقل إلى المرحلة الثانية: اتخاذ القرار النهائي. هنا، اختبر الباحثون ثلاث طرق مختلفة لدمج هذه التفضيلات، والتي تمثل أفكارًا مختلفة عن العدالة. إحدى الطرق، وتسمى "النفعية" (Utilitarian)، تقوم ببساطة بجمع إجمالي السعادة لجميع المجموعات وتختار الخيار الذي يحقق أكبر قدر من الخير العام. وطريقة أخرى، تسمى "المساواتية" (Egalitarian)، تركز بالكامل على المجموعة الأقل رضا، لضمان جعل المجموعة الأكثر تضررًا أكثر سعادة قدر الإمكان. أما الطريقة الثالثة، المعروفة باسم "ناش" (Nash)، فهي تسعى إلى تحقيق توازن حيث يتم تعظيم حاصل ضرب رضا الجميع، مما يمنع فعليًا تجاهل أي مجموعة بمفردها مع مكافأة التقدم العام في الوقت ذاته. وقد أثبت الباحثون رياضيًا أن طريقتهم يمكنها إيجاد سياسة واحدة تؤدي أداءً جيدًا تحت كل هذه التعريفات للعدالة، بشرط توفر البيانات الكافية.
إن أحد النتائج الرئيسية للدراسة هو أن مجرد تجميع كل البيانات معًا وتجاهل من قال ماذا يؤدي إلى نتيجة سيئة. فعندما قام الباحثون بمحاكاة سيناريو يتضمن ثلاث مجموعات متميزة من الناس، فشلت الطريقة التقليدية "المجمعة" في تحديد تسوية عادلة. إذ غالبًا ما كانت تختار خيارًا تحبه مجموعة واحدة ولكن تكرهه المجموعات الأخرى، مما يترك نصف السكان غير راضين تمامًا. وفي المقابل، نجحت طريقتهم الجديدة، التي حافظت على تميز المجموعات خلال مرحلة التعلم، في تحديد خيار وسط قدم مستوى معتدل من الرضا للجميع. وقد أظهر هذا أن الصعوبة في مواءمة الذكاء الاصطناعي لا تكمن فقط في امتلاك قدر كافٍ من البيانات، بل في الحفاظ على هيكل الخلاف البشري حتى يتم اتخاذ قرار واضح ومتعمد بشأن كيفية حله.
كما استكشف الباحثون سيناريو أكثر صعوبة حيث لا يمكن اختزال التفضيلات البشرية بسهولة في درجة بسيطة أو ترتيب. فأحيانًا، تكون خيارات الناس غير متسقة؛ فقد يفضلون (أ) على (ب)، و(ب) على (ج)، ثم يفضلون (ج) على (أ). في مثل هذه الحالات، تنهار الطريقة القياسية المتمثلة في تخصيص رقم واحد لكل خيار. وللتعامل مع هذا، طور الفريق استراتيجية جديدة تعتمد على مفهوم "فائز فون نيومان" (von Neumann winner). وهو نهج احتمالي حيث لا يحاول النظام إيجاد الخيار الأفضل الوحيد، بل يبحث عن استراتيجية من غير المرجح أن تخسر في مقارنة مباشرة ضد أي استراتيجية أخرى. وقد أثبتوا أنه حتى في هذه المواقف الفوضوية وغير المتسقة، يمكن لطريقتهم إيجاد حل مستقر وعادل يحترم تفضيلات جميع الأطراف، بشرما تم جمع البيانات بعناية كافية.
ومن خلال عمليات المحاكاة الحاسوبية، أظهر الفريق أن نهجهم يتفوق باستمرار على الأساليب الموجودة. فعندما اختبروا خوارزميتهم على بيانات اصطناعية مع عدد متفاوت من الأشخاص ومستويات مختلفة من الاتفاق، أنتجت الطالة الجديدة قرارات أقرب إلى النتيجة المثالية لكل مجموعة. وأكدت عمليات المحاكاة أنه من خلال الحفاظ على هويات المجموعات سليمة واستخدام هيكل تعلم مشترك، يمكن للنظام أن يتعلم بكفاءة أكبر ويتخذ خيارات أكثر عدلاً. وظلت النتائج ثابتة سواء كان الهدف هو تعظيم متوسط السعادة، أو حماية المجموعة الأكثر ضعفًا، أو إيجاد تسوية متوازنة.
يمثل هذا العمل خطوة مهمة للأمام في كيفية تفكيرنا في تدريب الذكاء الاصطناعي للعمل مع المجتمعات البشرية المتنوعة. فهو يبتعد عن فكرة وجود طريقة واحدة "صحيحة" وحيدة للسلوك يجب على الآلة اكتشافها. بدلاً من ذلك، فإنه يعامل التنوع في الرأي البشري كميزة يجب إدارتها، وليس كخطأ يجب إصلاحه. ومن خلال جعل عملية دمج وجهات النظر المختلفة صريحة وصارمة رياضيًا، قدم الباحثون مخططًا لبناء أنظمة يمكنها التنقل عبر الصراع دون محو الأصوات المتميزة التي أوجدته. لا تدعي الدراسة أنها حلت كل مشكلات التفاعل بين الإنسان والذكاء الاصطناعي، لكنها تقدم طريقة موثوقة ومثبتة للتعلم من حشد من الناس المختلفين وإنتاج قرار جماعي واحد سليم إحصائيًا وشفاف أخلاقيًا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.