← أحدث الأبحاث
🤖 machine learning

Back to Blackwell: Closing the Loop on Intransitivity in Multi-Objective Preference Fine-Tuning

تقدم هذه المساهمة خوارزمية PROSPER\texttt{PROSPER}، وهي خوارزمية فعالة بشكل مثبت تعتمد على المفهوم القائم على نظرية الألعاب لـ "فائز بلاكويل ذي الاعتلاج الأقصى" (Maximum-Entropy Blackwell Winner) لمعالجة التفضيلات غير المتعدية في الضبط الدقيق للتفضيلات متعددة الأهداف دون الحاجة إلى تغيير القياس، مع إثبات أداء متفوق على النماذج اللغوية الكبيرة باستخدام التغذية الراجعة للتقييم متعدد الأهداف.

المؤلفون الأصليون: Jiahao Zhang, Lujing Zhang, Keltin Grimes, Zhuohao Yu, Gokul Swamy, Zhiwei Steven Wu

نُشر 2026-05-07
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiahao Zhang, Lujing Zhang, Keltin Grimes, Zhuohao Yu, Gokul Swamy, Zhiwei Steven Wu

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم روبوت كتابة قصة مثالية. لديك "قاضٍ" (ذكاء اصطناعي آخر) يقرأ قصص الروبوت ويقدم ملاحظات حولها. عادةً، نطلب من القاضي إعطاء درجة واحدة، مثل "8 من 10". ومع ذلك، تكمن هنا المشكلة: القاضي غالباً ما يكون مرتبكاً. فقد يقول إن القصة (أ) أفضل من القصة (ب)، والقصة (ب) أفضل من القصة (ج)، ثم يقول بشكل غريب إن القصة (ج) أفضل من القصة (أ).

هذا ما يسمى بـ اللاانتظام (أو الدورة). إنه يشبه لعبة "حجر، ورقة، مقص": الحجر يهزم المقص، والمقص يهزم الورقة، لكن الورقة تهزم الحجر. لا يوجد هناك حركة واحدة هي الأفضل. عندما يحدث هذا، يصاب الروبوت بالارتباك لأنه لا يعرف الاتجاه الذي يجب أن يتعلم فيه.

يقدم هذا المقال طريقة جديدة لتعليم الروبوت كيف يتعلم حتى عندما يكون القاضي غير متسق والقواعد معقدة.

المشكلة: القاضي المرتبك وفخ "العدد القياسي"

عادةً، يحاول القاضي الذي يجب أن يقيم قصة بناءً على جوانب عديدة (مثل: هل هي مضحكة؟ هل هي آمنة؟ هل هي قائمة على الحقائق؟) ضغط كل هذه التقييمات في رقم واحد. يطلق المؤلفون على هذا العملية اسم التحويل إلى عدد قياسي (Scalarization).

  • التشبيه: تخيل أنك تقيم طالباً. يجب عليك تقييمه في الرياضيات، والفن، والجري. إذا قمت ببساطة بجمع كل شيء في "درجة عامة" واحدة، فقد تغفل عن حقيقة أن الطالب عبقري في الرياضيات ولكنه سيئ جداً في الفن. عندما يحاول القاضي دمج هذه الجوانب في رقم واحد، غالباً ما تنشأ هذه الدورات المحيرة (أ > ب > ج > أ) لأنه يحاول وضع وتد مربع في ثقب مستدير.

الحل: "فائز بلاكويلل للحد الأقصى من الإنتروبيا"

يقترح المؤلفون طريقة جديدة لإيجاد أفضل استراتيجية للروبوت، والتي يسمونها فائز بلاكويلل للحد الأقصى من الإنتروبيا (لنسمّه "الروبوت فائق التكيف").

بدلاً من السؤال: "أي قصة هي الأفضل على الإطلاق؟" (وهو أمر قد لا يكون موجوداً أصلاً)، فإنهم يسألون: "أي استراتيجية للروبوت هي الأصعب في الهزيمة، بغض النظر عن القاعدة المحددة التي يركز عليها القاضي اليوم؟"

  • التشبيه: تخيل لاعب شطرنج لا يحاول أن يكون الأفضل في افتتاحية معينة. بدلاً من ذلك، يلعب بطريقة تجعله لا يخسر بشكل سيء أبداً، بغض النظر عما إذا كان الخصم يهاجم من اليسار، أو اليمين، أو المنتصف. إنه يتميز بالمتانة ضد أي نقطة ضعف محددة قد يستغلها الخصم. هذا "الروبوت فائق التكيف" هو الذي يفوز في معظم الحالات في أسوأ السيناريوهات.

الخوارزمية: PROSPER

لتدريب الروبوت فعلياً ليصبح هذا النوع "فائق التكيف"، طور المؤلفون خوارزمية تسمى PROSPER.

  • الطريقة القديمة: عادةً، لتعليم الروبوت كيفية التعامل مع عدة قضاة، يجب محاكاة لعبة ضخمة وفوضوية حيث يلعب الروبوت ضد "شرير" يحاول خداعه. هذه العملية بطيئة وتستهلك موارد حوسبية مكثفة.
  • طريقة PROSPER: وجد المؤلفون خدعة رياضية. أدركوا أنه بدلاً من لعب لعبة معقدة مع شرير، يمكنهم ببساطة استخدام انحدار (Regression) بسيط (نوع من التعديل الرياضي) لتعليم الروبوت.
  • التشبيه: فكر في الأمر على هذا النحو: بدلاً من استئجار شريك تدريب يوجه لك اللكمات في وجهك ليعلمك كيفية المراوغة (وهو أمر صعب وخطير)، يمكنك ببساطة مشاهدة فيديو للكمات وتعلم النمط رياضياً. تتيح PROSPER للروبوت التعلم مباشرة من ملاحظات القاضي دون الحاجة إلى محاكاة معركة معقدة. إنها تحول لعبة متعددة اللاعبين إلى واجب منزلي بسيط.

ما فعلوه وما وجدوه

اختبر الفريق ذلك على نماذج لغوية كبيرة (LLMs) باستخدام مجموعة بيانات حيث يقوم القاضي بتقييم الإجابات بناءً على قوائم مراجعة محددة (معايير).

  1. التحقق من الواقع: أكدوا أن القاضي الذكاء الاصطناعي، عندما يُطلب منه التحقق من معايير عديدة (مثل السلامة، والأسلوب، والحقائق) بشكل منفصل، يظل عرضة للارتباك وإنتاج دورات (تضارب). تقسيم المعايير يساعد قليلاً ولكنه لا يحل المشكلة تماماً.
  2. النتيجة: عندما استخدموا PROSPER لتدريب الروبوت، أصبح الروبوت أفضل بكثير في اتباع التعليمات والدردشة بشكل طبيعي مقارنة بالروبوتات المدربة بالطرق القديمة.
  3. الإثبات: قاموا بإصدار الروبوتات المدربة (بـ 3 مليارات و7 مليارات معلمة/Parameter) وأظهروا أنها تفوقت على جميع الطرق الأخرى في الاختبارات القياسية لاتباع التعليمات والمحادثة العامة.

الملخص

باختاًصر: عندما يكون قضاة الذكاء الاصطناعي غير متسقين ومرتبكين بشأن ما يجعل الإجابة "جيدة"، تفشل طرق التدريب القياسية. يقول هذا المقال: "لا تحاول العثور على الإجابة المثالية الواحدة. بدلاً من ذلك، ابحث عن الاستراتيجية التي تتمتع بالمتانة الكافية للتعامل مع أي من تفضيلات القاضي المحيرة". لقد طوروا أداة تسمى PROSPER تحقق ذلك بكفاءة عن طريق تحويل مشكلة نظرية الألعاب المعقدة إلى مشكلة رياضية بسيطة، مما يؤدي إلى نماذج ذكاء اصطناعي أكثر ذكاءً وموثوقية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →