When Are Two RLHF Objectives the Same?
تقدم هذه الورقة Opal، وهي خوارزمية لتوحيد الصيغ (canonicalization) تحدد التكافؤ الجبري لأهداف تفضيلات التعلم المعزز من التغذية الراجعة البشرية (RLHF)، كاشفةً أن العديد من الأساليب المستخدمة على نطاق واسع هي في الواقع إعادة تمثيل لنفس الهدف الأساسي، مع تحديد الآليات الهيكلية المحددة التي تخلق أهدافاً متميزة حقاً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك طاهٍ يحاول إتقان وصفة لطبق جديد. على مدار السنوات القليلة الماضية، نشر مئات الطهاة الآخرين نسخهم "المحسنة" الخاصة من هذه الوصفة. البعض يقول إنهم غيروا التوابل، والبعض الآخر يقول إنهم عدلوا درجة حرارة الطهي، بينما يزعم آخرون أنهم اخترعوا طريقة جديدة تمامًا لخلط المكونات.
السؤال الكبير هو: هل هذه حقًا وصفات مختلفة، أم أنها مجرد نفس الطبق بأسماء مختلفة؟
تقدم هذه الورقة أداة تسمى Opal (فكر فيها كـ "مترجم وصفات" أو "ماسح لبصمة النكهة") للإجابة على هذا السؤال بالضبط فيما يتعلق بطرق تدريب الذكاء الاصطناعي المعروفة باسم RLHF (التعلم التعزيزي من التغذية الراجعة البشرية).
إليك تفصيل ما وجدته الورقة، باستخدام تشبيهات بسيطة:
١. المشكلة: أسماء كثيرة، ونفس المذاق
في عالم الذكاء الاصطناعي، اقترح الباحثون عشرات الطرق المختلفة لتعليم نماذج الذكاء الاصطناعي اتباع التفضيلات البشرية. لقد أعطوها أسماءً رنانة مثل DPO وSPPO وSimPO وGRPO. وتدعي كل ورقة بحثية أن طريقتها هي "طفرة" أو "أفضل بشكل متميز".
تساءل المؤلفون: هل هذه في الواقع أهداف رياضية مختلفة، أم أنها مجرد نفس الهدف مكتوب بلغات مختلفة؟
٢. الحل: Opal (المترجم)
بنى المؤلفون خوارزمية تسمى Opal. يمكنك التفكير في Opal كآلة تأخذ وصفتين مختلفتين (صيغ رياضية) وتحاول ترجمتهما إلى لغة "معيارية" واحدة موحدة.
- إذا تُرجمت الوصفات إلى نفس اللغة المعيارية تمامًا: تقول Opal: "هذه هي نفسها". فهي تعطيها نفس "البصمة" (رمز هاش).
- إذا لم تتمكن من الترجمة إلى نفس اللغة: تنتج Opal "شاهدًا" (witness). هذا بمثابة مثال ملموس يوضح بالضبط لماذا هما مختلفان. على سبيل المثال: "في الوصفة (أ)، إذا أضفت الملح، يصبح المذاق مالحًا. أما في الوصفة (ب)، فإن إضافة الملح تجعل المذاق حلوًا اعتمادًا على ما يوجد في القدر".
٣. الاكتشاف الكبير: العديد من الأساليب "الجديدة" هي مجرد أساليب قديمة متنكرة
عندما قام المؤلفون بتشغيل Opal على 33 طريقة مختلفة، وجدوا شيئًا مفاجئًا:
عائلة "DPO": تبين أن عشر طرق مختلفة (بما في ذلك SPPO وNash-MD) متطابقة جبريًا مع طريقة DPO الشهيرة.
- التشبيه: الأمر يشبه شخصًا يدعي أنه اخترع طريقة جديدة لغلي الماء عبر تسميتها "التحول الطوري الحراري". إنه نفس غليان الماء، لكن باسم رنان فقط.
- النتيجة: الانتقال من DPO إلى SPPO لا يغير الهدف الفعلي الذي يسعى الذكاء الاصطناعي لتحقيقه؛ بل يغير فقط كيفية كتابة الرياضيات.
الابتكارات "الحقيقية": كانت حفنة صغيرة فقط من الطرق مختلفة حقًا.
- GRPO (تأثير الدفعة/الدفعة التدريبية): هذه الطريقة تُستخدم في نموذج DeepSeek-R1 الشهير. أثبتت Opal أنها مختلفة جوهريًا عن DPO.
- التشبيه: تخيل أنك تقيم الطلاب. في الطريقة القياسية (DPO)، تقيم الطالب (أ) بناءً على درجات امتحانه الخاص فقط. أما في GRPO، فأنت تقيم الطالب (أ) بناءً على أدائه مقارنة بالطلاب الآخرين في الغرفة في ذلك اليوم. إذا وضعت عبقريًا في الغرفة، سيبدو الطالب (أ) أسوأ حالًا. وإذا وضعت طالبًا متعثرًا، سيبدو الطالب (أ) أفضل حالًا. "الدفعة" (Batch) تغير الدرجة. أثبتت Opal أن هذا "الاعتماد على الدفعة" يجعل GRPO وحشًا مختلفًا تمامًا.
- KTO وغيرها: تتعامل هذه الطرق مع "الربح" و"الخسارة" بشكل مختلف (مثل المقامر الذي يخشى الخسارة أكثر مما يستمتع بالربح). هذا التباين يجعلها فريدة من الناحية الهيكلية.
٤. "المكونات السرية" الأربعة للاختلافات الحقيقية
تحدد الورقة أنه لكي تكون الطريقة جديدة حقًا (وليست مجرد إعادة صياغة)، يجب أن تكسر أحد القواعد الأربع. إذا لم تكسر قاعدة، فمن المرجح أنها مجرد إعادة تدوير لطريقة قديمة.
- التطبيع الجماعي (Group Normalization): تغيير الدرجة بناءً على من هم في المجموعة (مثل GRPO).
- الوزن المعتمد على الزوج (Pair-Dependent Weighting): معاملة أزواج محددة من الإجابات بشكل مختلف بناءً على سماتها الفريدة (مثل KTO).
- بنية مستوى الرمز (Token-Level Structure): النظر إلى إجابة الذكاء الاصطناعي كلمة بكلمة بدلاً من الجملة كاملة دفعة واحدة.
- مستوى المسار (Trajectory-Level): النظر إلى المسار الكامل للقرارات التي اتخذها الذكاء الاصطناعي، وليس فقط الإجابة النهائية.
٥. ماذا يعني هذا للممارسين
إذا كنت مهندسًا يحاول اختيار طريقة:
- لا تنخدع بالأسماء. إذا رأيت طريقة جديدة تبدو مثل DPO ولكن لها اشتقاق رنان، فقد تكون مجرد DPO ترتدي بدلة رسمية (Tuxedo).
- تحقق من "الدفعة" (Batch). إذا كانت الطريقة تغير سلوكها اعتمادًا على الأمثلة الأخرى الموجودة في دفعة التدريب، فهي تقوم بشيء فريد (مثل GRPO).
- الهدف هو نفسه. حتى لو بدت الرياضيات مختلفة، إذا قالت Opal إنها متكافئة، فسيستهدفان نفس "السلوك المثالي" للذكاء الاصطناعي. ومع ذلك، قد يصلان إلى هناك بسرعات أو استقرارات مختلفة.
الملخص
هذه الورقة هي "اختبار واقع" لمجال الذكاء الاصطناعي. إنها تستخدم أداة رياضية (Opal) لتجريد المصطلحات الرنانة وإظهار أن معظم الطرق "الجديدة" الأخيرة هي في الواقع نفس الأهداف القديمة مكتوبة بشكل مختلف. الابتكار الحقيقي يحدث فقط عندما تغير بشكل جذري كيفية مقارنة الذكاء الاصطناعي للإجابات (مثل النظر إلى المجموعة بأكملها أو المسار بأكمله)، وليس فقط عندما تعيد ترتيب الجبر.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.