Beyond Pairs: Your Language Model is Secretly Optimizing a Preference Graph
تقدم هذه الورقة البحثية GraphDPO، وهو تعميم مبدئي لأسلوب التحسين المباشر للتفضيلات (Direct Preference Optimization) يستفيد من رسوم بيانية كاملة للتفضيلات ناتجة عن عمليات محاكاة متعددة لفرض خاصية التعدي وتجميع الإشراف، وبذلك يتغلب على قيود الطرق الثنائية ويحقق أداءً فائقاً في مهام الاستنتاج وتوليد البرامج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تعلم روبوت طباخ كيفية إعداد الوجبة المثالية.
الطريقة القديمة: اختبار "المذاقين"
تقليديًا، لتعليم الروبوت، كنت ستعطيه طبقين: أحدهما من صنعه (لنسمه "المذاق أ") والآخر من صنعك (أو نسخة أفضل منه، لنسمه "المذاق ب"). ستقول له: "المذاق ب أفضل من المذاق أ". يتعلم الروبوت من هذه المقارنة الوحيدة. هذا يشبه الطريقة القياسية الحالية التي تسمى DPO (تحسين التفضيل المباشر).
المشكلة هي أننا في العالم الحقيقي، لا نحصل على طبقين فقط. قد تطلب من الروبوت طهي نفس الوجبة خمس مرات. ستحصل على خمس نسخ مختلفة:
- خبز محترق.
- غير ناضج قليلاً.
- ذهبي مثالي.
- ذهبي مثالي (لكن بشكل مختلف قليلاً).
- طبق غريب ومختلف تمامًا.
إذا استخدمت طريقة "المذاقين" القديمة، فسيتعين عليك تفكيك هذه الأطباء الخمسة إلى أزواج (1 مقابل 2، 1 مقابل 3، 2 مقابل 3، إلخ). هذا يسبب فوضى. أنت تفقد الصورة الكبيرة. قد تخبر الروبوت أن "الذهبي المثالي" أفضل من "غير الناضج"، وأن "غير الناضج" أفضل من "المحترق"، لكن الروبوت قد يرتبك لأنك لم تخبره صراحةً أن "الذهبي المثالي" أفضل من "المحترق" في سلسلة واحدة واضحة. الأمر يشبه محاولة فهم شجرة العائلة من خلال النظر فقط إلى أزواج أبناء العم، وتجاهل الآباء والأجداد.
الطريقة الجديدة: "شجرة عائلة" المذاق (GraphDPO)
يقترح المؤلفون طريقة جديدة تسمى GraphDPO. بدلاً من النظر في الأزواج، ينظرون إلى "شجرة العائلة" بأكملها لمحاولات الروبوت.
- الرسم البياني (الشجرة): يأخذون هذه الأطباق الخمسة ويرتبونها في تسلسل هرمي.
- الأطباق "المحترقة" و"الغريبة" توضع في الأسفل.
- الطبق "غير الناضج" يوضع في المنتصف.
- الطبقان "الذهبيان المثاليان" يوضعان في الأعلى.
- والأهم من ذلك، يدركون أن الطبقين "الذهبيين المثاليين" متعادلان. إنهما في نفس "النادي". لا يحتاج الروبوت إلى العقاب لأنه لم يعرف أي الطبقين المثاليين أفضل قليلاً؛ يحتاج فقط لمعرفة أن كلاهما أفضل من الأطباق السيئة.
القواعد (التعدي): يفرض النظام قاعدة منطقية: إذا كان (أ) أفضل من (ب)، و(ب) أفضل من (ج)، فإن (أ) يجب بالضرورة أن يكون أفضل من (ج). الطريقة القديمة غالبًا ما تنسى هذه القاعدة عند تقسيم الأشياء إلى أزواج. أما GraphDPO فيبني هذه القاعدة مباشرة داخل عملية التعلم، مما يضمن اتساق فهم الروبوت من الأعلى إلى الأسفل.
"مرساة" الحقيقة المطلقة (The Oracle Anchor): في بعض الأحيان، يكون لديك الوصفة الفعلية (الحقيقة الأرضية). يسمح GraphDPO بتثبيت هذه الوصفة المثالية في قمة الشجرة. في بداية التدريب، يُقال للروبوت: "هذا هو المعيار الذهبي، استهدفه!" ومع زيادة ذكاء الروبوت، يخفف النظام تدريجيًا من قبضته، مما يسم يترك الروبوت يستكشف ويجد طريقه الخاص نحو القمة دون تدخل دقيق ومفرط.
لماذا هذا أفضل؟
- لا ارتباك: يمنع الروبوت من الارتباك بسبب التعليمات المتناقضة التي تحدث عندما تفرض ترتيبًا صارمًا على أشياء هي في الواقع متعادلة.
- الكفاءة: على الرغم من أنه ينظر إلى الشجرة بأكملها، إلا أنه سريع بشكل مدهش. فهو لا يحتاج إلى فحص كل زوج من الأطباق مقابل الآخر؛ بل ينظر فقط إلى المجموعات.
- نتائج أفضل: اختبر الباحثون هذا على مسائل رياضية ومهام برمجية. في هذه المجالات، حيث توجد غالبًا إجابات "صحيحة" و"خاطئة" (مثل الفرق بين طبق محترق وطبق مثالي)، ساعد GraphDPO الروبوت على التعلم بشكل أسرع والحصول على درجات أفضل مقارنة بالطرق القديمة التي تعتمد على الأزواج.
باخت حصر الكلام
يجادل البحث بأنه بدلاً من تعليم الذكاء الاصطناعي عبر عرض خيارين في كل مرة، يجب أن نعرض عليه مجموعة كاملة من الخيارات، ونرتبها في تسلسل هرمي واضح (رسم بياني)، ونتركه يتعلم العلاقات بينها جميعًا في وقت واحد. هذا يخلق معلمًا أكثر استقرارًا، ومنطقية، وفعالية للذكاء الاصطناعي، خاصة عندما تكون الإجابات إما صحيحة تمامًا أو خاطئة تمامًا.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.