← أحدث الأبحاث
🤖 machine learning

Linear-DPO: Linear Direct Preference Optimization for Diffusion and Flow-Matching Generative Models

تقترح هذه الورقة البحثية Linear-DPO، وهو إطار عمل موحد لتحسين التفضيلات يشتق هدفاً عاماً لكل من نماذج الانتشار (diffusion) ونماذج مطابقة التدفق (flow-matching) عن طريق استبدال المنفعة القياسية القائمة على دالة السيجمويد (sigmoid) بمنفعة خطية ونموذج مرجعي يتم تحديثه عبر المتوسط المتحرك الأسي (EMA) للتغلب على عدم توافق الأهداف وتحسين محاذاة توليد الصور من النصوص.

المؤلفون الأصليون: Kesong Li, Yixuan Xu, Kuo-kun Tseng, Weiyi Lu, Kan Liu, Tao Lan

نُشر 2026-05-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Kesong Li, Yixuan Xu, Kuo-kun Tseng, Weiyi Lu, Kan Liu, Tao Lan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فناناً موهوباً جداً يمكنه رسم لوحات بناءً على أوصافك. لقد تعلم هذا الفنان من خلال النظر إلى مليارات الصور والتعليقات النصية من الإنترنت. إنه بارع في جعل الأشياء تبدو واقعية، لكنه لا يعرف دائماً ما يفضله البشر فعلياً. أحياناً، يصنع صوراً صحيحة تقنياً ولكنها غريبة نوعاً ما، أو قبيحة، أو ببساطة ليست ما طلبته بالضبط.

لإصلاح ذلك، نحتاج إلى تعليم الفنان كيف يستمع إلى التعليقات البشرية. تقدم هذه الورقة البحثية طريقة جديدة وأكثر ذكاءً لهذا التعليم، تسمى Linear-DPO.

إليك تفصيل بسيط لكيفية عملها، باستخدام بعض التشبيهات من الحياة اليومية:

1. المشكلة: المعلم الذي يستخدم "نموذجاً واحداً للجميع"

في السابق، حاول الباحثون تعليم هؤلاء الفنانين بالذكاء الاصطناوي باستخدام طريقة تسمى DPO (تحسين التفضيل المباشر). فكر في DPO كمعلم صارم يقول لك: "إذا أجبت بشكل صحيح، فهذا رائع! وإذا أخطأت، فتوقف عن المحاولة فوراً".

  • المشكلة: قاعدة "التوقف فوراً" هذه تعمل جيداً مع النماذج اللغوية (مثل روبوتات الدردشة) حيث تحتاج فقط إلى اختيار الكلمة الصحيحة. ولكن بالنسبة لتوليد الصور، فالأمر يشبه محاولة نحت تمثال عبر إزالة القطع الكبيرة فقط ثم التوقف بمجرد أن يبدو الشكل "مقبولاً". لن تصل أبداً إلى التفاصيل الدقيقة لأن المعلم يتوقف عن تقديم الملاحظات في وقت مبكر جداً.
  • الفجوة: أيضاً، الطريقة القديمة كانت تعمل فقط مع نوع واحد محدد من فناني الذكاء الاصطناائي (يسمى نماذج "الانتشار" أو Diffusion). أما الفنانون الأحدث والأسرع (الذين يسمون نماذج "مطابقة التدفق" أو Flow-Matching)، فقد تُركوا خارج الفصل الدراسي تماماً.

2. الحل: فصل دراسي موحد

أدرك مؤلفو هذه الورقة أن كل من فناني "الانتشار" القدامى وفناني "مطابقة التدفق" الجدد يقومون في الواقع بنفس الشيء، ولكن بطرق مختلفة قليلاً. لذا قاموا ببناء إطار عمل موحد.

  • التشبيه: تخيل أن الطريقة القديمة كانت لمعلم يتحدث فقط إلى الطلاب الذين يرتدون قمصاناً زرقاء. الطريقة الجديدة هي معلم يتحدث لغة عالمية يفهمها كل من طلاب "القمصان الزرقاء" وطلاب "القمصان الحمراء" ببراعة. هذا يسمح بتدريب أحدث فناني الذكاء الاصطناعي وأكثرهم قوة (مثل SD3) باستخدام تعلم التفضيلات لأول مرة.

3. السر الخفي: "المنفعة الخطية" (Linear Utility)

الابتكار الأكبر هو تغيير كيفية تقديم المعلم للملاحظات.

  • الطريقة القديمة (Sigmoid): استخدمت الطريقة القديمة دالة "Sigmoid". تخيل مفتاح إضاءة؛ فهو إما "إيقاف تشغيل" (0) أو "تشغيل" (1). بمجرد أن يحصل الطالب على إجابة "جيدة بما يكفي"، ينقل المفتاح إلى وضع التشغيل، ويتوقف المعلم عن تصحيحه. هذا يجعل الطالب يعلق عند مستوى "جيد بما يكفي" ولا يتحسن أكثر من ذلك.
  • الطريقة الجديدة (Linear-DPO): استبدل المؤلفون مفتاح الإضاءة بـ مفتاح تعتيم (دالة خطية).
    • كيف تعمل: حتى عندما يؤدي الطالب أداءً جيداً، يستمر المعلم في تقديم دفعات صغيرة ولطيفة. الأمر يشبه مدرباً يقول: "عمل جيد، ولكن دعنا نجعل الألوان أكثر سطوعاً بقليل"، حتى بعد انتهاء اللوحة بالفعل.
    • النتيجة: هذا يحافظ على عملية التعلم سلسة ومستمرة. لا يتوقف الفنان عن التحسن لمجرد أنه حقق درجة "جيدة"؛ بل يستمر في صقل التفاصيل حتى تصبح اللوحة جميلة حقاً.

4. "الهدف المتحرك" المرجعي

في التدريب، تقوم عادةً بمقارنة عمل الطالب بـ "مرجع" (نموذج أساسي) للتأكد من أنه لا يخرج عن المسار.

  • الطريقة القديمة: كان المرجع عبارة عن تمثال ثابت وجامد. بمجرد أن يصبح الطالب أفضل من التمثال، تصبح المقارنة عديمة الفائدة.
  • الط الجديدة: يستخدم المؤلفون مرجع EMA (المتوسط المتحرك الأسي). تخيل أن المرجع هو ظل يتبع الطالب ببطء. مع تحسن الطالب، يتحرك الظل معه. هذا يضمن أن الطالب يتم تحديه دائماً ليكون أفضل "بقليل" من حالته الحالية، مما يمنعه من التراخي أو الركود.

5. النتائج

اختبرت هذه الورقة هذه الطة الجديدة على عدة فناني ذكاء اصطناعي مشهورين (SD1.5، SDXL، وSD3 الأحدث).

  • النتيجة: أنتج الفنانون الذين تدربوا باستخدام Linear-DPO صوراً صنفها البشر بأنها أفضل بكثير. بدت أكثر واقعية، واتبعت التعليمات بدقة أكبر، وكانت ذات تفاصيل أغنى.
  • الدليل: في الاختبارات المباشرة، تفوقت الطريقة الجديدة على الطرق القديمة (مثل DPO القياسي أو الضبط الدقيق البسيط) في كل مرة تقريباً، خاصة في النماذج الأحدث والأكثر قوة.

الملخص

فكر في Linear-DPO كترقية من معلم يستخدم مفتاح إضاءة (تشغيل/إيقاف، يتوقف مبكراً جداً) إلى معلم يستخدم مفتاح تعتيم (تغذية راجعة سلسة ومستمرة). لقد تأكدوا أيضاً من أن هذا المعلم يمكنه تعليم جميع أنواع فناني الذكاء الاصطناعي، وليس فقط القدامى منهم. والنتيجة هي فن مولد بالذكاء الاصطناعي يبدو أقرب بكثير إلى ما يريد البشر رؤيته حقاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →