← أحدث الأبحاث
💻 computer science

DeDPO: Debiased Direct Preference Optimization for Diffusion Models

تقترح الورقة البحثية "التحسين المباشر للتفضيلات منزوع الانحياز" (DeDPO)، وهو إطار عمل شبه مُشرف يدمج تقنيات الاستدلال السببي لتصحيح الانحيازات المنهجية في التغذية الراجعة الاصطناعية للذكاء الاصطناعي، مما يمكّن نماذج الانتشار من تحقيق أداء محاذاة يضاهي أو يتجاوز التدريب المعتمد كلياً على التصنيف البشري مع خفض تكاليف البيانات بشكل كبير.

المؤلفون الأصليون: Khiem Pham, Quang Nguyen, Tung Nguyen, Jingsen Zhu, Michele Santacatterina, Dimitris Metaxas, Ramin Zabih

نُشر 2026-02-09
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Khiem Pham, Quang Nguyen, Tung Nguyen, Jingsen Zhu, Michele Santacatterina, Dimitris Metaxas, Ramin Zabih

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم فناناً موهوباً (نموذج انتشار - Diffusion Model) كيف يرسم لوحات بناءً على أوصافك. الفنان بارع جداً بالفعل في صنع صور جميلة، لكنه أحياناً يغفل عن التفاصيل الصغيرة التي تهمك، مثل ضبط الإضاءة بشكل صحيح أو التأكد من أن القطة تبدو كقطة وليست كلباً.

لإصلاح ذلك، ستحتاج عادةً إلى استئجار فريق من النقاد البشر للنظر في لوحتين وقول: "أنا أفضل هذه اللوحة أكثر". هذا ما يسمى تحسين التفضيل المباشر (DPO). وهو يعمل بشكل رائع، لكن استئجار آلاف البشر لتقييم ملايين اللحات أمر مكلف للغاية وبطيء. الأمر يشبه محاولة دفع ثمن سياج مطلي بالذهب بينما لا تحتاج سوى إلى سياج خشبي متين.

المشكلة: الناقد "الرخيص"

لتوف Dev المال، حاول الباحثون استخدام نقاد ذكاء اصطناعي (برامج حاسوبية أخرى) للقيام بمهمة التحكيم بدلاً من البشر. فكروا قائلين: "لماذا ندفع للبشر بينما يمكن للحاسوب القيام بذلك مجاناً؟"

لكن هناك عقبة. هؤلاء النقاد من الذكاء الاصطناعي ليسوا مثاليين؛ فهم يرتكبون الأخطاء، ولديهم تحيزات غريبة، وأحياناً يكتفون بمجرد التخمين. إذا قمت بتدريب فنانك باستخدام آراء هؤلاء النقاد المعيبين فقط، فسيصاب الفنان بالارتباك ويبدأ في ارتكاب أخطاء غريبة. الأمر يشبه محاولة تعلم القيادة عبر الاستماع إلى نظام ملاحة (GPS) يخبرك أحياناً بأن تقود سيارتك داخل بحيرة.

الحل: DeDPO (المعلم الذكي)

ابتكر مؤلفو هذه الورقة البحثية، DeDPO، طريقة ذكية لاستخدام هؤلاء النقاد غير المثاليين والرخيصين من الذكاء الاصطناعي دون الارتباك من أخطائهم. لقد جمعوا بين فكرتين:

  1. فريق صغير من البشر: لا تزال تمتلك مجموعة صغيرة من البشر الحقيقيين لتقديم الإجابات "المعيارية الذهبية".
  2. جيش ضخم من نقاد الذكاء الاصطناعي: تستخدم الذكاء الاصطناعي الرخيص للحكم على كمية هائلة من اللوحات.

الخدعة السحرية: التصحيح "المزيل للانحياز"
عادةً، إذا قمت بخلط الآراء البشرية مع آراء الذكاء الاصطناعي، فإن أخطاء الذكاء الاصطناعي ستجر النظام بأكمله للأسفل. يستخدم DeDPO "مرشح تصحيح" رياضياً (مستعاراً من مجال يسمى الاستدلال السببي) لإصلاح هذا الأمر.

فكر في الأمر كالتالي:

  • ناقد الذكاء الاصطناعي هو محطة راديو صاخبة؛ تشغل الموسيقى، لكن هناك الكثير من التشويش (الضجيج).
  • الناقد البشري هو تسجيل نقي وواضح.
  • DeDPO هو مهندس صوت ذكي؛ يستمع إلى الراديو الصاخب طوال الحفل الموسيقي، لكنه يمتلك أيضاً التسجيل النقي (البشر) لبعض الأغاني الرئيسية.

يستخدم مهندس الصوت التسجيل النقي ليعرف بالضبط كيف يقوم الراديو بتشويه الموسي Die. وبمجرد معرفة نمط التشويه، يمكنه "طرح" التشويش من بقية بث الراديو الصاخب. فجأة، يصبح تعليقات الذكاء الاصطناعي الرخيصة جيدة تقريباً مثل التعليقات البشرية المكلفة.

كيف يعمل في الواقع

اختبرت الورقة البحثية هذا على مولدين شهيرين للصور (SD1.5 و SDXL). أعطوا النموذج:

  • 25% من البيانات مع تسميات بشرية حقيقية (التسجيل النقي).
  • 75% من البيانات مع تسميات تم إنشاؤها بواسطة الذكاء الاصطناعي (الراديو الصاخب).

النتائج:

  • الطريقة القياسية (DPO): عندما قاموا بمجرد خلط التسميات البشرية وتسميات الذكاء الاصطناعي دون التصحيح الخاص، ساء أداء النموذج. لقد طغى ضجيج الذكاء الاصطناعي على التوجيه البشري.
  • DeDPO: تعلم النموذج بشكل مثالي. في الواقع، كان أداؤه بجودة، وأحياناً أفضل من، النماذج التي تدربت على تسميات بشرية بنسبة 100%.

لماذا يهم هذا الأمر

أثبت المؤلفون أنك لست بحاجة إلى استئجار جيش من البشر لجعل فن الذكاء الاصطناعي يتوافق مع القيم البشرية. يمكنك استخدام قدر ضئيل من المساعدة البشرية لـ "معايرة" كمية هائلة من تعليقات الذكاء الاصطناعي الرخيصة.

  • التشبيه: الأمر يشبه وجود طباخ خبير يتذوق قدرًا كبيرًا من الحساء ليخبرك ما إذا كان يحتاج إلى ملح. بمجرد أن يقدم الطباخ هذا التصحيح الواحد، يمكنك الوثوق بآلة التتبيل الآلية لبقية القدر.
  • النتيجة: هذا يجعل من الممكن توسيع نطاق مواءمة الذكاء الاصطناعي (تعليم الذكاء الاصطناعي ليكون مفيداً وآمناً) دون كسر الميزانية أو الانتظار لسنوات للحصول على التعليقات البشرية.

باختختصار، DeDPO هو أسلوب يسمح للذكاء الاصطناعي بالتعلم من التعليقات "الرخيصة" عبر استخدام قدر ضئيل من الحكمة البشرية "المكلفة" لتنظيف الضجيج، مما يؤدي إلى فن ذكاء اصطناعي عالي الجودة ومتوافق مع القيم، دون التكلفة العالية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →