← أحدث الأبحاث
🤖 AI

Beyond VLM-Based Rewards: Diffusion-Native Latent Reward Modeling

تقدم هذه الورقة نموذج DiNa-LRM، وهو نموذج مكافأة كامن أصيل في عملية الانتشار (diffusion-native) وفعال حاسوبياً، يصيغ تعلم التفضيلات مباشرة على حالات الانتشار المشوشة للتغلب على عدم تطابق النطاق والتكاليف العالية لنماذج المكافآت القائمة على النماذج اللغوية البصرية، محققاً أداء محاذاة فائقاً مع متطلبات موارد أقل بكثير.

المؤلفون الأصليون: Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo

نُشر 2026-05-25
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Gongye Liu, Bo Yang, Yida Zhi, Zhizhou Zhong, Lei Ke, Didan Deng, Han Gao, Yongxiang Huang, Kaihao Zhang, Hongbo Fu, Wenhan Luo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا فنانًا كيفية رسم لوحات بناءً على أوصافك. يستخدم الروبوت نظامًا داخليًا معقدًا (يسمى نموذج الانتشار - Diffusion Model) يبدأ من ضجيج مشوش (static) ثم يقوم بتنقيته ببطء حتى تظهر صورة واضحة.

لتعليم هذا الروبوت الرسم بما يعجبك حقًا، فأنت بحاجة إلى "معلم" (نموذج مكافأة - Reward Model) ينظر إلى مسودات الروبوت ويقول له: "عمل جيد!" أو "حاول مجددًا".

المشكلة: المعلم القديم كان ثقيلًا وفي غير محله

في الوقت الحالي، أفضل "المعلمين" هي نماذج الرؤية واللغة الضخمة (VLMs). فكر في هذه النماذج كأنها مكتبات عملاقة فائقة الذكاء قرأت كل الكتب ورأت كل الصور في العالم.

  • المشكلة: هذه المكتبات العملاقة ثقيلة؛ فهي تتطلب قدرة حوسبة كبيرة للتشغيل، وهي بطيئة.
  • عدم التوافق: يعمل الفنان الروبوت في "عالم مجرد ومضغوط" (الفضاء الكامن - Latent Space)، لكن معلم المكتبة العملاقة ينظر إلى الصورة النهائية عالية الدقة (فضاء البكسل - Pixel Space). الأمر يشبه مطالبة طاهٍ بتقييم حساء عن طريق تذوق المكونات الخام بعد طهيها، بدلًا من تذوق الحساء أثناء غليه. هذا عدم التوافق يجعل عملية التعليم غير فعالة ومربكة.

الحل: DiNa-LRM (المعلم الأصلي)

ابتكر المؤلفون نوعًا جديدًا من المعلمين يسمى DiNa-LRM. بدلًا من استئجار مكتبة خارجية ضخمة، قاموا بتحويل العقل الداخلي للفنان الروبوت نفسه ليكون هو المعلم.

إليك كيف يعمل ذلك، باستخدام تشبيهات بسيطة:

1. العين "المعايرة للضجيج"

يقوم الفنان الروبوت بإنشاء الصور من خلال البدء بالضجيج (الاشتباك) ثم تنقيته بمرور الوقت.

  • الطريقة القديمة: المعلم ينظر فقط إلى الصورة النهائية والنظيفة.
  • طريقة DiNa-LRM: هذا المعلم الجديد مرتاح للنظر إلى الصورة بينما لا تزال ضبابية ومشوشة.
  • التشبيه: تخيل منتجًا موسيقيًا يعلم فرقة موسيقية. المعلم التقليدي ينتظر حتى يتم مزج الأغنية وإخراجها النهائي بالكامل لينتقدها. أما DiNa-LRM فهو مثل المنتج الذي يجلس في الاستوديو أثناء عملية التسجيل، يستمع إلى المسارات الخام والمشوشة. ولأن المعلم يفهم "الضجيج" بشكل طبيعي، فهو يعرف تمامًا مقدار عدم اليقين المتوقع في كل مرحلة. إذا كانت الصورة ضبابية جدًا، يقول المعلم: "لست متأكدًا بنسبة 100% بعد، لذا سأكون أكثر حذرًا في تقييمي". وإذا كانت الصورة واضحة، يقيمها المعلم بثقة عالية.

2. "تجميع الزمن" (Time-Travel Ensembling)

عندما يحتاج المعلم لإعطاء درجة نهائية لصورة مكتملة، فإنه لا يكتفي بالنظر إليها مرة واحدة فقط.

  • التشبيه: تخيل أنك تحاول تخمين حبكة فيلم. يمكنك مشاهدة المشهد الأخير فقط، لكن ذلك قد يكون مضللاً. أو يمكنك مشاهدة الفيلم عند اكتمال 10%، و50%، و90%، ودمج تلك الرؤى للحصول على فهم أفضل.
  • كيف يفعل DiNa-LRM ذلك: إنه ينظر إلى الصورة في مراحل مختلفة من "النقاء" (مستويات ضجيج مختلفة) ويدمج كل تلك الآراء في درجة واحدة نهائية وأكثر دقة. يسمى هذا تجميع الضجيج (Noise Ensembling). وهذا ما يجعله أكثر قوة وموثوقية دون الحاجة إلى عقل أكبر.

3. النتائج: أسرع، أرخص، وأذكى

اختبر المؤلفون هذا المعلم الجديد مقابل المكتبات العملاقة الأخرى ومحاولات أخرى.

  • الأداء: DiNa-LRM يكاد يكون بجودة أفضل المكتبات العملاقة في تحديد الصور التي يفضلها البشر.
  • الكفاءة: نظرًا لأنه يعيش داخل "عالم الروبوت المضغوط"، فإنه لا يحتاج إلى فك تشفير الصورة إلى صورة كاملة لتقييمها.
    • استخدم ذاكرة أقل بنسبة 51% (مثل الحاجة إلى نصف سعة الـ RAM في جهاز الكمبيوتر الخاص بك).
    • استخدم قدرة حوسبة أقل بنسبة 71% لعملية التقييم الفعلية.
  • التدريب: عند استخدامه لتدريب الفنان الروبوت، يتعلم الروبوت بشكل أسرع ولا يرتبك بسبب عدم التوافق بين رؤية المعلم ورؤية الفنان.

الملخص

يقدم البحث نموذج DiNa-LRM، وهو نموذج مكافأة يتحدث نفس "لغة" مولد الصور الذي يعلمه. بدلاً من إجبار خبير خارجي ضخم على ترجمة أفكاره إلى لغة المولد، يستخدم DiNa-LRM الهيكل الداخلي للمولد نفسه لتقييم عمله. إنه أكثر ذكاءً في التعامل مع عدم اليقين (الضجيج)، ويمكنه النظر إلى العمل قيد التنفيذ لاتخاذ أحكام نهائية أفضل، ويفعل كل ذلك مع استخدام قدر أقل بكثير من قوة الكمبيوتر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →