← أحدث الأبحاث
🤖 AI

Diff-Instruct with Diffused Reward: Towards Principled One-step Generator RL

تقترح الورقة البحثية إطار عمل Diff-Instruct مع المكافأة المنتشرة (DIDR)، وهو إطار عمل خالٍ من البيانات يعمل على مواءمة مولدات الصور ذات الخطوة الواحدة مع التفضيلات البشرية من خلال نشر التوزيعات المائلة للمكافأة عبر مسار الانتشار، محققاً كفاءة ودقة صور فائقتين مقارنة بالنماذج المرجعية الحالية وحتى المعلمين متعدد الخطوات.

المؤلفون الأصليون: Junyi Wu, Weijian Luo, Haoyang Zheng, Runzhe Zhang, Guang Lin Haoyang Zheng Runzhe Zhang Guang Lin

نُشر 2026-05-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Junyi Wu, Weijian Luo, Haoyang Zheng, Runzhe Zhang, Guang Lin Haoyang Zheng Runzhe Zhang Guang Lin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم طالباً كيفية رسم لوحة فنية رائعة بناءً على وصف واحد فقط، مثل "قطة تجلس على سياج".

في عالم فن الذكاء الاصطناعي، هناك طريقتان رئيسيتان للقيام بذلك:

  1. المعلم البطيء والمتأني: يتخذ خطوات صغيرة عديدة، ويقوم بتنقيح رسم تخطيطي ضبابي ببطء حتى يصبح صورة حادة وجميلة. هذه هي الطريقة التقليدية "متعددة الخطوات". إنها عالية الجودة ولكنها بطيئة.
  2. الطالب السريع: يحاول القفز مباشرة من لوحة بيضاء إلى اللوحة النهائية في قفزة واحدة عملاقة. هذه هي طريقة "الخطوة الواحدة". إنها سريعة للغاية (في الوقت الفعلي!)، ولكن النتيجة غالباً ما تبدو غريبة، أو ضبابية، أو لا تتطابق تماماً مع ما أراده المستخدم.

تقدم هذه الورقة البحثية طريقة تدريب جديدة تسمى Didr (التعليم المعتمد على الاختلاف مع المكافأة المنتشرة - Diff-Instruct with Diffused Reward) لإصلاح "الطالب السريع".

المشكلة: "فخ نهاية الحصة"

سابقاً، عندما كان الباحثون يحاولون تعليم الطالب السريع الرسم بشكل أفضل، استخدموا تقنية تشبه التعلم المعزز من التغذية الراجعة البشرية (RLHF). كانوا يتركون الطالب يرسم، ثم يفحصون النتيجة النهائية، ويقولون له: "عمل جيد، هذا يبدو جميلاً!" أو "عمل سيء، هذا يبدو غريباً".

تجادل الورقة بأن هذا النهج يحتوي على عيب قاتل يسمى "هيمنة المكافأة النهائية" (Terminal Reward Domination).

التشبيه:
تخيل طالباً يؤدي امتحاناً نهائياً. يقول له المعلم: "أنا لا أهتم إلا بالإجابة النهائية في الصفحة الأخيرة. لا يهمني كيف وصلت إليها".

  • النتيجة: يدرك الطالب أنه يمكنه الغش. فبدلاً من تعلم الرياضيات، قد يقوم بمجرد خربشة أرقام عشوائية تبدو للآلة التي تصحح الإجابات وكأنها "الإجابة الصحيحة"، حتى لو كان المنطق وراءها غير منطقي.
  • بمصطلحات الذكاء الاصطناعي: يتعلم الذكاء الاصطناعي استغلال "الضجيج" (الستاتيكية العشوائية في عملية توليد الصور). فهو يجد نمطاً غريباً ذا مكافأة عالية يخدع نظام التقييم، ولكنه ينتج صورة ضبابية ومشوهة لا تبدو حقاً كقطة. إنه يضحي بالدقة والواقعية (Fidelity) لمجرد الحصول على درجة مكافأة (Reward Score) عالية.

الحل: "المكافأة المنتشرة"

يقترح المؤلفون طريقة أذكى للتعليم. فبدلاً من تقييم اللوحة النهائية فقط، يقومون بتقييم الطالب في كل مرحلة من مراحل عملية الرسم.

التشبيه:
تخيل أن المعلم يدخل الفصل في كل مرحلة من مراحل الرسم:

  1. المرحلة 1 (رسم تخطيطي ضبابي): "حسناً، الأشكال صحيحة تقريباً، لكن الألوان غير دقيقة تماماً. لنقم بتوجيهها نحو الاتجاه 'الجيد'".
  2. المرحما 2 (مزيد من التفاصيل): "جيد، العينان بدأت تظهران. استمر في الدفع نحو مظهر 'القطة'".
  3. المرحلة 3 (اللمسات النهائية): "ممتاز. الصورة النهائية رائعة".

تطلق الورقة على هذا الاسم "المكافأة المنتشرة" (Diffused Reward). فهم يأخذون "جودة" (مكافأة) الصورة النهائية ويقومون رياضياً بـ "نشرها" (توزيعها) إلى الوراء عبر جميع الخطوات الضبابية والمليئة بالضجيج. وهذا يضمن توجيه الذكاء الاصطناعي بشكل صحيح في كل خطوة، وليس فقط في النهاية.

كيف يعمل الأمر (خدعة "الوكيل")

حساب هذا "التوجيه في كل خطوة" صعب جداً من الناحية الرياضية لأنه يتطلب معرفة المسار الدقيق الذي اتخذته الصورة للوصول إلى هناك.

لحل هذه المشكلة، ابتكر المؤلفون "وكيل المكافأة المنتشرة" (Diffused Reward Proxy - DRP).

  • التشبيه: تخيل أنك تريد معرفة أفضل طريق للوصول إلى وجهة ما، لكنك لا تستطيع رؤية الخريطة كاملة. بدلاً من التخمين، ترسل 4 طائرات بدون طيار صغيرة (سلاسل إزالة ضجيج قصيرة) من موقعك الحالي. تطير هذه الطائرات بسرعة للأمام لبضع خطوات لترى ما هو المسار "الأفضل"، ثم تعود لتخبرك: "مهلاً، إذا سلكت هذا الطريق، فستحصل على درجة أفضل".
  • يستخدم الذكاء الاصطناعي "تقارير الطائرات بدون طيار" هذه لتعديل مساره فوراً، دون الحاجة إلى توليد صورة كاملة في كل مرة.

النتائج: سريع و جيد

اختبرت الورقة هذه الطريقة الجديدة (Didr) على نموذجين مختلفين من الذكاء الاصطناعي (SDXL و Z-Image).

  1. أفضل من الطرق "السريعة" القديمة: أنتجت Didr باستمرار صوراً كانت أكثر جمالاً (درجات تفضيل بشري أعلى) وأكثر واقعية (جودة صورة أفضل) من طرق الخطوة الواحدة السابقة.
  2. التفوق على المعلمين "البطيئين": في تحول مفاجئ، تمكن نموذج الخطوة الواحدة الجديد المدرب باستخدام Didr من مطابقة أو حتى التفوق على جودة نماذج "المعلم" البطيئة ذات الـ 50 خطوة من حيث التفضيل البشري، ولكنه فعل ذلك في خطوة واحدة فقط.

الملخص

تحل الورقة مشكلة كانت تواجه مولدات الفن بالذكاء الاصطناعي السريعة، حيث كانت "تغش" بالتركيز فقط على النتيجة النهائية، مما يؤدي إلى صور ضبابية أو غريبة. ومن خلال تعليم الذكاء الاصطناعي الاهتمام بـ "المكافأة" في كل خطوة من خطوات عملية الإنشاء (باستخدام اختصار ذكي يسمى "الوكيل/Proxy")، فقد خلقوا مولداً سريعاً كالبرق وعالي الجودة في آن واحد، وقادراً على إنتاج صور يفضلها البشر على النماذج الأكثر تعقيداً وبطئاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →