← أحدث الأبحاث
💻 computer science

DyCoRM: Dynamic Criterion-Aware Reward Modeling for Text-to-Image Generation

تقدم هذه الورقة البحثية DyCoRM، وهو إطار عمل لنمذجة المكافأة الديناميكية الواعية بالمعايير يعالج الحاجة إلى تقييم الصور بدقة وتخصيص حسب المهمة في توليد الصور من النصوص عبر الاستفيد من مجموعة بيانات ومعيار مرجعي تم إنشاؤهما حديثاً لتمكين محاذاة أكثر دقة مع متطلبات المستخدم.

المؤلفون الأصليون: Jiaying Qian, Ziheng Jia, Qian Zhang, Zicheng Zhang, Jiayi Guo, Junqi Zhang, Guangtao Zhai, Xiongkuo Min

نُشر 2026-05-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jiaying Qian, Ziheng Jia, Qian Zhang, Zicheng Zhang, Jiayi Guo, Junqi Zhang, Guangtao Zhai, Xiongkuo Min

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك ناقد فني، ولكن بدلاً من مجرد قول "أنا أحب هذه اللوحة أكثر من تلك"، يتعين عليك شرح السبب بالضبط بناءً على قاعدة محددة أعطاك إياها الفنان.

تقدم هذه الورقة نظامًا جديدًا يسمى DyCoRM (نموذج المكافأة القائم على المعايير الديناميكية) المصمم لمساعدة الحواسيب على تقييم الصور التي يولدها الذكاء الاصطناعي. إليك تفصيل ذلك باستخدام تشبيهات بسيطة:

المشكلة: "المدير العام" الذي يطبق معيارًا واحدًا للجميع

تعمل معظم أحكام صور الذكاء الاصطناعي الحالية مثل مدير عام ينظر فقط إلى المنتج النهائي ويعطي درجة واحدة فقط (على سبيل المثال: "8 من 10").

  • المشكلة: في بعض الأحيان يريد المستخدم صورة "مخيفة"، وفي أحيان أخرى يريد صورة "ملونة". قد يعطي المدير العام درجة عالية لصورة ملونة حتى لو كان المستخدم قد طلب تحديدًا شيئًا مخيفًا. هؤلاء الحكام القدامى لا يعرفون كيفية تغيير تركيزهم بناءً على الطلب المحدد؛ فهم عالقون في استخدام مجموعة ثابتة من القواعد لكل مهمة.

الحل: "المفتش المتخصص" (DyCoRM)

بنى المؤلفون نظامًا جديدًا يعمل مثل مفتش مرن ومتخصص. بدلاً من مجرد إعطاء درجة، يقوم هذا المفتش بشيئين بالترتيب:

  1. الخطوة 1: قراءة المخطط (تأسيس المعايير):
    قبل النظر إلى الصور، يقرأ المفتش "الأمر" (Prompt) الخاص بالمستخدم ويسأل نفسه: "ما هي القواعد المحددة لهذه المهمة؟"
  • تشبيه: إذا كان الأمر هو "مدينة سايبربانك"، يكتب المفتش: "ابحث عن أضواء النيون، والسيارات الطائرة، والشوارع المظلمة".
  • إذا كان الأمر هو "مطبخ دافئ"، يكتب الم: "ابحث عن الإضاءة الدافئة، والبخار على النافذة، وقوام الطعام الواقعي".
  • يتعلم النظام استخراج هذه القواعد المحددة تلقائيًا لكل طلب جديد.
  1. الخطوة 2: التقييم بناءً على القواعد (المقارنة المشروطة بالمعايير):
    بمجرد وضع القواعد، ينظر المفتش إلى صورتين ويقارنهما بناءً على تلك القواعد المحددة فقط.
  • تشبيه: هو لا يكتفي بالقول "الصورة (أ) أجمل". بل يقول: "الصورة (أ) تفوز لأن أضواء النيون فيها أكثر سطوعًا (القاعدة رقم 1)، لكن الصورة (ب) تفوز لأن الطعام فيها يبدو ألذ (القاعدة رقم 2)".

بيانات التدريب: "الامتحان التجريبي" (DyCoDataset-20K)

لتعليم هذا المفتش كيفية القيام بعمله، أنشأ الباحثون مجموعة تدريبية ضخمة جديدة تسمى DyCoDataset-20K.

  • كيف صنعوا ذلك: أخذوا آلاف الأوامر، وولدوا صورًا من 14 نموذجًا مختلفًا للذكاء الاصطناعي، ثم استعانوا ببشر ليعملوا كـ "معلمين".
  • عملية التدريس: لم يقم البشر بمجرد اختيار الفائز، بل كان عليهم:
    1. كتابة المعايير المحددة لذلك الأمر الخاص (على سبيل المثال: "يجب أن تبدو الأيدي واقعية").
    2. مقارنة الصور بناءً على تلك المعايير فقط.
  • النتيجة: مجموعة بيانات تضم أكثر من 20,000 مثال حيث تتغير "القواعد" لكل مهمة، مما يعلم الذكاء الاصطناعي المرونة.

الاختبار المرجعي: "الامتحان النهائي" (DyCoBench-1K)

لقد أنشأوا أيضًا مجموعة اختبار أصغر وأصعب تسمى DyCoBench-1K. هذه المجموعة تشبه الامتحان النهائي حيث تكون الأسئلة مخادعة وتتطلب من الذكاء الاصطناعي تغيير تركيزه بسرعة. وأظهرت النتائج أن DyCoRM اجتاز هذا الامتحان بشكل أفضل بكثير من الحكام السابقين الذين يعملون بأسلوب "المدير العام".

التطبيق: "المتسوق الشخصي" (DyCoPick)

أخيرًا، أظهر المؤلفون كيفية استخدام هذا النظام في الحياة الواقعية باستخدام أداة تسمى DyCoPick.

  • كيف تعمل: تخيل أنك طلبت من الذكاء الاصطناعي توليد 10 صور لـ "قطة في الفضاء".
  • الطريقة القديمة: قد يختار الذكاء الاصطناعي أول صورة يراها "جيدة" بشكل عام.
  • طريقة DyCoPick: يقوم النظام بتوليد 10 خيارات، ثم يستخدم "المفتش المتخصص" للنظر في هذه الخيارات بناءً على احتياجاتك المحددة (على سبيل المثال: "أريد أن تبدو القطة منفوشة" أو "أريد أن تكون الخلفية مظلمة"). ثم يختار الصورة التي تناسب معاييرك المحددة بأفضل شكل، ليعمل كمتسوق شخصي يعرف تمامًا ما تريده، وليس فقط ما هو شائع.

الملخص

باختصار، تقول هذه الورقة: "توقفوا عن استخدام كتاب قواعد عام واحد لتقييم جميع صور الذكاء الاصطناعي. بدلاً من ذلك، ابنوا نظامًا يحدد أولاً ما هي القواعد المحددة للمهمة الحالية، ثم يقيم الصور بناءً على تلك القواعد المحددة". لقد بنوا المعلم (مجموعة البيانات)، والطالب (النموذج)، والاختبار (المعيار المرجعي) لإثبات أن هذه الطريقة تعمل بشكل أفضل من الطريقة القديمة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →