← أحدث الأبحاث
💻 computer science

ConsistentRFT: Reducing Visual Hallucinations in Flow-based Reinforcement Fine-Tuning

تقدم هذه الورقة ConsistentRFT، وهو إطار عمل عام يخفف من الهلوسة البصرية في الضبط الدقيق القائم على التدعيم المتدفق عبر معالجة قضايا الاستكشاف المحدود ومحاكاة المسار من خلال آلية تدحرج الحبيبية الديناميكية وتحسين تدرج السياسة المتسق.

المؤلفون الأصليون: Xiaofeng Tan, Jun Liu, Yuanting Fan, Bin-Bin Gao, Xi Jiang, Xiaochen Chen, Jinlong Peng, Chengjie Wang, Hongsong Wang, Feng Zheng

نُشر 2026-02-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xiaofeng Tan, Jun Liu, Yuanting Fan, Bin-Bin Gao, Xi Jiang, Xiaochen Chen, Jinlong Peng, Chengjie Wang, Hongsong Wang, Feng Zheng

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك فناناً موهوباً (مولد صور بالذكاء الاصطناعي) بارع جداً في رسم الصور بناءً على أوصافك. ومع ذلك، عندما تطلب منه "رسم لاعب بيسبول يرمي الكرة"، فإنه أحياناً يصبح مهووساً بملمس العشب أو غرز الخياطة على الكرة لدرجة أنه ينسى أن اللاعب يحمل في الواقع مضرباً، أو قد يضيف بالخطأ ذراعاً ثالثة. يُسمى هذا الهلوسة البصرية (Visual Hallucination).

تقدم الورقة البحثية طريقة تدريب جديدة تسمى ConsistentRFT لإصلاح هذا الأمر. وإليك كيف تعمل، مشروحة ببساطة:

المشكلة: الفنان "المفرط في التحسين"

وجد الباحثون أن الطرق الحالية لتعليم هؤلاء الفنانين من الذكاء الاصطناعي (التي تسمى التعزيز الدقيق بالتعزيز - Reinforcement Fine-Tuning) تعاني من عيبين رئيسيين:

  1. فخ "التكبير" (مشكلة الاستكشاف):
    تخيل أن الذكاء الاصطناعي يحاول تعلم شكل الصورة "الجيدة" من خلال إنشاء العديد من النسخ المتنوعة. الطرق الحالية تعمل مثل مصور فوتوغرافي يكتفي فقط بعمل "زوم" (تكبير) على تفاصيل دقيقة جداً (مثل ورقة شجر واحدة) ليرى ما إذا كانت تبدو حادة وواضحة، متجاهلاً الشجرة بأكملها.
  • النتيجة: يصبح الذكاء الاصطناعي بارعاً جداً في جعل التفاصيل الصغيرة مثالية، لدرجة أنه يبدأ في اختراع تفاصيل وهمية (مثل إضافة نمط شبكي أو زهور إضافية) فقط للحصول على درجة عالية، حتى لو كان الشكل العام للصورة غير منطقي.
  1. ارتباك "التقليد الأعمى" (مشكلة الاستغلال):
    لكي يتعلم، يحاول الذكاء الاصطناعي تقليد الرسومات "الفائزة" التي صنعها أثناء التدريب. ولكن نظرًا لأن طريقة التدريب كانت فوضوية نوعاً ما (بسبب الضجيج العشوائي)، يبدأ الذكاء الاصطناعي في تقليد الفوضى جنباً إلى جنب مع الأجزاء الجيدة.
  • النتيجة: ينسى الذكاء الاصطناعي القواعد السلسة والمنطقية التي تعلمها عندما تم إنشاؤه لأول مرة. ويبدأ في اتخاذ طرق مختصرة غريبة، مما يؤدي إلى صور غير متسقة أو ضبابية.

الحل: ConsistentRFT

يقترح المؤلفون مدرباً جديداً يحتوي على استراتيجيتين لمعالجة هذه المشكلات:

1. استراتيجية "التكبير الديناميكي" (Dynamic Granularity Rollout)

بدلاً من التكبير فقط على التفاصيل الدقيقة أو النظر فقط إلى الصورة ككل، تعلم هذه الطة الجديدة الذكاء الاصطناعي القيام بـ الأمرين معاً، ولكن في الأوقات المناسبة.

  • التشبيه: تخيل معلماً يقول لطالب: "أولاً، انظر إلى الغابة بأكملها لتتأكد من أن الأشجار في أماكنها الصحيحة (الدلالات الكلية - Global Semantics). ثم قم بالتكبير لتتأكد من أن الأوراق تبدو واقعية (التفاصيل المحلية - Local Details)".
  • كيف تعمل: يقوم النظام بالتبديل بين "التحليل خشن الحبيبات" (النظر إلى الصورة الكبيرة) و"التحليل ناعم الحبيبات" (التركيز على التفاصيل) أثناء التدريب. كما يستخدم مرشحاً ذكياً لاختيار أكثر الأمثلة تنوعاً للدراسة، حتى لا يقوم الذكنا الاصطناعي بحفظ نفس "الورقة المثالية" مراراً وتكراراً.

2. استراتيجية "اليد الثابتة" (Consistent Policy Gradient Optimization)

هذا الجزء يمنع الذكاء الاصطناعي من تقليد الرسومات "التدريبية" الفوضوية ويجبره على الالتزام بالقواعد المنطقية التي يعرفها بالفعل.

  • التشبيه: تخيل أن الذكاء الاصطناعي يتعلم ركوب الدراجة. الطريقة القديمة كانت تخبره بأن يقلد المسار المتعرج والمترنح لراكب مخمور لمجرد أنه وصل إلى خط النهاية. أما الطريقة الجديدة فتقول: "لا، قلد المسار السلس والمستقيم لراكب خبير، حتى لو سلك طريقاً مختلفاً قلياً".
  • كيف تعمل: تضيف قاعدة تقول: "أي شيء ترسمه في الخطوة 10 يجب أن يتصل منطقياً بما رسمته في الخطوة 9". هذا يمنع الذكاء الاصطناعي من الهلوسة بتفاصيل غريبة وغير متصلة لمجرد الحصول على درجة مكافأة عالية.

النتائج: فنان أفضل

اختبر المؤلفون هذه الطريقة الجديدة على مولد صور شهير يسمى FLUX1.dev.

  • هلوسة أقل: قللت من "الهلوسات منخفضة المستوى" (مثل الأنسجة الغريبة أو خطوط الشبكة) بنسبة 49%، ومن "الهلوسات عالية المستوى" (مثل الأجسام الخاطئة أو الأجزاء المفقودة) بنسبة 38%.
  • قدرة أفضل على التعميم: على عكس الطرق الأخرى التي تتحسن في أسئلة اختبار محددة وتسوء في كل شيء آخر، حسنت هذه الطريقة قدرة الذكاء الاصطناعي على فهم الأوامر الجديدة وغير المرئية بنسبة 5.1%.
  • السرعة: تعمل بنفس سرعة الطرق القياسية، مما يجعلها ترقية عملية.

باختصار: تعلم طريقة ConsistentRFT الذكاء الاصطناعي كيفية الموازنة بين النظر إلى الصورة الكبيرة والنظر إلى التفاصيل، وتجبره على البقاء منطقياً، مما ينتج صوراً جميلة ومنطقية في آن واحد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →