← أحدث الأبحاث
💻 computer science

ScribbleEdit: Synthetic Data for Image Editing with Scribbles and Text

تقدم هذه الورقة البحثية ScribbleEdit، وهي مجموعة بيانات اصطناعية واسعة النطاق تجمع بين التعليمات باللغة الطبيعية والرسومات الحرة (scribbles) لتدريب وتحسين نماذج تحرير الصور متعددة الوسائط، مما يمكنها من تحقيق تحكم مكاني ودلالي دقيق تعجز النماذج الجاهزة الحالية عن بلوغه.

المؤلفون الأصليون: Anya Ji, George Ma, Téa Wright, Yiming Zhang, David M. Chan, Alane Suhr, Somayeh Sojoudi

نُشر 2026-05-06
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Anya Ji, George Ma, Téa Wright, Yiming Zhang, David M. Chan, Alane Suhr, Somayeh Sojoudi

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول إعطاء تعليمات لفنان موهوب للغاية ولكنه مرتبك قليلاً. تريد تغيير صورة، ولكن لديك طريقتان للتحدث معه:

  1. الطريقة النصية: تقول له: "ضع تفاحة حمراء في المنتصف". يفهم الفنان "التفاحة الحمراء" تماماً، لكنه قد يضعها في اليسار، أو اليمين، أو يجعلها ضخمة جداً. إنه يفتقر إلى رؤيتك المحددة لـ أين توضع.
  2. طريقة الخربشة: تمسك قلماً وترسم دائرة مهزوزة وغير منتظمة على الصورة حيث تريد وضع التفاحة. يعرف الفنان تماماً أين يضعها، لكن ليس لديه أدنى فكرة عما إذا كانت يجب أن تكون حمراء، أو خضراء، أو لامعة، أو وبرية.

المشكلة: محررات الصور بالذكال الاصطناعي الحالية بارعة في أحدهما، لكنها تعاني في الجمع بين الاثنين معاً. فهي ترتبك عند محاولة دمج الخربشة مع النص، والسبب الرئيسي هو أنها لم تُدرب على ما يكفي من الأمثلة لهذا المزيج المحدد.

الحل: ScribbleEdit
قام مؤلفو هذه الورقة البحثية ببناء "صالة ألعاب رياضية للتدريب" ضخمة للذكاء الاصطناعي تسمى ScribbleEdit. فكر في الأمر كأنها مكتبة ضخمة من تمارين الممارسة حيث يتعلم الذكاء الاصطناعي كيفية الاستماع إلى كل من النص والخربشة في وقت واحد.

إليك كيف بنوا هذه المكتبة:

  • الإعداد: أخذوا آلاف الصور لأشياء (مثل التفاح، أو القطط، أو السيارات).
  • الممحاة: استخدموا أداة "ممحاة" ذكية لإزالة الشيء، تاركين مكاناً فارغاً في الخلفية.
  • الدليل: أخذوا الصورة الأصلية وربطوها بخربشة مرسومة يدوياً وغير منتظمة (مثل رسم طفل) تحدد تقريباً مكان الشيء الذي يجب أن يوضع.
  • النص: استخدموا ذكاءً اصطناعياً آخر لكتابة جملة تصف الشيء (على سبيل المثال: "ضع تفاحة حمراء لامعة هنا").
  • النتيجة: أنشأوا أكثر من 11,000 مثال حيث كان على الذكاء الاصطناعي النظر إلى المكان الفارغ، والخربشة الفوضوية، والجملة، ثم "رسم" الشيء مرة أخرى في المكان الذي تشير إليه الخربشة بالضبط، ليبدو تماماً كما وصف النص.

التجربة
أخذ الباحثون نوعين مختلفين من فناني الذكاء الاصطناعي وأخضعوهما للاختبار:

  1. الفنان "الجاهز": هؤلاء هم نماذج مدربة مسبقاً لم ترَ ScribbleEdit من قبل.
  2. الفنان "المُدرب": هم نفس النماذج، ولكن بعد دراستها لمكتبة ScribbleEdit.

النتائج

  • قبل التدريب: كانت النماذج غير المدربة سيئة للغاية. فعندما تُعطى خربشة، غالباً ما تتجاهلها، أو ترسم أشكالاً غريبة تبدو مثل الخربشات، أو تفشل ببساطة في تعديل الصورة. لم تكن تفهم "لغة" الخطوط المهزوزة.
  • بعد التدريب: بمجرد أن درست النماذج مجموعة بيانات ScribbleEdit، أصبحت أفضل بكثير. لقد تعلمت:
    • وضع الشيء تماماً حيث أشارت الخربشة (الدقة المكانية).
    • جعل الشيء يبدو كما وصف النص (الدقة الدلالية).
    • الحفاظ على بقية الصورة بشكل طبيعي.

الخلاصة
تظهر الورقة البحثية أنه بينما أصبح الذكاء الاصطناعي جيداً في تحرير الصور، إلا أنه لا يزال يعاني في فهم طريقتنا الفوضوية في الرسم. ومن خلال إنشاء مجموعة بيانات اصطناعية تعلم الذكاء الاصطناعي كيفية الجمع بين "الرسومات التقريبية" و"التعليمات الواضحة"، أثبت الباحثون أن الذكاء الاصطناعي يمكنه أن يتعلم كيف يكون محرراً أكثر دقة وطاعة.

ما لم يفعلوه (قيود هامة)
الورقة البحثية محددة جداً بشأن ما لم يفعلوه:

  • لم يخترعوا طريقة جديدة للرسم؛ بل استخدموا رسومات بشرية موجودة بالفعل من قاعدة بيانات تسمى "Sketchy".
  • اختبروا فقط "إعادة إضافة شيء ما" (إضافة الأشياء). لم يختبروا أموراً معقدة مثل تغيير وجه شخص أو تعديل جزء صغير من قميص.
  • لم يدّعوا أن هذا يعمل في التصوير الطبي أو المجالات المتخصصة الأخرى؛ فالأمر يتعلق حصرياً بتحرير الصور العام.

باختدات، ScribbleEdit هو دليل تدريب جديد يعلم الذكاء الاصطناعي كيفية الاستماع إلى خربشاتنا الفوضوية وكلماتنا الواضحة في آن واحد، مما يجعل تحرير الصور يبدو كأنه حديث مع مساعد بشري متعاون بدلاً من كونه تخميناً للغز.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →