← أحدث الأبحاث
💻 computer science

High Quality Image Generation using Improved Generative Adversarial Networks and Optimized Stable Diffusion Models

تقترح هذه الورقة بنية هجينة تجمع بين الشبكات التنافسية التوليدية (GANs) ونماذج الانتشار المستقر (Stable Diffusion) المُحسّنة لمعالجة عدم استقرار التدريب وانهيار النمط، محققةً توليد صور عالية الجودة بواقعية فائقة مقارنة بالشبكات التنافسية التوليدية المستقلة لتطبيقات تتراوح من إعادة البناء الجنائي إلى تعزيز البيانات.

المؤلفون الأصليون: Satishkumar Varma, Kunal Wagh, Omkar Raul, Sejal Chandgadkar, Shreya Belanekar, Kanchan Dabre

نُشر 2026-09-21
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Satishkumar Varma, Kunal Wagh, Omkar Raul, Sejal Chandgadkar, Shreya Belanekar, Kanchan Dabre

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في العصر الرقمي، تعلمت الحواسيب كيف ترى وتُبدع، متجاوزةً بمراحل مجرد العمليات الحسابية البسيطة إلى مجال التركيب الفني. وفي قلب هذه القدرة تكمن أنظمة مصممة لإنشاء صور من العدم، محاكيةً الطريقة التي قد يرسم بها الإنسان أو يلتقط بها صورة لمشهد لم يره في الواقع قط. لسنوات طويلة، اعتمدت الطريقة الرائدة لهذه المهمة على مفهوم يُعرف باسم "الشبكة التنافسية التوليدية" (Generative Adversarial Network). تخيل فنانين يعملان في نفس المرسم: أحدهما يحاول إنشاء تزوير مقنع، بينما يعمل الآخر كناقد صارم، يحاول كشف التزييف. يخوضان لعبة مستمرة حيث يصبح المزور أكثر براعة في إخفاء حيله، ويصبح الناقد أكثر حدة في اكتشافها. ومع مرور الوقت، تجبر هذه المنافسة المزور على إنتاج صور واقعية للغاية لدرجة أن الناقد الخبير لا يستطيع تمييزها عن الحقيقة. ومع ذلك، فإن هذه العملية صعبة الإدارة بشكل ملحوظ؛ إذ غالباً ما يعلق الفنانون في نمط مكرر، فينتجون نفس الصور القليلة مراراً وتكراراً، أو تنهار اللعبة ببساطة قبل إنتاج أي شيء مفيد.

وفي الآونة الأخيرة، ظهر نهج مختلف، لا يعتمد على لعبة تنافسية بل على عملية صقل تدريجي. فكر في الأمر كأنك تبدأ بلوحة مغطاة بالتشويش، مثل الثلج الذي يظهر على شاشة تلفاز قديم، ثم تقوم ببطء بتنقية هذا الضجيج للكشف عن صورة واضحة تحتها. هذه الطريقة، المعروفة باسم "نموذج الانتشار" (diffusion model)، أظهرت قدرة مذهلة على إنشاء صور عالية الجودة تتسم بالاستقرار والتنوع. وقد اكتسب إصدار محدد من هذه التقنية، يُسمى "ستابل ديفيوجن" (Stable Diffusion)، اهتماماً كبيراً لقدرته على تحويل الأوصاف المكتوبة إلى مشاهد بصرية. لطالما تساءل الباحثون كيف تقارن هاتان الطريقتان المختلفتان —اللعبة التنافسية والصقل التدريجي— عندما يتم دفعهما إلى أقصى حدودهما، وما إذا كان الجمع بين نقاط قوتهما يمكن أن يحل المشكلات المستمرة التي أعاقت توليد الصور لسنوات.

قام فريق من الباحثين من كليات في مومباي، الهند، باستكشاف هذا السؤال من خلال بناء واختبار كلا النظامين جنباً إلى جنب. ركز عملهم على تحدٍ محدد: إنشاء صور عالية الجودة عندما تكون البيانات المتاحة محدودة، وهو موقف يحدث غالباً في مجالات مثل الطب الشرعي أو التصوير الطبي حيث تكون الأمثلة الحقيقية نادرة. قاموا بتدريب أنظمتهم على ثلاث مجموعات مختلفة من الصور: مجموعة تضم 3,000 صورة بورتريه عالية الجودة لوجوه بشرية، ومجموعة أكبر تضم 6,000 صورة عامة من الإنترنت، ومجموعة صغيرة تضم 100 صورة لمشاهير. كان الهدف هو معرفة أي نظام يمكنه إنتاج نتائج أكثر واقعية، وما إذا كان بإمكانهم إنشاء صور جديدة لشخص معين، مثل ممثل ما، بناءً على عدد قليل فقط من الأمثلة.

كشفت نتائج تجاربهم عن تميز واضح بين التقنيتين. فالنظام التنافسي التقليدي، "الشبكة التنافسية التوليدية"، كان قادراً على التعلم وإنتاج وجوه يمكن التعرف عليها بعد التدريب، لكنه عانى من عدم الاتساق. وعندما اختبره الباحثون على المجموعة الكبيرة من صور الإنترنت، استطاع النظام تحديد الصور الحقيقية مقابل ابتكاراته الخاصة بدقة بلغت 91 بالمئة، وفي مجموعة البورتريه، وصل إلى دقة 81 بالمئة. وبينما تظهر هذه الأرقام أن النظام كان يتعلم، إلا أن الصور التي أنتجها غالباً ما افتقرت إلى التفاصيل الدقيقة والتنوع الطبيعي الموجود في الحياة الواقعية. لاحظ الباحثون أن النظام يفشل أحياناً في استيعاب النطاق الكامل من الاحتمالات في البيانات، مما يؤدي إلى صور تبدو مكررة قليلاً أو أقل حدة.

في المقابل، أظهر النظام القائم على عملية الصقل التدريجي، نموذج "ستابل ديفيوجن"، قدرة فائقة على إنشاء صور واقعية ومتنوعة. وعندما قام الباحثون بضبط هذا النموذج بدقة لفهم موضوعات محددة، كان التحسن مذهلاً. فعلى سبيل المثال، عندما دربوا النموذج على صور الممثل براد بيت، لم يكتفِ النموذج بنسخ الصور التي رآها؛ بل استنبط النموذج المعدل ملامح الممثل في مرحلة عمرية سابقة، رغم عدم إدراج أي صور من طفولته في بيانات التدريب. هذه القدرة على تخيل الشخص في مرحلة مختلفة من حياته تشير إلى أن النموذج يمكنه إنشاء صورة مقنعة له وهو طفل. وقاس الباحثون هذا النجاح باستخدام نظام تسجيل يتحقق من مدى مطابقة الصورة للوصف المقدم؛ حيث حقق النموذج المحسن درجة 31.98 على مجموعة صور الإنترنت، وهو رقم يشير إلى مستوى عالٍ من التماسك البصري والتفاصيل.

كما استكشفت الدراسة كيفية جعل هذه الأنظمة تعمل بشكل أفضل عبر ضبط إعداداتها الداخلية، تماماً مثل ضبط مقابض الراديو للعثور على أوضح إشارة. ووجدوا أن حجم مجموعة الصور التي يعالجها الكمبيوتر في المرة الواحدة يؤثر بشكل كبير على جودة المخرجات. ومن خلال اختبار أحجام مجموعات مختلفة، اكتشفوا أن معالجة خمس صور في المرة الواحدة تعطي أفضل النتائج لإعداداتهم الخاصة. علاوة على ذلك، قارنوا بين إصدارات مختلفة من تقنية الصقل ووجدوا أن أفضل نموذج لإنشاء البورتريه ليس بالضرورة هو نفسه الذي يعمل بشكل أفضل للمشاهد العامة. وهذا يسلط الض الضوء على أنه لا توجد أداة واحدة مثالية لكل مهمة؛ إذ يجب تفصيل اختيار النظام وفقاً لنوع الصور المراد إنشاؤها.

في النهاية، خلص الباحثون إلى أنه بينما يكون للمنهج التنافسي مكانته، فإن نهج الصقل التدريجي يوفر مساراً أكثر موثوقية لتوليد صور عالية الجودة، خاصة عندما يكون الهدف هو إنشاء تنويعات واقعية لموضوع ما من كمية صغيرة من البيانات. أنتجت النماذج المصقولة صوراً بأخطاء أقل، مثل الحواف الضبابية أو التشوهات الغريبة، وحافظت على اتساق في الإضاءة والألوان عجز النظام الآخر عن مضاهاته. ويشير هذا العمل إلى أنه بالنسبة للتطبيقات التي تتطلب دقة عالية، مثل إنشاء أدلة بصرية للقضايا القانونية، أو تحسين الفحوصات الطبية، أو إنتاج الفن، فإن التقنية الأحدث القائمة على الصقل هي الأداة الأكثر قوة. وأشار الباحثون إلى أن نتائجهم يمكن أن تساعد في مجالات متنوعة، من الزراعة إلى العلوم الجنائية، من خلال توفير وسيلة لتوليد بيانات بصرية واقعية حيث لم تكن موجودة سابقاً. وتعد هذه الدراسة برهاناً عملياً على أنه من خلال تحسين هذه الأنظمة الحديثة، يمكننا الاقتراب من آلات لا تنشئ مجرد صور، بل واقعاً قابلاً للتصديق.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →