JoLT: Joint Latent Trajectories for Context-Guided High-Resolution Tiled Generation
يقدم JoLT إطار عمل مبتكر لتوليد الصور عالية الدقة يقوم في آن واحد بإزالة الضجيج عن مسارات الكوامن منخفضة وعالية الدقة في تدفقين مترابطين، مما يجمع بفعالية بين التحكم في التخطيط العام وتوليد التفاصيل الدقيقة لإنتاج صور غنية بالتفاصيل وممتعة بصرياً.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
على مدى عقود، ظل حلم إنشاء الفن باستخدام الكمبيوتر محدودًا بمقايضة بسيطة: كان بإمكانك الحصول على صورة واضحة ومتماسكة، أو صورة مليئة بالتفاصيل المعقدة، ولكن نادرًا ما يمكنك الحصول على كليهما معًا. لقد أصبح الذكاء الاصطناعي الحديث، المدرب على تحويل الأوصاف المكتوبة إلى صور، بارعًا بشكل ملحوظ في التقاط الصورة الكبيرة؛ إذ يمكنه وضع قلعة على تلة أو قطة على حصيرة بمنطق مثالي. ومع ذلك، عندما يطلب الفنانون صورة ضخمة عالية الدقة مخصصة لجدار كبير أو طباعة فنية فاخرة، غالبًا ما تعاني هذه الأنظمة. فهي تميل إلى إنتاج صور تبدو حادة من مسافة بعيدة، لكنها تتفكك عند النظر إليها عن قرب، وتفتقر إلى الأنسجة الكثيفة والغنية التي تجعل المشهد يبدو حقيقيًا. كانت الطريقة القياسية لإصلاح ذلك هي عملية من خطوتين: أولاً، توليد صورة صغيرة منخفضة الدقة لضبط التخطيط العام، ثم محاولة إضافة التفاصيل فوقها. لكن هذا النهج يعاني من خلل جوهري؛ فبمجرد صنع الصورة الصغيرة، لا يستطيع الكمبيوتر العودة وتغيير الصورة الكبيرة لاستيعاب التفاصيل الجديدة، مما يؤدي إلى نتيجة نهائية تبدو فيها الأنسجة الدقيقة وكأنها "ملصقة" فوق المشهد بدلاً من أن تكون "منسوجة" فيه.
اقترح فريق من الباحثين طريقة مختلفة لحل هذه المشكلة، حيث قدموا منهجية تسمى "JoLT"، وهي اختصار لـ (Joint Latent Trajectories) أو المسارات الكامنة المشتركة. وبدلاً من بناء الصورة من الأسفل إلى الأعلى، بالبدء من الصغير ثم النمو نحو الكبير، تقوم JoLT ببناء الصورة من الداخل إلى الخارج، حيث تنشئ التكوين العام والتفاصيل الدقيقة في الوقت ذاته تمامًا. تخيل فنانًا، بدلاً من رسم مخطط تقريبي ثم ملئه لاحقًا، يقوم بطلاء اللوحة بأكملب في حركة واحدة مستمرة، حيث يضبط باستمرار الضربات العريضة لسلسلة جبلية بينما يصقل في الوقت نفسه الأوراق الفردية لشجرة. هذا هو جوهر النهج الجديد. يعمل النظام عبر عمليتين متوازيتين تتواصلان باستمرار؛ تركز إحدى العمليتين على التخطيط العام والتكوين، لضمان منطقية المشهد عالميًا، بينما تركز العملية الأخرى على تفاصيل الدقة العالية، بإضافة الملمس والتعقيد لمناطق محددة. والأهم من ذلك أن هاتين العمليتين ليستا منفصلتين، بل تتبادلان المعلومات في كل خطوة من خطوات الإنشاء؛ حيث تخبر عملية التخطيط عملية التفاصيل بمكان وضع العناصر، وتقوم عملية التفاصيل بتغذية ثرائها المتطور مرة أخرى في عملية التخطيط، مما يسمح للمشهد العام بالتكيف واستيعاب التعقيد الجديد.
اختبر الباحثون هذه الطريقة باستخدام مولد صور قوي وقارنوها بأفضل التقنيات الموجودة. طلبوا من الكمبيوتر إنشاء صور بناءً على أوصاف معقدة تتضمن العديد من الأشياء والإعدادات المختلفة، مثل ردهة فندق مغمورة بالمياه مليئة بالقوارب والساعات والأشجار. كانت النتائج مذهلة؛ فالصور التي أنتجتها JoLT لم تكن أكبر فحسب، بل كانت أكثر تعقيدًا وتفصيلًا بشكل ملحوظ من تلك التي أنتجتها الطرق الأخرى. وعندما قاس الباحثون كثافة المعلومات في الصور، أظهرت ابتكارات JoLT زيادة هائلة في التفاصيل، حيث سجلت بعض المقاييس تحسنًا بنسبة خمسين بالمائة عن أفضل طريقة تالية لها. والأهم من ذلك، ظلت هذه الصور متماسكة؛ فلم تؤدِ التفاصيل الإضافية إلى كسر المشهد أو جعله يبدو فوضويًا، بل بدت وكأنها جزء طبيعي من العالم المصور. كما منحت هذه المنظومة المستخدمين نوعًا جديدًا من التحكم؛ فمن خلال ضبط إعداد بسيط، يمكن للمستخدم رفع أو خفض مقدار التفاصيل، ليقرر بالضبط مدى تعقيد الصورة النهائية دون الحاجة إلى إعادة كتابة الوصف بالكامل.
ولمعرفة ما إذا كانت هذه التحسينات تهم البشر الحقيقيين، أجرى الباحثون دراسة شارك فيها بشر قاموا بمقارنة الصور التي صنعتها JoLT مقابل تلك التي صنعتها الأنظمة الرائدة الأخرى. فضل المشاركون باستمرار صور JoLT، ووجدونها أكثر تفصيلًا، وأكثر تعقيدًا بصريًا، وأكثر جاذبية فنية. كما شعروا أن الصور تطابق الأوصاف المكتوبة الأصلية بنفس قدر الطرق الأخرى، مما يثبت أن إضافة هذا القدر من التفاصيل لم تأتِ على حساب الدقة. تشير الدراسة إلى أن الطريقة القديمة للتفكير في توليد الصور عالية الدقة —التي تبدأ من الصغير ثم تحاول التوسع— ليست المسار الوحيد للمضي قدمًا. فمن خلال معاملة عملية إنشاء المشهد كعملية واحدة موحدة حيث يتطور المشهد العام والتفاصيل الدقيقة معًا، يمكن توليد صور ضخمة النطاق وغنية الملمس في آن واحد. وهذا يفتح آفاقًا جديدة للفنانين والمبدعين الذين يحتاجون إلى صور يمكنها الصمود أمام الفحص الدقيق، محولين الكمبيوتر من مجرد أداة تصنع صورًا بسيطة إلى شريك قادر على توليد عوالم كثيفة وعالية الدقة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.