PoseAdapter: Dual-Stream 2.5D Controllable Image Generation for Complex Multi-Object Scenes
يُعد PoseAdapter إطار عمل خفيف الوزن يحقق توليد صور عالي الدقة وقابل للتحكم للمشاهد المعقدة متعددة الكائنات، وذلك من خلال استخدام تمثيل ثنائي التدفق (2.5D) مع ركائز مكانية-زاوية دقيقة وآلية مدركة للسياق للقضاء على تسرب السمات مع الحفاظ على التماسك العالمي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
لقد تعلمت الحواسيب لسنوات كيفية رسم الصور من الكلمات. فإذا طلبت من الآلة "رسم قطة"، يمكنها إنتاج صورة مقنعة لحيوان من الفصيلة السنورية. لكن طلب شيء أكثر تحديداً، مثل "قطة تجلس على كرسي أحمر وتواجه اليسار، بجانب كلب أزرق"، غالباً ما يترك الحاسوب في حالة ارتباك. فقد يضع القطة على الكرسي لكنه يجعلها تواجه الاتجاه الخاطئ، أو قد يمزج ألوان الحيوانين بحيث يبدوان ككائن واحد غريب. ينبع هذا الصعوبة من كون أدوات صناعة الصور الحالية ممتازة في التقاط المزاج العام للمشهد، لكنها تعاني في فهم الهندسة الدقيقة لعدة أشياء. فهي تفتقر إلى القدرة على فهم مكان كل عنصر بدقة، وحجمه، والاتجاه الذي يشير إليه في الفضاء ثلاثي الأبعاد.
حاول الباحثون حل هذه المشكلة عبر تغذية الحاسوب بخرائط ثلاثية الأبعاد معقدة، تشبه المخططات التي يستخدمها المهندسون المعماريون لبناء المنازل. ومع ذلك، فإن هذه المخططات ثقيلة، وصعبة الإنشاء، وتؤدي إلى إبطاء العملية. وحاول آخرون ببساطة قص ولصق الأشياء داخل المشهد، لكن هذا غالباً ما ينتج صوراً تبدو كأنها تجميع (كولاج) لأجزاء غير مترابطة، تفتقر إلى الظلال الطبيعية أو الإضاءة المتسقة. لقد كان التحدي يكمن في إيجاد طريقة لإعطاء الحاسوب تعليمات صارمة حول أماكن الأشياء دون إجباره على معالجة كميات هائلة من البيانات أو فقدان التناغم الطبيعي للمشهد.
قدم فريق من الباحثين نهجاً جديداً يسمى "PoseAdapter"، صُمم لمنح الحواسيب حساً أدق بالمساحة والاتجاه. فبدلاً من الاعتماد على مخططات ثلاثية الأبعاد ثقيلة، يستخدم هذا النظام مجموعة خفيفة من التعليمات لكل عنصر في المشهد: وصف لما هو العنصر، وصندوق بسيط يوضح مكانه على الشاشة، وثلاثة أرقام تخبر الحاسوب بالضبط كيف يلتف هذا العنصر. فكر في الأمر كأنك تعطي الحاسوب قائمة من العناصر مع إحداثيات وزوايا محددة، بدلاً من نموذج ثلاثي الأبعاد معقد. تتيح هذه الطريقة للحاسوب إنشاء صور بدقة عالية، مما يضمن أن الدراجة النارية ليست فقط في مكانها الصحيح، بل هي أيضاً مائلة بالزاوية الصحيحة وتواجه الاتجاه الصحيح.
يكمن الابتكار الجوهري لهذا العمل في كيفية معالجة الحاسوب لهذه التعليمات. فعند إنشاء صورة تحتوي على العديد من الأشياء، يواجه الحاسوب خياراً صعباً: إذا ركز بصرامة شديدة على إبقاء كل جسم منفصلاً، سيبدو المشهد متصلباً وغير طبيعي، كما لو كانت العناصر ملصقة بخلفية. وإذا ركز كثيراً على دمجها معاً، ستبدأ الأشياء في الاختلاط، مما يؤدي إلى تحول الكرسي الأحمر إلى أزرق أو اكتساب الكلب لملامح القطة. ولحل هذه المشكلة، بنى الباحثون نظاماً ذا مسارين؛ يعمل أحد المسارين كحارس صارم، يضمن بقاء كل جسم ضمن حدوده الخاصة والحفاظ على ألوانه وأنسجته الفريدة. أما المسار الآخر فيعمل كوصلة، تسمح للأجسام بـ "رؤية" بعضها البعض حتى تتمكن من مشاركة الضوء والظلال والمنظور بشكل طبيعي. ومن خلال تشغيل هذين المسارين في وقت واحد، يتمكن النظام من إبقاء الأجسام متميزة مع جعلها تشعر في الوقت نفسه بأنها تنتمي إلى نفس العالم.
لتعليم هذا النظام كيفية العمل، أنشأ الباحثون مجموعة جديدة ضخمة من الصور تسمى "OrientLayout". تحتوي هذه المجموعة على أكثر من 110,000 مثال حيث تم تصنيف كل عنصر بعناً من حيث موقعه وحجمه واتجاهه. وقد بذل الفريق جهداً كبيراً لضمان دقة الاتجاهات، حتى أنهم قاموا بفحص آلاف الصور يدوياً لتصحيح الأخطاء. واستخدموا هذه البيانات لتدريب النموذج على فهم العلاقة بين مجموعة بسيطة من التعليمات والنتيجة البصرية النهائية. وقد صُممت عملية التدريب لإعطاء الأولوية للتخطيط العام للمشهد في المراحل الأولى، لضمان أن يحصل الحاسوب على الصورة الكبيرة قبل القلق بشأن التفاصيل الدقيقة.
وعند اختباره مقابل الأساليب الرائدة الأخرى، أظهر "PoseAdapter" تفوقاً واضحاً. ففي التجارب المتعلقة بالأجسام المفردة، استطاع وضع العناصر بدقة متناهية، محققاً مطابقة أفضل بكثير للموقع والزاوية المطلوبة مقارنة بالأنظمة السابقة. وفي المشاهد المعقدة التي تحتوي على عناصر متعددة، مثل غرفة مليئة بالأثاث أو شارع به عدة مركبات، نجحت الطريقة الجديدة في منع اختلاط السمات الذي عانت منه النماذج القديمة. فبينما قد تنتج الأنظمة الأخرى شاشة لابتوب خضراء عندما يُطلب منها شاشة فضية، أو تفشل في وضع سيارة بشكل صحيح على منحدر، حافظ "PoseAdapter" على سلامة كل جسم مع الحفاظ على تماسك المشهد. كما أثبت النظام أنه أسرع بكثير، لأنه لا يحتاج إلى إنشاء أو معالجة خرائط ثلاثية الأبعاد ثقيلة قبل إنشاء الصورة.
تشير النتائج إلى أن التحكم الدقيق في توليد الصور لا يتطلب أدوات حوسبة ثقيلة أو نمذجة ثلاثية الأبعاد معقدة. فمن خلال استخدام مجموعة بسية وفعالة من التعليمات المكانية والزاوية، ومن خلال الموازنة بين الفصل الصارم والاتصال الطبيعي، يمكن للحواسيب الآن إنشاء مشاهد معقدة متعددة الأجسام تكون دقيقة وواقعية بصرياً في آن واحد. وهذا التقدم يقرب المجال من مستقبل يمكن فيه للمستخدمين فرض التكوين الدقيق للمشهد بنفس سهولة وصف قصة، وسيفهم الحاسوب ليس فقط الكلمات، بل أيضاً المساحة التي تشغلها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.