CrowdGaussian: Reconstructing High-Fidelity 3D Gaussians for Human Crowd from a Single Image
يُعد CrowdGaussian إطار عمل موحداً يعيد بناء حشود بشرية ثلاثية الأبعاد عالية الدقة وواقعية من صور فردية، وذلك عبر توظيف مسار تكيف ذاتي التوجيه للتعامل مع حالات الاحتجاب الواسعة واستراتيجية تعلم ذاتي المعايرة لتحسين تمثيلات "Gaussian Splatting" ثلاثية الأبعاد لمتعدد الأشخاص.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك التقطت صورة واحدة لزاوية شارع مزدحم بالناس. بعضهم يختبئ جزئيًا خلف آخرين، وبعضهم بعيد وضبابي، وقد تكون الإضاءة صعبة أيضًا. الآن، تخيل أنك تريد تحويل هذه الصورة المسطحة ثنائية الأبعاد إلى عالم ثلاثي الأبعاد قابل للاستكشاف بالكامل، حيث يمكنك السير وسط الحشد ورؤية الجميع من أي زاوية، حتى الأجزاء التي كانت مخفية في الصورة الأصلية.
هذا هو بالضبط ما يفعله CrowdGaussian، لكنه تحدٍ تقني هائل. إليك كيف يعمل، مشروحًا ببساء.
المشكلة: "أحجية بقطع مفقودة"
معظم أدوات إعادة البناء ثلاثية الأبعاد تشبه حلالي الأحجيات الذين لا يعملون جيدًا إلا إذا أعطيتهم صورة واضحة وقريبة لشخص واحد. لكن الحياة الواقعية فوضوية. في الحشود:
- الانسداد (Occlusion): الناس يحجبون بعضهم البعض. لا يمكنك رؤية ظهر الشخص الذي أمامك، أو أرجل الشخص الذي خلفك.
- الضبابية (Blur): الناس البعيدون يبدون ككتل صغيرة ضبابية.
- التعقيد: هناك عدد كبير جدًا من الناس لمعالجتهم فردًا تلو الآخر دون أن يستغرق الأمر وقتًا طويلاً.
إذا حاولت استخدام الطرق القديمة على صورة حشد، فستكون النتيجة عادةً كتلة شبحية مليئة بالثقوب، أو الشفافية، أو الوجوه المشوهة بشكل غريب.
الحل: "خدعة سحرية" من مرحلتين
بنى الباحثون نظامًا يسمى CrowdGaussian يعمل كخدعة سحرية من خطوتين لحل هذه المشكلات.
المرحلة الأولى: "المهندس الخيالي" (LORM)
أولاً، ينظر النظام إلى الصورة الفوضوية ويحدد مكان كل شخص. إنه يعرف أين يجب أن تكون أجسامهم بناءً على الأشكال البشرية القياسية (مثل الهيكل العظمي)، حتى لو كانت بعض الأجزاء مفقودة.
- التشبيه: تخيل طفلًا يرسم صورة لشخص ولكنه مسح ذراع الشخص عن الورقة بالخطأ. الفنان العادي قد يترك بقعة فارغة. لكن "مهندسنا" (المسمى LORM) يشبه رسامًا ماهرًا يعرف تمامًا كيف يبدو الذراع. هو لا يخمن فحسب؛ بل يستخدم مكتبة ضخمة من المعرفة البشرية لـ "تخيل" (إعادة بناء) الذراع المفقودة بدقة، رغم أنها لم تكن موجودة في الصورة أبدًا.
- كيف يتعلم: بدلًا من الحاجة إلى معلم يوضح له الأجزاء المفقودة (وهو أمر مستحيل في الحياة الواقعية)، فإنه يعلم نفسه بنفسه. يأخذ صورة مثالية، ويخفي أجزاء منها، ثم يحاول إعادة بناء القطع المفقودة لتطابق الأصل. يصبح بارعًا جدًا في ملء الفراغات دون الحاجة إلى مخططات ثلاثية الأبعاد.
المرحلة الثانية: "ملمع التفاصيل" (CrowdRefiner)
الآن، أصبح لدى النظام حشد ثلاثي الأبعاد، لكنه قد يبدو مثل تمثال بلاستيكي ناعم. الملابس تبدو مسطحة، والشعر ضبابي لأن الصورة الأصلية كانت منخفضة الدقة.
- التشبيه: فكر في هذه المرحلة كأنها محرر صور رفيع المستوى أو نحات يضيف اللمسات النهائية. يأخذ النموذج ثلاثي الأبعاد "البلاستيكي" ويستخدم ذكاءً اصطناعيًا قويًا (نموذج انتشار/diffusion model) لإضافة تجاعيد واقعية، وأنسجة القماش، وخصلات الشعر الحادة.
- سر "المعايرة الذاتية": عادةً، عندما يحاول الذكاء الاصطناعي إضافة تفاصيل، فإنه يبالغ في الحماس ويبدأ في اختراع أشياء غريبة (مثل إعطاء شخص ثلاثة أعين أو نمط قميص غريب). لمنع ذلك، استخدم الباحثون استراتيجية تسمى التعلم ذاتي المعايرة (Self-Calibrated Learning).
- تخيل معلمًا يقول لطالب: "إذا ضبطت الوجه بشكل صحيح، فلا تلمسه. فقط أصلح الأجزاء الضبابية".
- يتعلم الذكاء الاصطناعي أن يكون ذكيًا: فهو يشحذ المناطق الضبابية لكنه يترك الأجزاء الجيدة كما هي. هذا يمنعه من "الإفراط في التصحيح" وتدمير الصورة.
النتيجة: حشد ثلاثي الأبعاد يمكنك السير من خلاله
بمجرد صقل التفاصيل، يحول النظام كل شيء مرة أخرى إلى تنسيق ثلاثي الأبعاد يسمى 3D Gaussians.
- ما هي الـ 3D Gaussians؟ تخيل أن العالم ثلاثي الأبعاد ليس مصنوعًا من مثلثات صلبة (مثل شخصية في لعبة فيديو)، بل من ملايين السحب الصغيرة المتوهجة والضبابية (مثل البريق/الجليتر). هذه السحب مرتبة بدقة شديدة بحيث عندما تنظر إليها، تبدو كصورة فوتوغرافية عالية الدقة.
- الثمرة: بفضل هذه الطريقة، يمكنك أخذ تلك الصورة الفوضوية للحشد وتحويلها إلى مشهد ثلاثي الأبعاد حيث يمكنك:
- السير حول الناس.
- رؤية ظهر الشخص الذي كان مخفيًا.
- التقريب لرؤية تفاصيل حادة على الملابس، حتى لو كانت الصورة الأصلية ضبابية.
لماذا هذا مهم؟
قبل هذا، كانت محاولة نمذجة حشد ثلاثي الأبعاد من صورة واحدة تشبه محاولة بناء منزل من الرمل المبلل—سوف ينهار ببساطة. CrowdGaussian هو الأداة التي تحول ذلك الرمل المبلل إلى قلعة متينة ومفصلة، مما يجعل من الممكن إنشاء عوالم افتراضية غامرة، وألعاب فيديو أفضل، وتجسيدات رقمية (avatars) واقعية للميتافيرس، وكل ذلك من مجرد لقطة واحدة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.