← أحدث الأبحاث
💻 computer science

Frequency-Decomposed Avatar Representation for Varying Camera Distances

يُعد CloseUpAvatar تمثيلاً مبتكراً للأفاتار البشري المفصلي، حيث يستخدم أنسجة قابلة للتعلم ومفككة ترددياً على مستويات منسوجة للتكيف تلقائياً مع تفاصيل الرندرة بناءً على مسافة الكاميرا، مما يحقق نتائج واقعية عالية الجودة عبر نطاق واسع من زوايا الرؤية مع الحفاظ على معدلات إطارات مرتفعة.

المؤلفون الأصليون: David Svitov, Pietro Morerio, Lourdes Agapito, Alessio Del Bue

نُشر 2026-09-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: David Svitov, Pietro Morerio, Lourdes Agapito, Alessio Del Bue

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول التقاط صورة لشخص في عالم رقمي بدقة متناهية بحيث يمكنك الاقتراب منه مباشرة، وتفحص نسيج قميصه، أو التراجع للخلف لرؤية جسده بالكامل في غرفة مزدحمة. لسنوات طويلة، كافح علماء الكمبيوتر لإنشاء هؤلاء "البشر الرقميين" الذين يبدون حقيقيين عند كل مسافة. تكمن المشكلة في وجود مقايضة: فالطرق التي تبدو حادة وواضحة عندما تكون قريباً غالباً ما تصبح ضبابية أو مشوهة عندما تبتعد، بينما الطرق التي تعمل بشكل جيد من بعيد تفقد التفاصيل الدقيقة اللازمة للرؤية عن قرب. هذا القصور قد أعاق تطبيقات الواقع الافتراضي، وألعاب الفيديو، والتواجد عن بُعد، حيث يحتاج المستخدمون للتفاعل مع البشر الرقميين بشكل طبيعي، والتحرك بحرية دون أن تتفكك الصورة.

لطال الوقت والحل لهذه المشكلة يكمن في مفهوم يُعرف بـ "مستوى التفاصيل" (level of detail)، وهو تقنية تُستخدم في رسومات الكمبيوتر لتبسيط الأجسام المعقدة عندما تكون بعيدة وإضافة التفاصيل عندما تقترب. ومع ذلك، لم تتمكن الطرق الموجودة لإنشاء الصور الرمزية البشرية المتحركة (avatars) من تطبيق هذه الفكرة بسلاسة؛ فهي إما تعتمد على أشكال ثلاثية الأبعاد صلبة تفتقر إلى الملمس، أو تستخدم آلاف النقاط الصغيرة العائمة التي تصبح فوضوية وبطيئة عندما تقترب الكاميرا كثيراً. وقد طور فريق من الباحثين الآن طريقة جديدة لبناء هؤلاء البشر الرقميين تحل مشكلة المسافة هذه، مما يسمح بإنشاء تمثيل واحد عالي الجودة يبدو واقعياً سواء كنت واقفاً على بعد بوصات أو في الجهة الأخرى من الغرفة.

قام الباحثون، بالعمل مع بيانات من كاميرات عالية الدقة، بإنشاء نظام أطلقوا عليه اسم "CloseUpAvatar". وبدلاً من محاولة بناء الشخص من شبكة صلبة أو سحابة من ملايين النقاط، قاموا بتمثيل جسم الإنسان كمجموعة من المربعات المسطحة الصغيرة ذات الملمس. تخيل هذه المربعات كلوحات إعلانية صغيرة ومرنة تغطي سطح الجسم، حيث تحمل كل لوحة صورتها الخاصة التي يمكن أن تتغير مع حركة الشخص. ويكمن الابتكار الرئيسي في كيفية تخزين هذه الصور؛ فقد أدرك الفريق أن ملف صورة واحد لا يمكنه التعامل مع كل من الألوان الواسعة للوجه وتفاصيل مسام الجلد الحادة في آن واحد دون أن يحدث ارتباك.

ولإصلاح ذلك، قاموا بتقسيم المعلومات المرئية إلى طبقتين منفصلتين لكل لوحة إعلانية صغيرة. تحمل طبقة واحدة التفاصيل منخفضة التردد، وهي الألوان والأشكال العامة الناعمة التي تحدد المظهر العام للشخص. وتحمل الطبقة الثانية التفاصيل عالية التردد، وهي الأنسجة الحادة والواضقة مثل التجاعيد، والمسام، وأنماط القماش. تم تصميم النظام ليكون ذكياً في تحديد متى يستخدم أي طبقة؛ فعندما تكون الكاميرا بعيدة، يعرض النظام فقط الطبقة منخفضة التردد الناعمة، وهو أمر فعال ويبدو مثالياً من مسافة بعيدة. ومع اقتراب الكاميرا، يقوم النظام تلقائياً وبشكل تدريجي بدمج الطبقة عالية التردد الحادة. يحدث هذا الانتقال بسلاسة شديدة بحيث لا يلاحظ المشاهد عملية التبديل؛ إذ تصبح الصورة ببساطة أكثر حدة مع الاقتراب، دون أي قفزات مفاجئة أو ضبابية.

اختبر الباحثون هذا النهج باستخدام مجموعة بيانات كبيرة لأشخاص حقيقيين تم تصويرهم من زوايا عديدة، بما في ذلك لقطات عالية الدقة سمحت لهم بمحاكاة عمليات التقريب الشديد. وقارنوا طريقتهم الجديدة بأفضل التقنيات الحالية في هذا المجال. وأظهرت النتائج أنه بينما عانت الطرق الأخرى لإنتاج صورة واضحة عند تقريب الكاميرا، مما أدى غالباً إلى وجوه ضبابية أو مشوهة، حافظ نظامهم الجديد على جودة واقعية تشبه الصور الفوتوغرافية. وفي الواقع، تمكنت الطريقة الجديدة من عرض هذه الصور الرمزية المفصلة بسرعة تزيد عن 200 إطار في الثانية، وهي سرعة كافية للتفاعل في الوقت الفعلي في الواقع الافتراضي. وقد تحقق هذا من خلال استخدام عدد أقل بكثير من وحدات البناء مقارنة بالطرق السابقة، مما يثبت أن امتلاك قطع أقل ولكن أكثر ذكاءً هو أكثر فعالية من امتلاك الملايين من القطع البسيطة.

كان أحد أهم النتائج هو قدرة النظام على تعلم التعامل مع هذه المسافات المتغيرة أثناء عملية التدريب. لقد علم الباحثون الكمبيوتر من خلال إظهار نفس الشخص من مسافة قريبة جداً ومن مسافة بعيدة جداً، وهي تقنية فشلت فيها الطرق الأخرى أو أنتجت عيوباً غريبة. ومن خلال استخدام نهج تقسيم التردد، تعلم النظام فصل الشكل العام عن التفاصيل الدقيقة، مما سمح له بالتكيف فوراً مع موقع الكاميرا. وهذا يعني أنه يمكن التجول حول إنسان رقمي تم إنشاؤه بهذه الطريقة، وفحصه عن كثب، ومشاهدته من مسافة بعيدة دون أن تتدهور جودة الصورة أبداً.

يُظهر هذا العمل أنه من الممكن الحصول على إنسان رقمي واحد يتسم بالكفاءة والدقة المتناهية في آن واحد. وأشار الباحثون إلى أنه بينما يعد نظامهم فعالاً للغاية للجسم والميزات العامة، فإنه لا يزال يواجه تحديات مع التفاصيل الدقيقة للغاية مثل الأصابع الفردية أو تعبيرات الوجه المعقدة، والتي تظل مجالاً للتحسين في المستقبل. ومع ذلك، بالنسبة للمهمة الأوسع المتمثلة في إنشاء بشر رقميين تفاعليين وواقعيين، فإن هذا النهج الجديد يمثل قفزة نوعية كبيرة؛ فهو يزيل الحاجز بين المستخدم والعالم الرقمي، ويضمن أنه مهما اقتربت، سيظل الشخص على الشاشة يبدو حقيقياً تماماً كما يبدو من بعيد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →