SemanticSlider3D: Training-Free Continuous Semantic Editing for 3D Objects
تُعد SemanticSlider3D تقنية خالية من التدريب تتيح التحرير الدلالي المستمر ودقيق التفاصيل للأجسام ثلاثية الأبعاد عبر بناء اتجاهات خاصة بالسمات في الفضاء الكامن لنموذج توليد ثلاثي الأبعاد، مما يتغلب على تحديات مثل السلامة الهندسية والتماسك عبر الرؤى لتتفوق على النماذج المرجعية الحالية القائمة على البعد الثنائي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تمسك بجسم مادي في يديك، ربما كرسي خشبي أو مزهرية خزفية. إذا أردت تغيير نمطها من ريفي إلى مستقبلي، فسيتعين عليك نحت الخشب أو إعادة تشكيل الطين، وهي عملية بطيئة ودائمة وتتطلب مهارة كبيرة. في العالم الرقمي، كان إنشاء الأجسام ثلاثية الأبعاد للأفلام أو ألعاب الفيديو أو تصميم المنتجات يتبع تقليديًا مسارًا مشابهًا من العمل اليدوي؛ حيث يبني المصممون النماذج قطعة بقطعة، ويصقلون كل منحنى وسطح. مؤخرًا، قدم الذكاء الاصطناعي طريقًا مختصرًا، مما سمح للناس بتوليد أجسام ثلاثية الأبعاد بمجرد كتابة وصف. ومع ذلك، غالبًا ما تعمل أدوات الذكاء الاصطناعي هذه مثل آلة اليانصيب: تكتب وصفًا، ويقوم النظام بإنتاج نتيجة. وإذا كانت النتيجة عصرية للغاية أو ليست دقيقة تمامًا، فلا يمكنك ببساطة إجراء تعديل طفيف؛ بل يجب عليك البدء من جديد بوصف جديد، آملًا في الحصول على نتيجة أفضل. وهذا يجعل من الصعب إجراء تعديلات صغيرة ودقيقة، مثل جعل الكرسي أكثر استدارة قليلاً أو جعل السيارة أكثر انسيابية، دون فقدان السيطرة على التصميم بأكمله.
لقد طور فريق من الباحثين طريقة جديدة تسمى SemanticSlider3D لحل هذه المشكلة. يقدم عملهم وسيلة لتعديل مظهر وملمس جسم ثلاثي الأبعاد بشكل مستمر باستخدام منزلق بسيط، تمامًا مثل التحكم في مستوى الصوت في جهاز الستيريو، ولكن لنمط أو مادة جسم رقمي. بدلاً من البدء من الصفر مع كل تغيير، يسمح هذا النظام للمستخدم بأخذ نموذج ثلاثي الأبعاد موجود وتحريك التحكم ذهابًا وإيابًا لرؤيته يتحول بسلاسة من طرف إلى آخر. على سبيل المثال، يمكن للمستخدم أن يأخذ بيانو قياسي ويحرك التحكم ليجعله يبدو مستقبليًا بشكل متزايد، مشاهدًا كل تباين دقيق بينهما، من لمسة خشبية كلاسيكية إلى تصميم أنيق ومتوهج مع أضواء مدمجة. يحقق النظام ذلك دون الحاجة إلى إعادة التدريب لكل جسم أو نمط جديد، مما يجعله أداة مرنة للمصممين الذين يحتاجون إلى استكشاف العديد من الاحتمالات بسرعة.
كان التحدي الجوهري الذي واجهه الباحثون هو أن الأجسام ثلاثية الأبعاد أكثر تعقيدًا بكثير من الصور المسطحة. عندما تعدل صورة ثنائية الأبعاد، فإنك تغير فقط ما تراه الكاميرا من زاوية واحدة. لكن الجسم ثلاثي الأبعاد يوجد في الفضاء، وتغيير مظهره من جانب واحد يجب أن يكون متسقًا مع كيفية ظهوره من الجوانب الأخرى. إذا قام الذكاء الاصطناعي بتغيير مقدمة الكرسي لتبدو مستقبلية بينما ترك الجزء الخلفي يبدو قديمًا، فستكون النتيجة تبدو مكسورة وغير واقعية. فشلت المحاولات السابقة لحل هذه المشكلة، والتي تضمنت تعديل صورة ثنائية الأبعاد للجسم ثم محاولة تحويل تلك الصورة مرة أخرى إلى شكل ثلاثي الأبعاد. وجد الباحثون أن هذا النهج فشل لأن عملية تحويل الصورة مرة أخرى إلى ثلاثية الأبعاد أدت إلى حدوث أخطاء وعدم اتساق، مما نتج عنه غالبًا أجسام تبدو مشوهة أو فقدت شكلها الأصلي.
لتجاوز هذه الأخطاء، بنى الباحثون نظامهم ليعمل مباشرة داخل "دماغ" الكمبيوتر حيث يتم تخزين الجسم ثلاثي الأبعاد، بدلاً من العمل على الصور المسطحة أولاً. استخدموا نموذج ذكاء اصطناعي قوي يفهم بنية الأشكال ثلاثية الأبعاد. تبدأ العملية بأخذ الجسم ثلاثي الأبعاد الأصلي والنظر إليه من زوايا مختلفة عديدة، مثل نظام كاميرات المراقبة الذي يلتقط الغرفة من جميع الجوانب. ثم يطلب النظام من نموذج لغوي كتابة وصفين: أحدهما يصف الجسم في أقصى حالاته السلبية (عكس التغيير المطلوب) والآخر يصف أقصى حالاته الإيجابية (التغيير المطلوب). على سبيل المثال، إذا كان الهدف هو جعل الأريكة تبدو "مستقبلية جدًا"، فسيقوم النظام بتوليد وصف لأريكة كلاسيكية تقليدية وأخرى لأريكة عصرية فائقة الأناقة.
بعد ذلك، يحدد النظام زوايا الكاميرا الأكثر أهمية لإظهار التغيير. إذا أراد المستخدم تغيير حجم عيني الشخصية، فإن النظام يتجاهل الرؤى من الخلف ويركز فقط على الأمام. ثم يستخدم الأوصاف المتناقضة لإنشاء زوج من الصور لكل عرض مهم: أحدهما يظهر الجسم في أقصى حالاته السلبية والآخر يظهره في أقصى حالاته الإيجابية. ومن خلال مقارنة هذه الأزواج، يحسب النظام اتجاهًا محددًا في مساحته الرياضية الداخلية يؤدي من المظهر القديم إلى المظهر الجديد. يعمل هذا الاتجاه كدليل؛ فعندما يحرك المستخدم المنزلق، يتبع النظام هذا الدليل، معدلًا شكل الجسم وملمسه خطوة بخطوة. ولأن النظام يعمل مباشرة على البنية ثلاثية الأبعاد، فإنه يضمن أن التغييرات تبدو متسقة من كل الزوايا، مما يحافظ على سلامة الجسم مع تطبيق النمط الجديد.
اختبر الباحثون هذه الطريقة على مجموعة بيانات مكونة من خمسين جسمًا مختلفًا، تتراوح بين الحيوانات والأثاث إلى الطعام والمركبات. وقارنوا نظام المنزلق الجديد هذا بالنهج القياسي الذي حاول تعديل الصور ثنائية الأبعاد ثم تحويلها مرة أخرى إلى ثلاثية الأبعاد. قام خمسة خبراء بشريين بتقييم النتائج، حيث صنفوا مدى التنوع الذي أنتجه المنزلق، ومدى اتساق التغييرات، والجودة الإجمالية للنموذج ثلاثي الأبعاد، وما إذا كان النظام قد غير عن طريق الخطأ أجزاءً من الجسم لم يكن من المفترض لمسها. كانت النتائج واضحة: فضل الخبراء طريقة المنزلق الجديدة بشكل ساحق. لقد أنتجت نطاقًا أوسع بكثير من التغييرات ذات المعنى، وحافظت على الأجسام ثلاثية الأبعاد بجودة عالية وبنية سليمة، ونجحت في الحفاظ على الميزات غير المرتبطة بالتغيير. على سبيل المثال، عند جعل الكرسي يبدو أكثر مستقبلية، قام النظام بتغيير النمط دون تغيير عدد الأرجل أو البنية الأساسية للمقعد عن طريق الخطأ.
ولرؤية كيف سيعمل هذا النوع من الأدوات في بيئة تصميم حقيقية، دعا الباحثون ستة أشخاص لديهم خبرة في النمذجة ثلاثية الأبعاد لاستخدام النظام في بيئة محكومة. طُلب من المشاركين إنشاء نماذج أولية ثلاثية الأبعاد لأهداف متنوعة، مثل تصميم مصباح أو طرف اصطناعي. وجد المشاركون أن المنزلق ساعدهم في استكشاف أفكار تصميمية لم يخطر ببالهم في البداية. أحد المشاركين، الذي أراد تصميم مصباح أرضي حديث، فوجئ بأن نسخة بنمط "الريترو" (النمط القديم) قدمت تفاصيل أكثر إثارة للاهتمام من النسخة الحديثة التي تصورها في البداية. مشارك آخر، كان يصمم طرفًا اصطناعيًا للساق، أدرك أن رؤية الطيف الكامل للخيارات ألهمته للتفكير في ميزات جديدة لم يفكر في تضمينها. لم يكن الأداة مجرد محرر، بل كانت شريكًا في العملية الإبداعية، حيث ساعدت المستخدمين على توضيح ما يريدونه حقًا من خلال إظهار النطاق الكامل للاحتمالات.
ومع ذلك، كشفت الدراسة أيضًا عن بعض القيود. فبينما عمل النظام بشكل جيد جدًا في تغيير الأنماط العامة أو المواد أو "مزاج" الجسم، إلا أنه كان أقل دقة عندما يتعلق الأمر بتغيير تفاصيل هندسية محددة، مثل الحجم الدقيق لعين واحدة أو ارتفاع جزء معين. لاحظ الباحثون أن إجراء هذه التغييرات الهيكلية الدقيقة لا يزال صعبًا على النظام للتعامل معه بسلاسة. بالإضافة إلى ذلك، فإن الوقت الذي يستغرقه إنشاء المنزلق يمكن أن يكون كبيرًا، حيث يستغرق الإعداد الأولي حوالي اثنتي عشرة دقيقة وكل نقطة جديدة على المنزلق تستغرق حوالي دقيقة ونصف لإنشائها. وهذا يعني أنه على الرغم من قوة الأداة، إلا أنها ليست فورية بعد، ويجب على المستخدمين التحلي بالصبر أثناء عمل النظام.
على الرغم من هذه القيود، تشير النتائج إلى خطوة مهمة للأمام في كيفية تفاعل البشر مع الذكاء الاصطناعي للتصميم. يوضح النظام أنه من الممكن منح المستخدمين تحكمًا دقيقًا في الأجسام ثلاثية الأبعاد دون مطالبتهم بأن يكونوا خبراء في برامج النمذجة ثلاثية الأبعاد. ومن خلال السماح للناس بالتمرير عبر نطاق مستمر من الأنماط والسمات، تجسر هذه الأداة الفجوة بين الطبيعة الغامضة للمطالبات النصية والاحتياجات الدقيقة للتصميم الاحترافي. إنها تقدم طريقة للتنقل في المساحة الشاسعة من الاحتمالات الإبداعية، مما يساعد المصممين على العثور على التوازن المثالي بين فكرتهم الأولية والمنتج النهائي. ومع تحسن التكنولوجيا، خاصة في التعامل مع التغييرات الهندسية المعقدة وتقليل أوقات الانتظار، يمكن أن تصبح جزءًا قياسيًا من سير العمل الإبداعي، مما يغير طريقة تخيلنا وبنائنا لأجسام المستقبل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.