EditFlow3D: Automated Local Editing of 3D Assets with Trajectory Preservation
يُعد EditFlow3D إطار عمل لا يتطلب تدريباً يتيح التحرير المحلي الدقيق والآلي للأصول ثلاثية الأبعاد من خلال الاستفيد من سير عمل مدفوع بنماذج الرؤية واللغة الكبيرة (VLM) لتوليد الأقنعة والتوجيه البصري، مع توظيف التدفق التفاضلي الموجه بالقناع والحفاظ على المسار خطوة بخطوة لتحرير المناطق المستهدفة دون المساس ببنية ومظهر المناطق غير المستهدفة.
تخيل أن لديك منحوتة من الطين السحري يمكنك إعادة تشكيلها بمجرد التحدث إليها. هذا هو الحلم وراء نماذج التوليد ثلاثية الأبعاد، وهي فرع من فروع الذكاء الاصطعي الذي يبني كائنات ثلاثية الأبعاد من خلال الأوصاف النصية أو الصور. فكر في هذه النماذج كأنها نحاتون رقميون ماهرون للغاية، ولكنهم متعثرون قليلاً؛ فهم بارعون في صنع تمثال جديد تماماً من الصفر، ولكن إذا طلبت منهم فقط "تغيير القبعة" على تمثال موجود بالفعل دون إفساد الوجه أو الذراعين، فإنهم غالباً ما يواجهون صعوبة. قد يتسببون في إذابة التمثال بالكامل، أو قد يصبغون أنف التمث باللون الأزرق عن طريق الخطأ أثناء محاولتهم إصلاح القبعة.
التحدي الجوهري هنا هو التعديل المحلي: إجراء تغييرات دقيقة على جزء معين من كائن ثلاثي الأبعاد مع إبقاء كل شيء آخر كما هو تماماً. الأمر يشبه محاولة استبدال محرك سيارة دون تفكيك السيارة بأكملها أو تغيير لون الإطارات بالخطأ. وللقيام بذلك بشكل جيد، يحتاج الكمبيوتر إلى شيئين: خريطة مثالية لـ أين يجب إجراء التغييرات (قناع)، وطريقة لإجراء التغيير دون أن يتسرب "سحر" التعليمات الجديدة إلى الأجزاء التي لا ينبغي أن تتغير. وحتى الآن، كان الحصول على هذه الخريطة المثالية تلقائياً أمراً صعباً، وكان الحفاظ على استقرار بقية الكائن أكثر صعوبة.
هنا يأتي دور EditFlow3D، وهو أسلوب جديد يعمل كنحات رقمي فائق الدقة ولا يحتاج إلى تدريب. فبدلاً من الحاجة إلى تعلم كيفية النحت من جديد في كل مرة (وهو ما يعنيه "التدريب" عادةً)، فإنه يستخدم مساعداً ذكياً ليفهم بالضبط ما تريده وأين تضعه. يعمل النظام عبر مرحلتين رئيسيتين. أولاً، يقوم "نموذج رؤية-لغوي" (نوع من الذكاء الاصطناعي الذي يفهم الصور والكلمات معاً) بفحص الكائن ثلاثي الأبعاد وتعليماتك (مثل "استبدل العباءة الحمراء بأجنحة خفاش سوداء"). يقوم النموذج باختيار أفضل زاوية للنظر إلى الكائن، ويرسم صورة لما ستكون عليه النتيجة، والأهم من ذلك، يرسم خريطة ثلاثية الأبعاد دقيقة (قناع) توضح بالضبط أي البكسلات تنتمي للعباءة وأيها تنتمي لبقية التمثال.
بمجرد تجهيز الخريطة، يحدث السحر الحقيقي. يستخدم النظام تقنية تسمى توجيه التدفق التفاضلي (Differential Flow Guidance). تخيل أن الكائن ثلاثي الأبعاد هو نهر يتدفق نحو شكل نهائي. يحسب الذكاء الاصطناعي الفرق بين كيفية تدفق النهر إذا كان مجرد التمثال الأصلي مقابل كيفية تدفقه إذا كان التمثال بالأجنحة الجديدة. ثم يدفع المياه فقط في اتجاه الأجنحة، ولكن فقط داخل المنطقة المحددة بالعباءة. يضمن هذا حدوث التغيير تماماً حيث تريده.
ومع ذلك، هناك عقبة: حتى لو دفعت المياه فقط في منطقة العباءة، فقد تنتشر التموجات أحياناً وتزعزع استقرار بقية التمثال. ولمنع حدم، قدم المؤلفون تقنية توجيه الحفاظ على المسار (Trajectory Preservation Guidance). فكر في هذا كيد لطيفة وغير مرئية تمسك ببقية التمث وتثبته. بينما يبني الذكاء الاصطناعي الأجنحة الجديدة خطوة بخطوة، تقوم هذه "اليد" باستمرار بفحص الأجزاء التي لا ينبغي أن تتغير (مثل الوجه أو الساقين) وتدفعها بلطف للعودة إلى شكلها الأصلي إذا بدأت في الانحراف. وبخلاف الأساليب القديمة التي قد تكتفي بتجميد تلك الأجزاء في مكانها (مما قد يسبب حوافاً متعرجة ومكسورة)، فإن هذه الطريقة توجهها بنعومة، مما يحافظ على سلاسة الانتقال ويجعل الكائن بأكمله يبدو طبيعياً.
اختبر الباحثون هذا الأسلوب الجديد في مجموعة متنوعة من المهام، من إضافة دخان إلى مدخنة قطار إلى استبدال دجاجة بباندا. وقارنوه بأفضل الأساليب الأخرى ووجدوا أن EditFlow3D كان أفضل بكثير في إصابة المنطقة المستهدفة دون إفساد بقية النموذج. في الواقع، في دراسة أجريت على المستخدمين شارك فيها 40 شخصاً، فضل نصف المشاركين تقريباً نتائج EditFlow3D على جميع الأساليب الأخرى، مشيدين بقدرته على اتباع التعليمات بدقة مع الحفاظ على مظهر الكائن الأصلي سليماً. وتشير الورقة البحثية إلى أنه من خلال الجمع بين "صانع خرائط" ذكي و"يد ثابتة" توجه التغييرات، يمكننا أخيراً تعديل الكائنات ثلاثية الأبعاد بدقة الجراح وسهولة المحادثة.
ملخص تقني: EditFlow3D
بيان المشكلة
يتطلب التحرير المحلي القابل للتحكم للأصول ثلاثية الأبعاد تحديداً دقيقاً للمناطق المستهدفة وتوجيهاً بصرياً مناسباً. تواجه الطرق الحالية تحديين رئيسيين:
الحصول على القناع (Mask Acquisition): هناك نقص في وجود طريقة بسيطة ودقيقة في آن واحد للحصول على أقنعة ثلاثية الأبعاد لمناطق محددة.
الحفاظ على المنطقة (Region Preservation): تجد النهج الحالية صعوبة في تحقيق التعديلات المطلوبة مع الحفاظ بأمانة على بنية ومظهر المناطق غير المستهدفة. غالباً ما تعاني هذه الطرق من تدهور غير مقصود، أو عدم اتساق بين الرؤى (cross-view inconsistencies)، أو عيوب في الحدود عند تعديل أجزاء معينة من الأصل.
بينما تسمح التطورات الأخيرة في النماذج التوليدية ثلاثية الأبعاد بإنشاء الأصول من النصوص أو الصور، فإن تعديل الأصول الموجودة (مثل استبدال المكونات أو إزالة الهندسة) يتطلب موازنة بين تعديل الهدف والحفاظ على المصدر. فالأقنعة المكانية وحدها لا يمكنها منع تأثير التكييف المستهدف (target conditioning) على المناطق غير المستهدفة، كما أن استبدال الميزات المباشر يمكن أن يخل بالاتساق بين المناطق.
المنهجية
EditFlow3D هو إطار عمل خالٍ من التدريب (training-free framework) مصمم للتحرير المحلي الدقيق للأصول ثلاثية الأبعاد. يعمل في فضاء التمثيل الأصلي لنموذج توليدي ثلاثي الأبعاد مدرب مسبقاً (تحديداً عائلة TRELLIS) ويتكون من مرحلتين رئيسيتين:
1. بناء التحكم في التحرير الآلي المدفوع بنماذج اللغة والرؤية (VLM)
تقوم هذه المرحلة بتحويل مدخلات المستخدم المرنة (التعليمات النصية، الصور المرجعية الاختيارية، والأصول ثلاثية الأبعاد المصدرية) إلى ضوابط بصرية ومكانية دقيقة.
اختيار الرؤية وتوليد التوجيه: يقوم نموذج لغة ورؤية (VLM) بتحليل عمليات رندرة متعددة الرؤى للأصل المصدر لاختيار الرؤية المثلى (Isrc) التي تظهر المنطقة المستهدفة. ثم يوجه الـ VLM نموذج تحرير صور لتوليد صورة توجيه بصري (Iedit) تصور التعديل المطلوب.
بناء القناع ثلاثي الأبعاد:
التفكيك الأولي: يُستخدم P3-SAM لتفكيك الأصل المصدر إلى أجزاء في الفضاء ثلاثي الأبعاد الأصلي.
التحسين: لمعالجة تسرب المنطقة عند وصلات الأجزاء، يستخدم النظام تقسيمات هرمية من PartField وتقسيمات متعددة المستويات من S2AM3D. يقوم النظام برسم خرائط لهذه المخرجات إلى نقاط السطح ويختار الأجزاء المرشحة بناءً على "نقاء التداخل" (overlap purity) مقابل القناع الأولي.
الدمج: يتم تصفية المرشحين ودمجهم بناءً على الاتصال الهندسي واتساق الناظم السطحي (surface-normal consistency) لإنتاج قناع سطح محسن (Mref).
الرسم النهائي: يتم رسم خريطة لـ Mref إلى الإحداثيات المتفرقة الأصلية للنموذج التوليدي لإنشاء قناع التحرير النهائي (Medit) ومكمله (Mkeep).
2. تحرير التدفق ثلاثي الأبعاد المحلي (Local 3D Flow Editing)
تقوم هذه المرحلة بإجراء التعديل باستخدام استراتيجية توجيه ثنائية المسار ضمن تدفق النموذج التوليدي:
توجيه التدفق التفاضلي (DFG):
يعمل أثناء توليد الفوكسل المتفرق (sparse voxel generation).
يحسب اتجاه التحرير من خلال مقارنة حقول السرعة المتوقعة تحت شرط المصدر البصري (csrc) وشرط الهدف البصري (cedit).
يعمل الفرق (Δvt) كمتجه التحرير.
يقوم القناع ثلاثي الأبعاد (Sedit) بتقييد هذا التحديث مكانياً، مما يحصر تغييرات التدفق بدقة في المنطقة المستهدفة: zedit←zedit+γΔtSedit⊙Δvt.
توجيه الحفاظ على المسار (TPG):
يعمل أثناء توليد الميزات اللاحقة (الهندسة والنسيج).
يعالج مشكلة التسبب في انحراف الميزات غير المستهدفة عن حالة المصدر بسبب التكييف البصري العالمي.
بدلاً من الاستبدال القاسي للميزات المتوسطة (الذي يسبب عيوباً)، يفرض TPG قيداً ناعماً. يقوم بحساب فقدان الحفاظ (Lpres) عبر مقارنة الحالة النظيفة المتوقعة في المنطقة غير المستهدفة (Skeep) مع حالة المصدر المشفرة (xsrc).
يتم تصحيح الحالة القابلة للتحرير بنعومة عبر تدرج هذا الفقدان: zedit←zedit−λ(∇zeditLpres). هذا يحافظ على تماسك الحدود ويقلل من التدهور غير المقصود دون تعطيل مسار التوليد.
المساهمات الرئيسية
إطار عمل EditFlow3D: إطار عمل خالٍ من التدريب ومن الخصائص العكسية (inversion-free)، يقوم تلقائياً بتحويل مدخلات المستخدم إلى ضوابط بصرية ومكانية دقيقة للتحرير المحلي ثلاثي الأبعاد.
خوارزمية تحرير مبتكرة: خوارزمية تحرير التدفق ثلاثي الأبعاد المحلي التي تجمع بين التدفق التفاضلي الموجه بالقناع (للتعديل المستهدف) والحفاظ على المسار خطوة بخطوة (لاتساق المناطق غير المستهدفة). يقيد هذا النهج تحديثات التدفق في المنطقة المستهدبة بينما يثبط الانحراف في المناطق غير المستهدفة دون استبدال قاسي للميزات.
EditFlow-Bench: معيار جديد يضم 100 أصلاً مصدرياً و200 حالة تحرير عبر خمسة أنواع (إضافة، حذف، استبدال، تعديل هندسي، تعديل مظهر). هذا يكمل معيار Edit3D-Bench من خلال تغطية مجموعة أوسع من التغييرات الهيكلية والنسيجية.
النتائج
تم تقييم إطار العمل على كل من EditFlow-Bench و Edit3D-Bench العام باستخدام نماذج TRELLIS و TRELLIS.2 الأساسية.
الأداء الكمي: حقق EditFlow3D أفضل النتائج الإجمالية عبر جميع المقاييس (Similarity, CD, PSNR, SSIM, LPIPS, DINO-I, FID) في كلا المعيارين. أظهر توافقاً فائقاً في المنطقة المستهدفة مقارنة بالنماذج المرجعية مثل Nano3D و PartFlow و VoxHammer و Vinedresser3D، مع تفوق ملحوظ في الحفاظ على المناطق غير المستهدفة.
المقارنة النوعية: أظهرت النتائج البصرية أنه بينما تسببت النماذج المرجعية غالباً في تعتيم عالمي، أو تعديلات غير مكتملة، أو انقطاعات في الحدود، نجح EditFlow3D في حصر التغييرات محلياً مع الحفاظ على هندسة ومظهر المناطق غير المعدلة.
دراسات الاستئصال (Ablation Studies):
إزالة DFG قللت بشكل كبير من دقة التحرير (انخفضت Sim من 0.318 إلى 0.287).
إزالة TPG حافظت على دقة التحرير ولكنها أدت إلى تدهور شديد في مقاييس الحفاظ (PSNR, SSIM, LPIPS, FID)، مما يؤكد دورها في منع الانحراف في المناطق غير المستهدفة.
ثبت أن الاختيار التكيفي للرؤية وتحسين القناع ضروريان لكل من الدقة والحفاظ.
دراسة المستخدم: في دراسة شملت 40 مشاركاً، فُضل EditFlow3D على جميع النماذج المرجعية في 43% من الحالات من حيث توافق التعليمات، و57% من حيث الجودة البصرية، و49% من حيث الحفاظ على المصدر.
الأهمية
يزعم البحث أن EditFlow3D يعالج المقايضة الحرجة بين تعديل الهدف والحفاظ على المصدر في التحرير ثلاثي الأبعاد. من خلال تقديم توجيه الحفاظ على المسار (Trajectory Preservation Guidance)، يحل هذا الأسلوب مشكلة تدهور المناطق غير المستهدفة التي تستمر حتى عند استخدام الأقنعة المكانية، حيث يمكن للتكييف المستهدف أن يؤثر على عملية التوليد عالمياً. يثبت إطار العمل أنه يمكن تحقيق تحرير محلي دقيق دون الحاجة لتدريب نماذج جديدة أو عكس الأصول، بالاعتماد بدلاً من ذلك على فضاء التمثيل الأصلي للنماذج التوليدية المدربة مسبقاً مقترناً ببناء تحكم مؤتمت مدفوع بنماذج اللغة والرؤية (VLM). إن تقديم EditFlow-Bench يوفر معياراً ضرورياً لتقييم التعديلات الهيكلية والنسيجية المتنوعة، مما يسد فجوة في بروتوكولات التقييم الحالية.