إن Vinedresser3D هو إطار عمل وكيل يستفيد من نموذج لغوي كبير متعدد الوسائط ونموذج لتحرير الصور لتفكيك النصوص المعقدة وإجراء تحرير ثلاثي الأبعاد دقيق وخالٍ من الأقنعة مباشرة في الفضاء الكامن لنموذج توليد ثلاثي الأبعاد أصلي، مما يضمن توافقاً عالياً مع المطالبات مع الحفاظ على تماسك المناطق غير المحررة.
المؤلفون الأصليون:Yankuan Chi, Xiang Li, Zixuan Huang, James M. Rehg
تخيل أن لديك مجموعة "ليغو" رقمية سحرية. في الماضي، إذا أردت تحويل سيارة لعبة إلى قطار، كان عليك أن تكون بانيًا محترفًا؛ كان عليك تفكيك كل قطعة يدويًا، واستبدالها، والأمل في ألا ينهار النموذج بأكمله. كان الأمر بطيئًا، ويتطلب مهارات خاصة، وكان محبطًا وصعبًا للغاية.
Vinedresser3D يشبه توظيف بستاني آلي فائق الذكاء يمكنه إعادة تشكيل حديقتك الرقمية فورًا بناءً على جملة بسيطة تقولها.
أنت تتحدث: تقول: "حوّل تلك السيارة اللعبة إلى قطار".
العقل يفكر: بدلًا من مجرد تغيير البكسلات بشكل أعمى، ينظر الخادم إلى جسمك ثلاثي الأبعاد، ويفهم ماهية "السيارة" وماهية "القطار"، ويحدد بالضبط أي الأجزاء يجب أن تتغير. يدرك قائلًا: "حسناً، أحتاج لتغيير هيكل السيارة والعجلات، لكن يجب أن أبقي البطة الصغيرة الجالسة في الأعلى في مكانها تمامًا دون تغيير".
الخطة: يكتب وصفة مفصلة للتغيير، تصف جسم القطار والعجلات الجديدين، مع الوعد بترك البطة كما هي.
2. "العيون" (تحديد الموقع)
في الأيام الخوالي، كان عليك رسم دائرة حول الجزء الذي تريد تغييره (قناع/Mask). Vinedresser3D لا يحتاج منك القيام بذلك.
الرؤية السحرية: يستخدم الخادم نظارات خاصة (أداة تقسيم ثلاثية الأبعاد) لينظر إلى الجسم، ويكتشف تلقائيًا أين ينتهي "جسم السيارة" وأين تبدأ "البطة". إنه يرسم خطًا غير مرئي حول أجزاء السيارة ليعرف بالضبط ما الذي يجب لمسه وما الذي يجب تركه دون مساس.
3. "الأيدي" (التعديل)
الآن يأتي دور الخدعة السحرية الحقيقية. يستخدم النظام تقنية تسمى "التعديل القائم على الانعكاس" (Inversion-Based Editing).
التشبيه: تخيل أن لديك منحوتة مصنوعة من الطين. بدلًا من نحت أجزاء منها، يقوم النظام أولاً بتحويل المنحوتة بأكملها إلى سحابة من الغبار (ضجيج/Noise) لا تزال تحتفظ بـ ذاكرة الشكل الأصلي.
إعادة المزج: ثم يأخذ تلك السحابة من الغبار ويبدأ في إعادة بنائها. لكن الخدعة هنا هي أنه يعيد بناء الأجزاء الموجودة داخل "الخط غير المرئي" (السيارة) فقط. أما الأجزاء خارج الخط (البطة)، فيتم الحفاظ عليها في شكلها الأصلي.
التحقق المزدوج: لضمان أن يبدو القطار الجديد مثاليًا، يستخدم النظام خبيرين مختلفين: أحدهما بارع في قراءة الأوصاف النصية (لضبط الفكرة الصحيحة)، والآخر بارع في النظر إلى الصور (لضبط التفاصيل اللامعة). يتنقل النظام بينهما ذهابًا وإيابًا، مثل طباخ يتذوق الحساء ويعدل التوابل، حتى يبدو القطار مثاليًا.
لماذا يعد هذا أمرًا بالغ الأهمية؟
لا مزيد من الأخطاء "الشاملة": الطرق القديمة غالبًا ما كانت تغير الشيء بأكمله عندما كنت تريد تغيير العجلات فقط. Vinedrer3D يشبه الجراح؛ فهو يعمل فقط على البقعة المحددة التي طلبتها.
لا مزيد من الرسم: لست بحاجة لأن تكون فنانًا لترسم قناعًا حول الجسم. أنت فقط تتحدث إلى الذكاء الاصطناعي.
إنه يحافظ على الأشياء الجيدة: إذا كان لديك مشهد معقد يحتوي على عربة مليئة بالبطيخ، وطلبت "إضافة لوحة إعلانية"، فإن النظام سيضيف اللوحة ولكنه سيبقي البطيخ يبدو تمامًا كما هو. لن يحول البطيخ إلى صخور بالخطأ.
النتيجة
تظهر الورقة البحثية أن هذا النهج "الوكيل" (حيث يعمل الذكاء الاصطناعي كمساعد ذكي وليس مجرد أداة) ينتج تعديلات ثلاثية الأبعاد تتميز بـ:
الدقة: يفعل بالضبط ما طلبته.
النظافة: لا يفسد الأجزاء التي لم تطلب تغييرها.
الجودة العالية: تبدو الأجسام الجديدة وكأنها تنتمي إلى المشهد، وليست مجًا مجرد ملصق ضبابي موضوع فوقه.
باختصار، يحول Vinedresser3D المهمة التقنية الصعبة لتعديل النماذج ثلاثية الأبعاد إلى محادثة بسيطة، مما يجعل من الممكن لأي شخص إعادة تشكيل عالمه الرقمي بمجرد التحدث بما يدور في ذهنه.
إليك ملخص تقني مفصل لورقة البحث بعنوان "Vinedresser3D: Agentic Text-guided 3D Editing".
1. بيان المشكلة
يهدف التحرير ثلاثي الأبعاد الموجه بالنصوص (Text-guided 3D editing) إلى تعديل الأصول ثلاثية الأبعاد الموجودة باستخدام تعليمات باللغة الطبيعية. ورغم التقدم في التوليد ثلاثي الأبعاد، تواجه طرق التحرير الحالية ثلاثة تحديات حرجة:
التحديد التلقائي للموقع (Automatic Localization): عدم القدرة على تحديد مناطق التحرير ثلاثية الأبعاد بدقة من النص وحده، مما يتطلب غالباً أقنعة (masks) ثلاثية الأبعاد يدوية.
الحفاظ (Preservation): المعاناة في الحفاظ على المحتوى غير المعدل (الهندسة والمظهر) أثناء تطبيق التغييرات، مما يؤدي إلى تشوهات عالمية غير مقصودة أو فقدان للتفاصيل.
تندرج النهج الحالية عموماً ضمن فئتين ذات قيود:
أخذ عينات تشتت الدرجة (Score Distillation Sampling - SDS): مكلفة حاسوبياً لكل مشهد وتؤدي غالباً إلى تغييرات عالمية غير مقصودة.
التحرير ثنائي الأبعاد + إعادة البناء ثلاثي الأبعاد: تعاني من عدم الاتساق بين المشاهد المتعددة ونقص الإشراف ثلاثي الأبعاد، مما يفشل في الحفاظ على المناطق غير المرئية.
التحرير الأصلي ثلاثي الأبعاد (مثل VoxHammer): يعمل في الفضاء الكامن ثلاثي الأبعاد ولكنه لا يزال يعتمد على أقنعة ثلاثية الأبعاد يقدمها المستخدم ولا يمكنه التعامل مع طلبات التحرير المعقدة.
2. المنهجية: Vinedresser3D
يقترح المؤلفون Vinedresser3D، وهو إطار عمل وكيل (agentic framework) يعمل مباشرة في الفضاء الكامن لنموذج توليد ثلاثي الأبعاد أصلي (Trellis). يدمج النظام نموذج لغة كبير متعدد الوسائط (MLLM) مع أدوات ثلاثية الأبعاد متخصصة لإجراء تحرير عالي الجودة بدون أقنعة.
يتكون خط الإنتاج من أربع مراحل رئيسية:
أ. توليد التوجيه متعدد الوسائط (العقل المدبر)
المدخلات: أصل ثلاثي الأبعاد (يتم عرضه كصور متعددة الزوايا) وتعليمة نصية من المستخدم.
جوهر الـ MLLM: يستخدم Gemini-2.5-flash لتحليل التعليمات دلالياً.
المخرجات:
الوصف الأصلي: وصف تفصيلي للأصل المدخل.
تصنيف التحرير: تحديد نوع التحرير (إضافة، تعديل، حذف) والأجزاء المحددة المستهدفة.
الأوصاف الجديدة: توليد وصف كامل للأصل بعد التحرير وعزل أوصاف الأجزاء الجديدة.
التفكيك: تقسيم الأوصاف إلى المرحلة 1 (الهيكل/الهندسة) والمرحلة 2 (المظهر/النسيج) ليتماشى مع عملية توليد Trellis ذات المرحلتين.
التوجيه البصري: يختار الـ MLLM الزاوية المثلى للرؤية ويستخدم نموذج تحرير صور (Nano Banana) لتوليد صورة مرجعية عالية الدقة بناءً على النص المفكك.
ب. الكشف التلقائي عن منطقة التحرير
الهدف: إلغاء الحاجة إلى أقنعة ثلاثية الأبعاد يقدمها المستخدم.
العملية:
التقسيم (Segmentation): يستخدم PartField لتفكيك الأصل ثلاثي الأبعاد إلى أجزاء دلالية.
الاختيار: يحلل الـ MLLM الأجزاء المقسمة مقابل التعليمة النصية لاختيار الأجزاء المحددة للتحرير (Pedit) والأجزاء المراد الحفاظ عليها (Ppres).
رسم خرائط الفوكسل (Voxel Mapping): يحول الأجزاء الدلالية إلى أقنعة فوكسل (Redit).
للإضافة/الحذف: المنطق مباشر (خارج الأصل أو داخله).
للتعديل: يستخدم نهج أقرب جار (KNN)؛ حيث يحسب نسبة الفوكسلات المجاورة التي تنتمي إلى منطقة التحرير. إذا تجاوزت هذه النسبة عتبة معينة τ، يتم تحديد الفوكسل كقابل للتحرير. هذا يمنع "النزيف" إلى الهندسة المراد الحفاظ عليها.
ج. التحرير القائم على الانعكاس (المحرك)
النموذج الأساسي: يستخدم Trellis، وهو نموذج توليد ثلاثي الأبعاد أصلي قائم على التدفق (flow-based) يستخدم تمثيلات الهيكل الكامن (SLAT).
الانعكاس (Inversion): يستخدم RF-Solver (طريقة تقريب تايلور من الدرجة الثانية) لعكس الأصل ثلاثي الأبعاد إلى ضوضاء مهيكلة في الفضاء الكامن، مشروطة بوصف الأصل.
الترميم المتداخل (Interleaved Inpainting):
بدلاً من استخدام الشروط النصية فقط أو الصور فقط، يقوم الوكيل بعملية إزالة ضجيج متداخلة.
يتناوب بين Trellis-text (للمحاذاة الدلالية والالتزام بالتعليمة) و Trellis-image (للتفاصيل البصرية عالية الدقة) في كل خطوة زمنية.
الترميم الموجه بالقناع: خلال عملية إزالة الضجيج، يتم استبدال الفوكسلات خارج منطقة التحرير (Redit) بميزات من مسار الانعكاس الأصلي لضمان الحفاظ على المحتوى.
القناع الناعم (Soft Masking): بالنسبة للفوكسلات القريبة من حدود المناطق المحفوظة، يتم حساب الميزات كمتوسط مرجح للقضاء على الآثار العائمة (artifacts).
3. المساهمات الرئيسية
إطار عمل وكيل (Agentic Framework): يقدم أول وكيل تحرير ثلاثي الأبعاد يستخدم MLLM لتنسيق فهم النصوص، وكشف المناطق، واستدعاء الأدوات دون أقنعة يدوية.
تكامل الـ MLLM: يثبت أن نماذج MLLM (المدربة أساساً على بيانات ثنائية الأبعاد) يمكنها بفعالية تخطيط استراتيجيات التحرير ثلاثي الأبعاد، وتوليد توجيه متعدد الوسائط، والتفاعل مع أدوات التجزئة والتوليد ثلاثية الأبعاد.
دقة خالية من الأقنعة: يطور مساراً مبتكراً للكشف التلقائي عن مناطق التحرير باستخدام التجزئة ثلاثية الأبعاد والاستدلال المكاني، مما يزيل عقبة إنشاء الأقنعة يدوياً.
التحرير المتداخل: يقترح وحدة أخذ عينات متداخلة تجمع بين التوجيه النصي والصوري للتغلب على قيود التحرير أحادي النمط (النص يفتقر للتفاصيل؛ والصورة تفتقر لمعالجة الاحتجاب/Occlusion).
4. النتائج التجريبية
تم تقييم الطريقة على مجموعة بيانات متنوعة من الأصول ثلاثية الأبعاد (أجسام ومشاهد) مقابل النماذج المرجعية: Trellis (مع أقنعة)، VoxHammer، و Instant3dit.
المقاييس الكمية:
المحاذاة النصية: حقق أعلى درجة CLIP-T (0.252)، متفوقاً على جميع النماذج المرجعية.
الحفاظ (Preservation): رغم أنه أقل قليلاً من Trellis (باستخدام أقنعة بشرية) في مقاييس الحفاظ (PSNR, SSIM)، إلا أنه يتفوق بشكل كبير على الطرق الأخرى الخالية من الأقنعة أو شبه التلقائية.
الجودة: حقق أفضل درجات FID (29.49)، مما يشير إلى جودة ثلاثية أبعاد عامة متفوقة.
دراسة التفضيل البشري:
فضل المستخدمون Vinedresser3D على Trellis و Voxhammer بنسبة 92.5% و 89.8% على التوالي، عبر معايير المحاذاة النصية، والحفاظ، والجودة العامة.
دراسات الاستئصال (Ablation Studies):
إزالة تصميم التداخل (Interleaved) (باستخدام Trellis-image فقط) أدى إلى مخرجات مشوهة ودرجات FID أقل.
إزالة قناع منطقة التحرير أدى إلى تغيير الأجزاء المحفوظة وتشويه الهندسة، مما يؤكد ضرورة وحدة الكشف.
5. الأهمية والعمل المستقبلي
الأهمية: يردم Vinedresser3D الفجوة بين التعليمات اللغوية عالية المستوى والتحكم الدقيق ثلاثي الأبعاد. إنه ينقل المجال من سير العمل "المعتمد على التحسين" أو "المعتمد على الأقنعة" إلى نموذج وكيل، مؤتمت، وعالي الدقة. كما يثبت أن نماذج MLLM المدربة على بيانات 2D يمكن دمجها بنجاح في المسارات ثلاثية الأبعاد لحل مهام الاستدلال المكاني المعقدة.
القيود: لا يقبل الـ MLLM الحالي مدخلات ثلاثية الأبعاد أصلية (يعتمد على المشاهد المعروضة)، كما يعتمد الأداء على جودة الأدوات الخارجية مثل PartField للتقسيم.
الاتجاه المستقبلي: يقترح المؤلفون أن تمكين نماذج MLLM من استهلاك المدخلات ثلاثية الأبعاد مباشرة وتحسين نماذج التجزئة ثلاثية الأبعاد سيعزز قدرات النظام بشكل أكبر.
في الختام، يمثل Vinedresser3D خطوة هامة نحو دمقرطة إنشاء المحتوى ثلاثي الأبعاد، مما يسمح لغير الخبراء بإجراء تعديلات دقيقة ومعقدة على الأصول ثلاثية الأبعاد باستخدام تعليمات نصية بسيطة.