SlotDiT: Object-Centric Representations for Diffusion Transformers
تقدم هذه الورقة البحثية SlotDiT، وهو محول انتشار (Diffusion Transformer) موجه بالنص يستخدم تمثيلات كامنة قائمة على الفتحات (slots) متمحورة حول الكائنات لتحقيق جودة تنافسية في توليد الفيديو ومعدلات تحسين كبيرة في إتمام المهام في التطبيقات الروبوتية مقارنة بالنهج التقليدية القائمة على المشفر التلقائي المتغير (VAE).
لطالما عانت الروبوتات في فهم العالم، ليس فقط كضباب من البكسلات، بل كمجموعة من الأشياء المتميزة التي تتحرك وتتفاعل. لسنوات، اعتمدت أنظمة الذكاء الاصطناعي المصممة لتوليد الفيديو أو تخطيط أفعال الروبوت على طريقة تعامل مع كل صورة كشبكة ضخمة من النقاط الملونة. وبينما ينتج هذا النهج صوراً واقعية مذهلة، فإنه غالباً ما يفشل عندما يحتاج الروبوت إلى معرفة كيفية التقاط كوب أو تحريك كتلة عبر طاولة. المشكلة هي أن هذه الأنظمة ترى العالم بتفاصيل عالية الدقة ولكنها تفتقر إلى خريطة ذهنية واضحة للأشياء الفردية داخله. إنها تعرف كيف يبدو المشهد، لكنها تجد صعوبة في فهم ما يحدث بداخله. هذه الفجوة بين الرؤية والفهم حدت من قدرة الآلات على اتباع تعليمات بسيطة أو التخطيط لحركات معقدة في بيئات العالم الحقيقي.
اقترح فريق من الباحثين في جامعة بون طريقة مختلفة لرؤية الآلات. فبدلاً من إجبار الذكاء الاصطناعي على معالجة كل بكسل في الفيديو، علموه كيفية تفكيك المشهد إلى عدد صغير من الأجزاء المتميزة والقابلة للتحريك. يطلقون على هذه الأجزاء اسم "الفتحات" (slots). تخيل النظر إلى سطح مطبخ مزدحم والتعرف فوراً على كوب القهوة، والمحمصة، ووعاء الفاكهة ككيانات منفصلة، بدلاً من كونها فوضى عارمة من الأشكال والألوان. يستخدم هذا النظام الجديد، الذي أسماه الباحثون "SlotDiT"، هذا النهج المرتكز على الأشياء لتوجيه نموذج حاسوبي قوي لتوليد الفيديو. ومن خلال التركيز على الأشياء نفسها بدلاً من الضجيج في الخلفية، يمكن للنظام التنبؤ بكيفية تغير المشهد بمرور الوقت بدقة أكبر بكثير، خاصة عند إعطائه تعليمات نصية بسيطة مثل "حرك الكتلة الحمراء إلى الوعاء الأزرق".
بنى الباحثون نظامهم ليعمل في مرحلتين رئيسيتين. أولاً، يتعلم الكمبيوتر كيفية النظر إلى إطار فيديو وفصله إلى هذه "الفتحات" الكائنية الفردية؛ حيث يحدد الكيانات الموجودة في المشهد ويخصص لكل منها تمثيلاً رقمياً مدمجاً. وبمجرد تفكيك المشهد، يستخدم النظام تعليمات نصية لتوجيه التنبؤ بما سيحدث بعد ذلك. وبدلاً من محاولة تخمين لون كل بكسل في المستقبل، يتنبأ النموذج ببساطة بكيفية تحرك وتغير هذه الفتحات القليلة، ثم يقوم بتجميع هذه التنبؤات معاً لإنشاء فيديو للمستقبل. اختبر الفريق هذه الطريقة مقابل الأنظمة القديمة التي اعتمدت على النهج التقليدي الكثيف البكسلات. وأجروا تجارب على أربع مجموعات بيانات مختلفة، تتراوح من محاكاة حاسوبية بسيطة لألعاب الطاولة إلى لقطات واقعية معقدة لروبوتات تؤدي مهام منزلية.
أظهرت النتائج انقساماً واضحاً بين رؤية العالم بالتفصيل وفهمه هيكلياً. فالأنظمة القديمة، التي ركزت على الدقة البصرية العالية، أنتجت غالباً فيديوهات تبدو سلسة وواقعية للعين البشرية، ومع ذلك، عندما طُلب منها اتباع تعليمات محددة، كانت تفشل تكراراً. فقد تولد فيديو جميلاً لكتلة تنزلق، لكن الكتلة ستنتهي في المكان الخاطئ أو تفشل في التفاعل مع الكائن المستهدف كما هو مطلوب. في المقابل، نجح نظام SlotDiT الجديد، رغم أنه قد ينتج أحياناً فيديوهات أقل كمالاً من الناحية البصرية، في إنجاز المهمة الفعلية باستمرار. وفي مجموعة بيانات تسمى "CLIPort"، حيث يجب على الروبوت وضع كتلة محددة في وعاء محدد، حقق النظام الجديد معدل نجاح قدره 73.0 بالمائة، متفوقاً بمراحل على أفضل طريقة تالية، والتي لم تتجاوز 50 بالمائة. وحتى في السيناريوهات الأكثر تعقيداً في العالم الحقيقي المتعلقة بالأعمال المنزلية، حافظ النظام المرتكز على الأشياء على معدل نجاح أعلى من منافسيه المرتكزين على البكسلات.
بالإضافة إلى مجرد إنجاز العمل، أثبت النهج الجديد أنه أسرع وأكثر كفاءة بشكل ملحوظ. ولأن النظام لا يحتاج إلا لتتبع عدد قليل من "فتحات الأشياء" بدلاً من آلاف البكسلات، فإنه يتطلب طاقة حوسبة أقل بكثير لتوليد التنبؤات. وفي اختباراتهم، وجد الباحثون أن النظام الجديد يمكنه توليد التنبؤات بسرعة تزيد عن خمس مرات مقارنة بالنماذج القياسية عالية الدقة. هذه الميزة في السرعة حاسمة بالنسبة للروبوتات، حيث تحتاج الآلة إلى التفكير والاستجابة في الوقت الفعلي. وتشير الدراسة إلى أنه لكي تكون الروبوتات مفيدة حقاً، فهي لا تحتاج بالضرورة إلى رؤية العالم بدقة عالية جداً؛ بل تحتاج لرؤيته بطريقة تسلط الضوء على الأشياء ذات الأهمية. ومن خلال إعطاء الأولوية لهيكل المشهد على التفاصيل الدقيقة للصورة، أظهر الباحثون أن الآلات يمكن أن تصبح أفضل بكثير في اتباع التعليمات وتخطيط أفعالها الخاصة.
كما يسلط هذا العمل الضوء على حقيقة مدهشة حول الذكاء الاصطناعي: أن المظهر الأفضل لا يعني دائماً تفكيراً أفضل. فقد وجد الباحثون صراحةً أن الأنظمة التي أنتجت أكثر الفيديوهات إبهاراً بصرياً كانت غالباً هي الأسوأ في حل المهام. وهذا يشير إلى أن المعيار الحالي للحكم على توليد الفيديو — وهو مدى واقعيته — قد يكون مضللاً عندما يكون الهدف هو بناء آلات يمكنها التفاعل مع العالم المادي. وتخلص الدراسة إلى أن منح الروبوتات رؤية ترتكز على الأشياء للعالم هو وسيلة قوية لتحسين قدرتها على التخطيط والتحكم في حركاتها. ورغم أن النظام لا يزال يواجه بعض القيود، مثل الحاجة إلى عدد ثابت من الأشياء لتتبعها، إلا أن النتائج تقدم مساراً واعداً للمستقبل. إنها تشير إلى أن مستقبل الذكاء الروبوتي قد لا يكمن في جعل الآلات ترى أكثر، بل في مساعدتها على فهم ما تراه.
حققت نماذج الانتشار الكامنة المشروطة بالنصوص نجاحاً كبيراً في توليد الفيديو، وتظهر وعوداً في تطبيقات الروبوتات مثل التخطيط، وتعلم السياسات، ونمذجة العالم. ومع ذلك، تعتمد النهج الحالية بشكل أساسي على التمثيلات على مستوى البكسل أو تمثيلات المشفّر التلقائي المتغير (VAE) في الفضاء الكامن. هذه التمثيلات يتم تعلمها عادةً باستخدام أهداف قائمة على إعادة البناء (مثل Stable Diffusion VAE)، مما يعطي الأولوية للدقة البصرية العالية على حساب الهيكل الدلالي الصريح. وبناءً على ذلك، غالباً ما يفتقر الفضاء الكامن إلى التفكيك الهيكلي على مستوى الأشياء الضروري للمهام اللاحقة في الروبوتات، حيث تهم إتمام المهام والتخطيط أكثر من إعادة البناء المثالية للبكسلات. وبينما أثبتت التمثيلات المركزية على الأشياء فائدتها في نمذجة الديناميكيات والتحكم، فإن دمجها كفضاءات كامنة للنمذجة التوليدية القائمة على الانتشار لا يزال غير مستكشف.
المنهجية
يقترح المؤلفون SlotDiT، وهو محول انتشار (DiT) موجه بالنص يعمل ضمن فضاء كامن مدمج ومبني على "الفتحات" (slots) المركزية على الأشياء. يتكون الإطار من مرحلتين رئيسيتين:
1. تعلم التمثيلات القائمة على الفتحات (Slots)
تتضمن المرحلة الأولى تعلم تفكيك للمشهد مركزي على الأشياء.
المشفّر (Encoder): يستخرج محول رؤية (ViT) مجمد من نوع DINOv2 الميزات البصرية من الإطارات المدخلة.
انتباه الفتحات (Slot Attention): تقوم وحدة "انتباه الفتحات" بتنقية مجموعة من المتجهات الكامنة (الفتحات) بشكل تكراري من خلال الانتباه إلى الميزات البصرية. هذا يفرض تنافساً بين الفتحات لتمثيل كيانات مشهد متميزة.
المفكك (Decoder): يقوم مفكك مكون من مرحلتين (مفكك بث يعتمد على MLP يليه مفكك صور يعتمد على CNN) بإعادة بناء المشهد من الفتحات، مع التحسين لكل من خسائر إعادة بناء الميزات والصور.
المخرجات: يتم تمثيل كل إطار كمجموعة من NS من الفتحات المركزية على الأشياء، حيث تمثل كل فتحة كياناً معيناً في المشهد.
2. محول الانتشار المعتمد على الفتحات والمشروط بالنص
تدرب المرحلة الثانية النموذج التوليدي داخل الفضاء الكامن الذي تم تعلمه.
البنية: يستخدم SlotDiT بنية محول انتشار (DiT) تتكون من كتل متطابقة تحتوي على انتباه ذاتي ثنائي الاتجاه، وانتباه متقاطع (cross-attention) بين النص والفتحات، وMLPs.
التكييف (Conditioning): يتم تكييف النموذج بناءً على تعليمات لغوية (يتم تشفيرها عبر مشفر T5) وسياق المشهد الملحوظ (مجموعة الفتحات الأولية).
عملية التوليد: بالنظر إلى صورة مرجعية وتعليمات، يقوم النموذج بإزالة الضجيج بشكل تكراري (autoregressively) لمسارات الفتحات المستقبلية. يعمل النموذج على نافذة زمنية ثابتة الطول، حيث يستقبل سياق الفتحات وتضمينات النص، بينما يحقن ضجيج غاوسي في الإطارات المستقبلية.
التدريب: يتبع النموذج إطار عمل Diffusion Forcing Transformer (DFoT)، مستخدماً نموذج "الضجيج كقناع" (noise-as-masking)، حيث يتم تلويث كل إطار بمستوى مستقل من الضجيج. الهدف هو التنبؤ بالسرعة (v-prediction) لعملية إزالة الضجيج.
الاستدلال: تتم عملية التوليد بشكل تكراري باستخدام عينة DDIM. يتم استخدام التوجيه الخالي من التصنيف (Classifier-free guidance) لتحسين جودة العينات واتباع التعليمات من خلال الجمع بين التنبؤات الشرطية وغير الشرطية.
المساهمات الرئيسية
نموذج SlotDiT: تقديم محول انتشار موجه بالنص يعمل في فضاء كامن مركزي على الأشياء، مما يسمح بالنمذجة التوليدية الهيكلية للبيئات الروبوتية.
دراسة مقارنة منضبطة: إجراء تحقيق منهجي يقارن التمثيلات القائمة على الفتحات مقابل التمثيلات القائمة على VAE (مثل SD-VAE, ImageVAE, VA-VAE, VideoVAE) والتمثيلات المحاذية دلالياً (المبنية على DINOv2) ضمن إطار عمل DiT موحد. هذا يعزل تأثير تصميم الفضاء الكامن مع الحفاظ على ثبات البنية وإجراءات التدريب.
التحقق التجريبي: إثبات أن الهيكل المركزي على الأشياء يعمل كتحيز استقرائي قوي، مما يؤدي إلى جودة توليد فيديو تنافسية مع تحسين معدلات نجاح المهام بشكل كبير في توليد الفيديو الموجه بالنص ومهام التحكم الروبوتي.
النتائج
قيم المؤلفون SlotDiT على أربع مجموعات بيانات روبوتية (LanguageTable-Synthetic, CLIPort, LanguageTable-Real, و Bridgev2) تغطي بيئات محاكية وواقعية.
نجاح المهمة مقابل الدقة البصرية: من النتائج الحاسمة هي الفصل بين مقاييس الجودة البصرية ونجاح المهمة. بينما حققت النماذج المرجعية القائمة على VAE درجات إدراكية أعلى (LPIPS, FVD, JEDi)، إلا أنها فشلت تكراراً في اتباع التعليمات أو إتمام المهام. على سبيل المثال، في CLIPort، حقق DiT + VideoVAE أعلى دقة بصرية بين نماذج VAE، لكنه حقق معدل نجاح مهمة قدره 57.1% فقط، بينما حقق SlotDiT نسبة 87.8%. وبالمثل، في LanguageTable-Synthetic، تفوق DiT + VideoVAE على SlotDiT في المقاييس البصرية ولكنه حقق معدل نجاح مهمة أقل بكثير (55.8% مقابل 79.7%).
التحكم الروبوتي: في تقييمات التحكم الروبوتي بالحلقة المغلقة والمفتوحة، تفوق SlotDiT على جميع النماذج المرجعية، بما في ذلك المتنبئات التحويلية المركزية على الأشياء (TextOCVP) ونماذج DiT القائمة على VAE. في LanguageTable-Synthetic، كاد SlotDiT أن يطابق أداء النموذج المثالي (oracle) الذي يستخدم الفتحات المستقبلية الحقيقية، مما يشير إلى أن المسارات المولدة تحافظ على المعلومات الأساسية المتعلقة بالمهمة.
الكفاءة: أدت الطبيعة المدمجة لتمثيل الفتحات (على سبيل المثال، 10 فتحات لكل إطار مقابل 256 رمزاً للنماذج القائمة على VAE) إلى كفاءة حوسبية كبيرة. حقق SlotDiT تسريعاً بمقدار 5.68 ضعفاً في إنتاجية الاستدلال مقارنة بنموذج DiT + SD-VAE، ويرجع ذلك أساساً إلى تقليل عدد الرموز (tokens) أثناء مرحلة أخذ عينات الانتشار.
المتانة والقابلية للتحكم: أظهر SlotDiT متانة تجاه تكوينات المشهد خارج التوزيع (مثل زيادة عدد الأشياء) وقوالب التعليمات غير المرئية. كما أظهر قدرة قوية على التحكم، حيث نجح في تكييف المسارات المولدة مع التعليمات النصية المعدلة مع الحفاظ على اتساق المشهد.
الأهمية والادعاءات
يزعم البحث أن الهيكل المركزي على الأشياء هو تحيز استقرائي قوي للنمذجة التوليدية القائمة على الانتشار في البيئات الروبوتية.
يجادل المؤلفون بأنه بينما تعد إعادة البناء البصري عالي الدقة قيمة لتوليد الفيديو العام، إلا أنها ليست المتطلب الأساسي للتخطيط والتحكم الروبوتي. بدلاً من ذلك، فإن الفضاء الكامن الذي يفكك المشاهد صراحةً إلى كيانات دلالية (فتحات) يوفر تمثيلاً أكثر كفاءة وفعالية لنمذجة الديناميكيات المتعلقة بالمهمة. تشير النتائج إلى أن مقاييس توليد الفيديو القياسية لا تستطيع التقاط فائدة الفضاء الكامن للمهام الروبوتية اللاحقة بشكل كامل. ومن خلال إعطاء الأولوية للدلالات الهيكلية على مستوى الأشياء بدلاً من دقة البكسل، يسد SlotDiT الفجوة بين النمذجة التوليدية والتطبيق الروبوتي العملي، مما يوفر بديلاً فعالاً حوسبياً يحسن كلاً من دقة التخطيط ومعدلات إتمام المهام.