← أحدث الأبحاث
💻 computer science

SlotDiT: Object-Centric Representations for Diffusion Transformers

تقدم هذه الورقة البحثية SlotDiT، وهو محول انتشار (Diffusion Transformer) موجه بالنص يستخدم تمثيلات كامنة قائمة على الفتحات (slots) متمحورة حول الكائنات لتحقيق جودة تنافسية في توليد الفيديو ومعدلات تحسين كبيرة في إتمام المهام في التطبيقات الروبوتية مقارنة بالنهج التقليدية القائمة على المشفر التلقائي المتغير (VAE).

المؤلفون الأصليون: Gjergj Plepi, Sven Behnke

نُشر 2026-09-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Gjergj Plepi, Sven Behnke

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لطالما عانت الروبوتات في فهم العالم، ليس فقط كضباب من البكسلات، بل كمجموعة من الأشياء المتميزة التي تتحرك وتتفاعل. لسنوات، اعتمدت أنظمة الذكاء الاصطناعي المصممة لتوليد الفيديو أو تخطيط أفعال الروبوت على طريقة تعامل مع كل صورة كشبكة ضخمة من النقاط الملونة. وبينما ينتج هذا النهج صوراً واقعية مذهلة، فإنه غالباً ما يفشل عندما يحتاج الروبوت إلى معرفة كيفية التقاط كوب أو تحريك كتلة عبر طاولة. المشكلة هي أن هذه الأنظمة ترى العالم بتفاصيل عالية الدقة ولكنها تفتقر إلى خريطة ذهنية واضحة للأشياء الفردية داخله. إنها تعرف كيف يبدو المشهد، لكنها تجد صعوبة في فهم ما يحدث بداخله. هذه الفجوة بين الرؤية والفهم حدت من قدرة الآلات على اتباع تعليمات بسيطة أو التخطيط لحركات معقدة في بيئات العالم الحقيقي.

اقترح فريق من الباحثين في جامعة بون طريقة مختلفة لرؤية الآلات. فبدلاً من إجبار الذكاء الاصطناعي على معالجة كل بكسل في الفيديو، علموه كيفية تفكيك المشهد إلى عدد صغير من الأجزاء المتميزة والقابلة للتحريك. يطلقون على هذه الأجزاء اسم "الفتحات" (slots). تخيل النظر إلى سطح مطبخ مزدحم والتعرف فوراً على كوب القهوة، والمحمصة، ووعاء الفاكهة ككيانات منفصلة، بدلاً من كونها فوضى عارمة من الأشكال والألوان. يستخدم هذا النظام الجديد، الذي أسماه الباحثون "SlotDiT"، هذا النهج المرتكز على الأشياء لتوجيه نموذج حاسوبي قوي لتوليد الفيديو. ومن خلال التركيز على الأشياء نفسها بدلاً من الضجيج في الخلفية، يمكن للنظام التنبؤ بكيفية تغير المشهد بمرور الوقت بدقة أكبر بكثير، خاصة عند إعطائه تعليمات نصية بسيطة مثل "حرك الكتلة الحمراء إلى الوعاء الأزرق".

بنى الباحثون نظامهم ليعمل في مرحلتين رئيسيتين. أولاً، يتعلم الكمبيوتر كيفية النظر إلى إطار فيديو وفصله إلى هذه "الفتحات" الكائنية الفردية؛ حيث يحدد الكيانات الموجودة في المشهد ويخصص لكل منها تمثيلاً رقمياً مدمجاً. وبمجرد تفكيك المشهد، يستخدم النظام تعليمات نصية لتوجيه التنبؤ بما سيحدث بعد ذلك. وبدلاً من محاولة تخمين لون كل بكسل في المستقبل، يتنبأ النموذج ببساطة بكيفية تحرك وتغير هذه الفتحات القليلة، ثم يقوم بتجميع هذه التنبؤات معاً لإنشاء فيديو للمستقبل. اختبر الفريق هذه الطريقة مقابل الأنظمة القديمة التي اعتمدت على النهج التقليدي الكثيف البكسلات. وأجروا تجارب على أربع مجموعات بيانات مختلفة، تتراوح من محاكاة حاسوبية بسيطة لألعاب الطاولة إلى لقطات واقعية معقدة لروبوتات تؤدي مهام منزلية.

أظهرت النتائج انقساماً واضحاً بين رؤية العالم بالتفصيل وفهمه هيكلياً. فالأنظمة القديمة، التي ركزت على الدقة البصرية العالية، أنتجت غالباً فيديوهات تبدو سلسة وواقعية للعين البشرية، ومع ذلك، عندما طُلب منها اتباع تعليمات محددة، كانت تفشل تكراراً. فقد تولد فيديو جميلاً لكتلة تنزلق، لكن الكتلة ستنتهي في المكان الخاطئ أو تفشل في التفاعل مع الكائن المستهدف كما هو مطلوب. في المقابل، نجح نظام SlotDiT الجديد، رغم أنه قد ينتج أحياناً فيديوهات أقل كمالاً من الناحية البصرية، في إنجاز المهمة الفعلية باستمرار. وفي مجموعة بيانات تسمى "CLIPort"، حيث يجب على الروبوت وضع كتلة محددة في وعاء محدد، حقق النظام الجديد معدل نجاح قدره 73.0 بالمائة، متفوقاً بمراحل على أفضل طريقة تالية، والتي لم تتجاوز 50 بالمائة. وحتى في السيناريوهات الأكثر تعقيداً في العالم الحقيقي المتعلقة بالأعمال المنزلية، حافظ النظام المرتكز على الأشياء على معدل نجاح أعلى من منافسيه المرتكزين على البكسلات.

بالإضافة إلى مجرد إنجاز العمل، أثبت النهج الجديد أنه أسرع وأكثر كفاءة بشكل ملحوظ. ولأن النظام لا يحتاج إلا لتتبع عدد قليل من "فتحات الأشياء" بدلاً من آلاف البكسلات، فإنه يتطلب طاقة حوسبة أقل بكثير لتوليد التنبؤات. وفي اختباراتهم، وجد الباحثون أن النظام الجديد يمكنه توليد التنبؤات بسرعة تزيد عن خمس مرات مقارنة بالنماذج القياسية عالية الدقة. هذه الميزة في السرعة حاسمة بالنسبة للروبوتات، حيث تحتاج الآلة إلى التفكير والاستجابة في الوقت الفعلي. وتشير الدراسة إلى أنه لكي تكون الروبوتات مفيدة حقاً، فهي لا تحتاج بالضرورة إلى رؤية العالم بدقة عالية جداً؛ بل تحتاج لرؤيته بطريقة تسلط الضوء على الأشياء ذات الأهمية. ومن خلال إعطاء الأولوية لهيكل المشهد على التفاصيل الدقيقة للصورة، أظهر الباحثون أن الآلات يمكن أن تصبح أفضل بكثير في اتباع التعليمات وتخطيط أفعالها الخاصة.

كما يسلط هذا العمل الضوء على حقيقة مدهشة حول الذكاء الاصطناعي: أن المظهر الأفضل لا يعني دائماً تفكيراً أفضل. فقد وجد الباحثون صراحةً أن الأنظمة التي أنتجت أكثر الفيديوهات إبهاراً بصرياً كانت غالباً هي الأسوأ في حل المهام. وهذا يشير إلى أن المعيار الحالي للحكم على توليد الفيديو — وهو مدى واقعيته — قد يكون مضللاً عندما يكون الهدف هو بناء آلات يمكنها التفاعل مع العالم المادي. وتخلص الدراسة إلى أن منح الروبوتات رؤية ترتكز على الأشياء للعالم هو وسيلة قوية لتحسين قدرتها على التخطيط والتحكم في حركاتها. ورغم أن النظام لا يزال يواجه بعض القيود، مثل الحاجة إلى عدد ثابت من الأشياء لتتبعها، إلا أن النتائج تقدم مساراً واعداً للمستقبل. إنها تشير إلى أن مستقبل الذكاء الروبوتي قد لا يكمن في جعل الآلات ترى أكثر، بل في مساعدتها على فهم ما تراه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →