DynEoMT: Learning Object Dynamicity from Online Segmentation Queries
يُعد DynEoMT إطار عمل عبر الإنترنت يعمل على تعزيز تقسيم الفيديو القائم على الاستعلام للتنبؤ بديناميكية الأجسام على مستوى المنطقة (متحرك مقابل ثابت) دون الحاجة إلى التدفق البصري أو العمق أو وضعية الكاميرا، محققاً أداءً قوياً من خلال مسار إشراف غير متصل بالإنترنت مبتكر تم تدريبه على التدفق البصري المعوض لحركة الكاميرا.
المؤلفون الأصليون:Calvin Galagain, Martyna Poreba, François Goulette
في عالم الرؤية الحاسوبية، أصبحت الآلات بارعة بشكل ملحوظ في التعرف على ما يوجد في الصورة. يمكنها تحديد سيارة، أو شخص، أو شجرة، ورسم مخطط دقيق حولها. ولكن هناك فرق دقيق بين رؤية جسم ما وفهم كيفية حركته. فعندما تتحرك الكاميرا عبر مشهد ما، يبدو أن كل شيء في مجال الرؤية ينزاح. قد تبدو سيارة مركونة وكأنها تنزلق عبر الشاشة ببساطة لأن الكاميرا تدور، بينما يتحرك أحد المشاة لسببه الخاص. ولكي تفهم الآلة المشهد حقاً، يجب أن تميز بين الأجسام التي تتحرك من تلقاء نفسها والأجسام التي تبدو وكأنها تتحرك فقط بسبب حركة الكاميرا. هذه القدرة على التمييز بينهما أمر بالغ الأهمية للروبوتات التي تحتاج إلى التنقل في العالم أو للأنظمة التي تبني خرائط لمحيطها. فإذا أخطأ الروبوت في اعتبار مبنى ثابت عائقاً متحركاً، أو تجاهل سيارة حقيقية متحركة لأنه اعتقد أن المبنى هو الذي يتحرك، فإن فهمه للعالم ينهار.
لقد علم الباحثون الحواسيب لفترة طويلة كيفية تتبع الأجسام بمرور الوقت، مع الحفاظ على تسمية متسقة لسيارة أو شخص معين أثناء تحركه عبر الفيديو. ومع ذلك، فإن هذه الأنظمة عادة ما تتوقف عند تحديد الجسم وموقعه؛ فهي لا توضح صراحةً ما إذا كان هذا الجسم يتحرك بشكل مستقل أم أنه مجرد جزء ثابت من الخلفية. تقدم دراسة جديدة طريقة تسمى DynEoMT، والتي تضيف هذه الطبقة المفقودة من الفهم. يتعلم النظام النظر إلى إطارات الفيديو والبيانات التي جمعها بالفعل عن الأجسام، ثم يقرر لكل منطقة متتبعة ما إذا كانت ديناميكية أم ثابتة. والإنجاز الرئيسي هنا هو أن النظام يفعل ذلك دون الحاجة إلى حساب أنماط حركة معقدة، أو قياس العمق، أو معرفة الموقع الفيزيائي للكاميرا. فهو يتعلم استنتاج حالة الحركة مباشرة من الطريقة التي يتتبع بها الجسم نفسه.
لتعليم الحاسوب هذه المهارة، كان على الباحثين أولاً إنشاء طريقة لتسمية البيانات، بما أن مجموعات بيانات الفيديو الموجودة لا تتضمن هذه المعلومة المحددة. لقد بنوا عملية "أوفلاين" (غير متصلة بالإنترنت) تعمل كمعلم. تنظر هذه العملية إلى أزواج من إطارات الفيديو وتحسب كيفية تحرك البكسلات بينها. ثم تقدر مقدار تلك الحركة الناتج عن الكاميرا نفسها وتقوم بطرحه. وما يتبقى هو الحركة "المتبقية"، والتي تمثل الحركة الفعلية للأجسام في العالم. إذا أظهرت منطقة ما حركة كبيرة بعد إزالة حركة الكاميرا، يتم تصنيفها على أنها ديناميكية. وإذا أظهرت حركة ضئيلة أو معدومة، يتم تصنيفها على أنها ثابتة. طبق الباحثون هذا المنطق على أربع مجموعات رئيسية من بيانات الفيديو، تغطي كل شيء بدءاً من التجزئة الدلالية (semantic segmentation)، حيث يتم إعطاء كل بكسل فئة معينة، وصولاً إلى التجزئة الجزئية (instance segmentation)، حيث يتم تتبع الأجسام الفردية بشكل منفصل. وقد خلق هذا مجموعة ضخمة من الأمثلة التدريبية حيث تأتي كل قناع للجسم (object mask) مصحوبة بتسمية تشير إلى ما إذا كان متحركاً أم ساكناً.
ومع بيانات التدريب الجديدة هذه، قام الباحثون بتعديل نموذج تجزئة فيديو موجود. لقد أضافوا مكوناً صغيراً وخفيف الوزن لاتخاذ القرار، أو "رأساً" (head) للنظام. ينظر هذا المكون إلى التمثيل الداخلي لكل جسم يتتبعه النموذج ويتنبأ بما إذا كان متحركاً أم ثابتاً. ومن الأهمية بمكان أن هذا التنبؤ يحدث في الوقت الفعلي أثناء تشغيل الفيديو. يستخدم النظام الصورة الحالية فقط والمعلومات التي نقلها من الإطار السابق. فهو لا ينظر إلى الصور القديمة، ولا يحسب التدفق البصري (optical flow)، ولا يتطلب أي مستشعرات إضافية. يتعلم النموذج القيام بهذا التنبؤ جنباً إلى جنب مع وظيفته الأساسية المتمثلة في رسم الخطوط حول الأجسام، مما يضمن أن المهمة الجديدة لا تتعارض مع قدرته على الرؤية والتتبع.
تظهر النتائج أن هذا النهج يعمل بفعالية عبر أنواع مختلفة من بيانات الفيديو. ففي مجموعة بيانات كبيرة من التجزئة البانوبتيكية للفيديو (video panoptic segmentation)، حدد النظام حالة حركة الأجسام بدقة بلغت 84.3 بالمائة. وفي مجموعات بيانات أخرى تركز على تتبع الحالات الفردية، تراوحت الدقة بين 68.0 و87.6 بالمائة. ولعل الأمر الأكثر أهمية هو أن إضافة هذه القدرة الجديدة لم تضعف أداء النظام الأصلي. فقد ظلت القدرة على رسم الأقنعة بدقة وتتبع هويات الأجسام كما هي تقريباً قبل التعديل. وجد الباحثون أن الإشارات الداخلية التي يستخدمها النموذج لتتبع الأجسام تحتوي بالفعل على معلومات كافية لتحديد ما إذا كانت تلك الأجسام تتحرك. فبمجرد إضافة طبقة صغيرة لتفسير تلك الإشارات، اكتسب النظام فهماً جديداً للعالم دون الحاجة إلى خط معالجة حركة منفصل ومعقد.
يبرهن هذا العمل على أن التمييز بين جسم متحرك وآخر ثابت يمكن تعلمه مباشرة من الطريقة التي يتتبع بها النموذج الأجسام بمرور الوقت. ويشير ذلك إلى أن الأنظمة المستقبلية المصممة للروبوتات أو الملاحة الذاتية يمكن أن تكتسب فهماً أكثر قوة لبيئتها دون التكلفة الحسابية الثقيلة لأدوات تحليل الحركة المخصصة. يعتمد الأسلوب على مبدأ بسيط: إذا كنت تستطيع تتبع جسم ما، فمن المرجح أنك تستطيع معرفة ما إذا كان يتحرك من تلقاء نفسه. لقد أتاح الباحثون الكود الخاص بهم للجمهور، مما يسمح للآخرين بإعادة إنتاج هذه النتائج والبناء على نظام لا يرى فقط ما هو موجود، بل كيف يتصرف أيضاً.
ملخص تقني: DynEoMT
بيان المشكلة
تتفوق نماذج تقسيم الفيديو الحالية في التعرف على الأجسام وتتبعها عبر الزمن، لكنها تفتقر إلى القدرة على التمييز بين الأجسام التي تتحرك بشكل مستقل عن الكاميرا وتلك الثابتة بالنسبة للعالم والتي تظهر وكأنها تتحرك بسبب حركة الكاميرا الذاتية (ego-motion). هذا التمييز، المسمى ديناميكية منطقة التقسيم (segmentation-region dynamicity)، يعد أمراً حاسماً لتطبيقات مثل الروبوتات ورسم الخرائط والتخطيط، حيث يمكن أن يؤدي الخلط بين الفئات الدلالية وحالات الحركة إلى تحديثات خاطئة للخرائط أو التخلص من الهندسة الثابتة.
لا توفر المعايكات الحالية (مثل VIPSeg، OVIS، YouTube-VIS، VSPW) المحتوى الدلالي، والمدى المكاني، والهوية الزمنية، ولكنها لا توفر أيضاً تسميات لما إذا كانت المنطقة المقسمة ديناميكية أم ثابتة. علاوة على ذلك، تعتمد معظم طرق تقسيم الأجسام المتحركة (MOS) عادةً على خطوط معالجة مخصصة للحركة (التدفق البصري، العمق، وضعية الكاميرا) أو تنتج مناطق متمحورة حول الحركة بدلاً من تعيين حالات الحركة لمخرجات التقسيم الدلالي أو المثالي أو الشامل (panoptic) القياسية. يكمن التحدي الجوهري في تحديد ما إذا كانت التمثيلات الموجزة للأجسام (الاستعلامات/queries) التي تتعلمها نماذج التقسيم القائمة على الاستعلام الحديثة تشفر بطبيعتها معلومات زمنية كافية للتنبؤ بالديناميكية دون مدخلات حركة صريحة.
المنهجية
1. توليد الإشراف الديناميكي غير المتصل (Offline)
بما أنه لا توجد حقيقة أرضية (ground truth) لديناميكية منطقة التقسيم، يقترح المؤلفون خط أنابيب إشراف غير متصل لتعميم الفئات (class-agnostic) لتوليد تسميات مستعارة:
التدفق ثنائي الاتجاه: يتم تقدير التدفق البصري ثنائي الاتجاه بين الإطارات المتتالية باستخدام MemFlow.
تصفية الموثوقية: تقوم فحوصات الاتساق الأمامي-الخلفي بتصفية الارتباطات غير الموثوقة الناتجة عن حالات الحجب (occlusions) أو التدفق غير المستقر.
تعويض الكاميرا: يتم ملاءمة نموذج تدفق ناتج عن الكاميرا (الاختيار من بين نماذج الترجمة، أو التآلف، أو التماثل، أو التربيع) للبيكسلات الموثوقة خارج المناطق الموسومة. يتم طرح تدفق الكاميرا المقدر هذا من التدفق الملاحظ لعزل الحركة المتبقية.
تجميع الأدلة: داخل كل قناع موسوم، يتم حساب إحصائيات الحركة المتبقية (المقدار، التماسك، وجزء البيكسلات التي تتجاوز عتبة معينة) لتوليد درجة دليل الحركة.
تسمية ثلاثية الحالات: تقوم عملية تصفية زمنية مدركة للثقة بتعيين حالة واحدة من ثلاث حالات لكل تتبع للقناع: ديناميكي (Dynamic)، ثابت (Static)، أو غير مؤكد (Uncertain). يتم تجاهل التسميات غير المؤكدة (بسبب الغموض، أو تسرب الحدود، أو انخفاض الثقة) أثناء التدريب.
2. بنية DynEoMT
توسع DynEoMT بنية VidEoMT (وهي نهج Vision Transformer يعتمد على المشفّر فقط) التي تعمل عبر الإنترنت (online) وتعتمد على الاستعلام، بإضافة رأس تنبؤ بالديناميكية خفيف الوزن:
المدخلات: يعالج النموذج فقط رقع الصور (image patches) للإطار الحالي والاستعلامات (queries) المنتشرة من الإطار السابق. لا يحتفظ النموذج بإطارات RGB سابقة أو خرائط ميزات أو يتطلب تدفقاً بصرياً أو عمقاً أو وضعية كاميرا أثناء الاستنتاج.
العمود الفقري المشترك: يقوم مشفر ViT مدرب مسبقاً بمعالجة صورة الإطار الحالي والاستعلامات المنتشرة معاً.
رأس الديناميكية: يتم إلحاق طبقة MLP خفيفة الوزن مكونة من طبقتين مباشرة بكل استعلام منتشر. يتنبأ هذا الرأس باحتمالية كون المنطقة ديناميكية أو ثابتة.
التدريب المشترك: يتم تدريب رأس الديناميكية بشكل مشترك مع أهداف التقسيم الأصلية (التصنيف، mask BCE، وDice). تظل عملية التعيين الهنغاري (Hungarian assignment) لمطابقة الاستعلامات مع أقنعة الحقيقة الأرضية قائمة فقط على تكاليف الفئة والقناع، مما يضمن عدم تداخل مهمة الديناميكية مع تعيين التقسيم.
دالة الخسارة: يتم تطبيق دالة خسارة الانتروبيا المتقاطعة الثنائية الموزونة على تنبؤات الديناميكية لأزواج الاستعلام-الهدف المتطابقة، مع تعديل الأوزان لمواجهة عدم التوازن بين الفئات الثابتة والديناميكية.
المساهمات الرئيسية
إطار إشراف غير مرتبط بالفئة: خط أنابيب لتوليد الإشراف الديناميكي عبر مهام التقسيم الزمني الدلالي والمثالي والشامل باستخدام التدفق البصري المعوض بالكاميرا والتصفية الزمنية.
إطار عمل DynEoMT: صياغة تعتمد على الاستعلام وتعمل عبر الإنترنت (online)، تقوم بالتقسيم والتنبؤ بالديناميكية بشكل مشترك. تحقق ذلك دون الحاجة إلى خط معالجة منفصل متمحور حول الحركة، وبالاعتماد فقط على الاستعلامات المنتشرة والإطار الحالي.
تقييم موحد: تقييم شامل عبر أربعة معايكات (VIPSeg، OVIS، YouTube-VIS 2022، VSPW) يقدم مقياس DynSeg-F1، الذي يقيم الأداء النهائي لنطاق القناع، والفئة الدلالية، والتنبؤ بالديناميكية في آن واحد.
النتائج
الحفاظ على التقسيم: تحافظ DynEoMT إلى حد كبير على أداء التقسيم الأصلي. عبر جميع المعايكات وأحجام العمود الفقري (ViT-S, B, L)، يظل التغيير المطلق في مقاييس التقسيم الأصلية (VPQ, STQ, AP, mIoU) ضمن حدود 1.8 نقطة مقارنة بالنموذج الأساسي VidEoMT.
التنبؤ بالديناميكية:
في VIPSeg، تحقق DynেMT دقة متوازنة (BAcc) تبلغ 84.3% (ViT-B) وDynSeg-F1 تبلغ 55.0% (ViT-L).
في OVIS، وYouTube-VIS 2022، وVSPW، تحقق دقة متوازنة تبلغ 68.0% (ViT-B)، و68.6% (ViT-B)، و87.6% (ViT-B)، على التوالي.
تعمل الأعمدة الفقارية الأكبر (ViT-L) عموماً على تحسين التغطية النهائية وDynSeg-F1، رغم أن دقة التصنيف الشرطية (BAcc) تتباين بشكل متوسط.
الكفاءة: لا تسبب إضافة رأس الديناميكية أي عبء حسابي يُذكر. على جهاز NVIDIA Jetson AGX Orin، كان الفرق في الإنتاجية (throughput) بين VidEoMT وDynOfMT أقل من 0.1% في المتوسط، مع حد أقصى للتباطؤ قدره 2.3%.
نتائج الدراسة الاستقصائية (Ablation): كشفت تجارب الاستقصاء على استعلامات VidEoMT المجمدة أن المعلومات المتعلقة بالديناميكية موجودة بالفعل في الاستعلامات المنتشرة. ومع ذلك، فإن الضبط الدقيق المشترك الكامل (full joint fine-tuning) يعطي أفضل النتائج، مما يشير إلى أن تكييف تمثيل التقسيم خصيصاً للديناميكية يحسن الأداء العام للنظام.
الأهمية والادعاءات
يزعم البحث أن ديناميكية منطقة التقسيم يمكن تعلمها مباشرة من الاستعلامات المنتشرة للأجسام في نماذج التقسيم المرئي القائمة على الاستعلام. يتيح هذا الاكتشاف دمج التنبؤ بالديناميكية في التقسيم المرئي عبر الإنترنت دون الحاجة إلى:
خطوط معالجة مخصصة للحركة (مثل التدفق البصري أو تقدير العمق).
وضعية الكاميرا أو المعلمات الداخلية.
الاحتفاظ بالإطارات السابقة أو خرائط الميزات.
يؤكد المؤلفون أن نهجهم يوفر مخرجاً موحداً حيث يتم تعزيز المناطق الدلالية أو المثالية أو الشاملة بحالة ديناميكية أو ثابتة. كما يقرون بالقيود، مشيرين إلى أن التسميات المستعارة هي تقريبات للحركة الفيزيائية (تعتمد على التدفق المتبقي ثنائي الأبعاد) وقد تواجه صعوبة مع الحركة غير الصلبة (non-rigid motion) أو اختلاف المنظر (parallax). ومع ذلك، يوضح العمل أن إضافة خفيفة الوزن إلى بنيات التقسيم الحالية يمكن أن تستنتف حالات الحركة بفعالية، مما يسد الفجوة بين التقسيم الدلالي وفهم الحركة بطريقة فعالة حاسوبياً وعبر الإنترنت.