← أحدث الأبحاث
💻 computer science

DynEoMT: Learning Object Dynamicity from Online Segmentation Queries

يُعد DynEoMT إطار عمل عبر الإنترنت يعمل على تعزيز تقسيم الفيديو القائم على الاستعلام للتنبؤ بديناميكية الأجسام على مستوى المنطقة (متحرك مقابل ثابت) دون الحاجة إلى التدفق البصري أو العمق أو وضعية الكاميرا، محققاً أداءً قوياً من خلال مسار إشراف غير متصل بالإنترنت مبتكر تم تدريبه على التدفق البصري المعوض لحركة الكاميرا.

المؤلفون الأصليون: Calvin Galagain, Martyna Poreba, François Goulette

نُشر 2026-09-16
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Calvin Galagain, Martyna Poreba, François Goulette

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الرؤية الحاسوبية، أصبحت الآلات بارعة بشكل ملحوظ في التعرف على ما يوجد في الصورة. يمكنها تحديد سيارة، أو شخص، أو شجرة، ورسم مخطط دقيق حولها. ولكن هناك فرق دقيق بين رؤية جسم ما وفهم كيفية حركته. فعندما تتحرك الكاميرا عبر مشهد ما، يبدو أن كل شيء في مجال الرؤية ينزاح. قد تبدو سيارة مركونة وكأنها تنزلق عبر الشاشة ببساطة لأن الكاميرا تدور، بينما يتحرك أحد المشاة لسببه الخاص. ولكي تفهم الآلة المشهد حقاً، يجب أن تميز بين الأجسام التي تتحرك من تلقاء نفسها والأجسام التي تبدو وكأنها تتحرك فقط بسبب حركة الكاميرا. هذه القدرة على التمييز بينهما أمر بالغ الأهمية للروبوتات التي تحتاج إلى التنقل في العالم أو للأنظمة التي تبني خرائط لمحيطها. فإذا أخطأ الروبوت في اعتبار مبنى ثابت عائقاً متحركاً، أو تجاهل سيارة حقيقية متحركة لأنه اعتقد أن المبنى هو الذي يتحرك، فإن فهمه للعالم ينهار.

لقد علم الباحثون الحواسيب لفترة طويلة كيفية تتبع الأجسام بمرور الوقت، مع الحفاظ على تسمية متسقة لسيارة أو شخص معين أثناء تحركه عبر الفيديو. ومع ذلك، فإن هذه الأنظمة عادة ما تتوقف عند تحديد الجسم وموقعه؛ فهي لا توضح صراحةً ما إذا كان هذا الجسم يتحرك بشكل مستقل أم أنه مجرد جزء ثابت من الخلفية. تقدم دراسة جديدة طريقة تسمى DynEoMT، والتي تضيف هذه الطبقة المفقودة من الفهم. يتعلم النظام النظر إلى إطارات الفيديو والبيانات التي جمعها بالفعل عن الأجسام، ثم يقرر لكل منطقة متتبعة ما إذا كانت ديناميكية أم ثابتة. والإنجاز الرئيسي هنا هو أن النظام يفعل ذلك دون الحاجة إلى حساب أنماط حركة معقدة، أو قياس العمق، أو معرفة الموقع الفيزيائي للكاميرا. فهو يتعلم استنتاج حالة الحركة مباشرة من الطريقة التي يتتبع بها الجسم نفسه.

لتعليم الحاسوب هذه المهارة، كان على الباحثين أولاً إنشاء طريقة لتسمية البيانات، بما أن مجموعات بيانات الفيديو الموجودة لا تتضمن هذه المعلومة المحددة. لقد بنوا عملية "أوفلاين" (غير متصلة بالإنترنت) تعمل كمعلم. تنظر هذه العملية إلى أزواج من إطارات الفيديو وتحسب كيفية تحرك البكسلات بينها. ثم تقدر مقدار تلك الحركة الناتج عن الكاميرا نفسها وتقوم بطرحه. وما يتبقى هو الحركة "المتبقية"، والتي تمثل الحركة الفعلية للأجسام في العالم. إذا أظهرت منطقة ما حركة كبيرة بعد إزالة حركة الكاميرا، يتم تصنيفها على أنها ديناميكية. وإذا أظهرت حركة ضئيلة أو معدومة، يتم تصنيفها على أنها ثابتة. طبق الباحثون هذا المنطق على أربع مجموعات رئيسية من بيانات الفيديو، تغطي كل شيء بدءاً من التجزئة الدلالية (semantic segmentation)، حيث يتم إعطاء كل بكسل فئة معينة، وصولاً إلى التجزئة الجزئية (instance segmentation)، حيث يتم تتبع الأجسام الفردية بشكل منفصل. وقد خلق هذا مجموعة ضخمة من الأمثلة التدريبية حيث تأتي كل قناع للجسم (object mask) مصحوبة بتسمية تشير إلى ما إذا كان متحركاً أم ساكناً.

ومع بيانات التدريب الجديدة هذه، قام الباحثون بتعديل نموذج تجزئة فيديو موجود. لقد أضافوا مكوناً صغيراً وخفيف الوزن لاتخاذ القرار، أو "رأساً" (head) للنظام. ينظر هذا المكون إلى التمثيل الداخلي لكل جسم يتتبعه النموذج ويتنبأ بما إذا كان متحركاً أم ثابتاً. ومن الأهمية بمكان أن هذا التنبؤ يحدث في الوقت الفعلي أثناء تشغيل الفيديو. يستخدم النظام الصورة الحالية فقط والمعلومات التي نقلها من الإطار السابق. فهو لا ينظر إلى الصور القديمة، ولا يحسب التدفق البصري (optical flow)، ولا يتطلب أي مستشعرات إضافية. يتعلم النموذج القيام بهذا التنبؤ جنباً إلى جنب مع وظيفته الأساسية المتمثلة في رسم الخطوط حول الأجسام، مما يضمن أن المهمة الجديدة لا تتعارض مع قدرته على الرؤية والتتبع.

تظهر النتائج أن هذا النهج يعمل بفعالية عبر أنواع مختلفة من بيانات الفيديو. ففي مجموعة بيانات كبيرة من التجزئة البانوبتيكية للفيديو (video panoptic segmentation)، حدد النظام حالة حركة الأجسام بدقة بلغت 84.3 بالمائة. وفي مجموعات بيانات أخرى تركز على تتبع الحالات الفردية، تراوحت الدقة بين 68.0 و87.6 بالمائة. ولعل الأمر الأكثر أهمية هو أن إضافة هذه القدرة الجديدة لم تضعف أداء النظام الأصلي. فقد ظلت القدرة على رسم الأقنعة بدقة وتتبع هويات الأجسام كما هي تقريباً قبل التعديل. وجد الباحثون أن الإشارات الداخلية التي يستخدمها النموذج لتتبع الأجسام تحتوي بالفعل على معلومات كافية لتحديد ما إذا كانت تلك الأجسام تتحرك. فبمجرد إضافة طبقة صغيرة لتفسير تلك الإشارات، اكتسب النظام فهماً جديداً للعالم دون الحاجة إلى خط معالجة حركة منفصل ومعقد.

يبرهن هذا العمل على أن التمييز بين جسم متحرك وآخر ثابت يمكن تعلمه مباشرة من الطريقة التي يتتبع بها النموذج الأجسام بمرور الوقت. ويشير ذلك إلى أن الأنظمة المستقبلية المصممة للروبوتات أو الملاحة الذاتية يمكن أن تكتسب فهماً أكثر قوة لبيئتها دون التكلفة الحسابية الثقيلة لأدوات تحليل الحركة المخصصة. يعتمد الأسلوب على مبدأ بسيط: إذا كنت تستطيع تتبع جسم ما، فمن المرجح أنك تستطيع معرفة ما إذا كان يتحرك من تلقاء نفسه. لقد أتاح الباحثون الكود الخاص بهم للجمهور، مما يسمح للآخرين بإعادة إنتاج هذه النتائج والبناء على نظام لا يرى فقط ما هو موجود، بل كيف يتصرف أيضاً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →