Label-Efficient Transfer Learning for Human Action Recognition Using Pretrained VideoMAE
تُظهر هذه الدراسة أن دمج مشفر VideoMAE مدرب مسبقاً ومجمد مع مصنف خطي خفيف الوزن يتيح التعرف على الأنشطة البشرية بكفاءة عالية في استخدام الملصقات، محققاً أداءً قوياً على معايير UCF101 وHMDB51 مع حد أدنى من التوضيحات مع الحفاظ على استقرار التحسين وثبات استهلاك الموارد الحسابية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الرؤية الحاسوبية، ظل تعليم الآلات فهم الحركة البشرية لزمن طويل لغزاً ذا تعقيد هائل. لعقود من الزمن، حاول الباحثون بناء أنظمة يمكنها مشاهدة مقطع فيديو وتحديد ما يفعله الشخص، سواء كان ذلك إرسال كرة تنس، أو مصافحة، أو سقوطاً. اعتمدت المحاولات المبكرة على قواعد مصممة يدوياً، حيث كان المهندسون يحددون يدوياً كيف تبدو الحركة، لكن هذه الأنظمة غالباً ما كانت تفشل عندما تتغير زاوية الكاميرا أو تصبح الخلفية مزدحمة. تحول المجال مع وصول التعلم العميق، مما سمح للحواسيب بتعلم هذه الأنماط مباشرة من بيانات الفيديو الخام. ومع ذلك، جاء هذا النهج الجديد بثمن باهظ: فقد تطلب كميات هائلة من الفيديو المصنف، حيث كان البشر يشاهدون ساعات من اللقطات بدقة ويضعون علامات على كل حركة. كانت هذه العملية بطيئة، ومكلفة، وغالباً ما تكون مستحيلة في المهام المتخصصة حيث يندر وجود الخبراء. ولحل هذه المشكلة، اتجه العلماء إلى التعلم الخاضع للإشراف الذاتي، وهو أسلوب تتعلم فيه الحواسيب من محيطات شاسعة من الفيديوهات غير المصنفة عبر محاولة التنبؤ بالأجزاء المفقودة من الصورة، مما يعلمها فعلياً هيكل الحركة دون مساعدة بشرية. والسؤال الذي يبقى هو ما إذا كانت هذه الأنظمة ذاتية التعلم جاهزة حقاً للعالم الواقعي، حيث تكون البيانات المصنفة محدودة غالباً، أم أنها لا تزال بحاجة إلى يد بشرية قوية من الإشراف لتعمل بشكل صحيح.
قام باحث في معهد "سيداغانجا" للتكنولوجيا في الهند بالإجابة على هذا السؤال من خلال اختبار نوع محدد من نماذج التعلم الذاتي يسمى "VideoMAE". تخيل طالباً قرأ كل كتاب في مكتبة ولكنه لم يخض اختباراً قط؛ أراد الباحث أن يرى مدى قدرة هذا الطالب على الإجابة على أسئلة الاختبار إذا تم إعطاؤه فقط بعض الإجابات النموذجية للدراسة. في دراسته، استخدم نموذج "VideoMAE" مدرباً مسبقاً، والذي تعلم بالفعل فهم الفيديو من خلال إعادة بناء الأجزاء المحجوبة من آلاف المقاطع غير المصنفة. قام بتجميد "دماغ" هذا النموذج بحيث لا يمكنه تعلم أي شيء جديد، وربط فوقه مصنفاً بسيطاً وخفيف الوزن. سمح هذا الإعداد باختبار الفهم الخام للحركة البشرية لدى النموذج من خلال تغذيته بميات مختلفة من بيانات التدريب المصنفة، بدءاً من جزء ضئيل جداً وصولاً إلى مجموعة البيانات الكاملة. وقد اختبر هذا النهج على معيارين معروفين للتعرف على الحركة البشرية: "UCF101"، الذي يحتوي على مجموعة متنوعة من الرياضات والأنشطة اليومية، و"HMDB51"، وهو مجموعة أكثر صعوبة من المقاطع المستخرجة من الأفلام وقواعد البيانات العامة التي تتميز بحركات كاميرا معقدة وخلفيات متنوعة.
كشفت النتائج عن مسار واضح وعملي لاستخدام هذه النماذج المتقدمة. فعندما أعطى الباحث النظام عشرة بالمائة فقط من البيانات المصنفة المتاحة، تمكن النظام من تحديد الحركات بدقة ملحوكة. وفي مجموعة بيانات "UCF101"، حقق النموذج معدل تعرف يقارب ثمانية وثمانين بالمائة باستخدام ذلك الجزء الصغير فقط من الأمثلة المصنفة. ومع زيادة كمية البيانات المصنفة إلى خمسة وعشرين بالمائة ثم خمسين بالمائة، ارتفعت الدقة بشكل مطرد، لتصل إلى أكثر من اثنين وتسعين بالمائة عند استخدام مجموعة البيانات الكاملة. ومع ذلك، فإن الاكتشاف الأكثر أهمية لم يكن فقط في أن النموذج يعمل ببيانات قليلة، بل في أن فوائد إضافة المزيد من البيانات بدأت تتلاشى بسرعة. فبمجرد وصول النظام إلى نصف عينات التدريب المصنفة، لم تؤدِ إضافة النصف المتبقي إلا إلى تحسن طفيف جداً في الأداء. يشير هذا إلى أن التدريب المسبق الخاضع للإشراف الذاتي قد استوعب بالفعل الغالبية العظمى من المعلومات البصرية والزمنية اللازمة لفهم الحركة البشرية، مما ترك المصنف البسيط يقوم بعمل ضئيل جداً للتكيف مع المهمة المحددة.
كانت القصة مختلفة قليلاً، ولكنها كاشفة بنفس القدر، عندما اختبر الباحث مجموعة بيانات "HMDB51" الأكثر صعوبة. ولأن هذه الفيديوهات كانت أكثر فوضوية، بكاميرات مهتزة وخلفيات معقدة، بدأ النموذج بدقة أقل بنحو اثنين وخمسين بالمائة باستخدام عشرة بالمائة فقط من التصنيفات. ومع ذلك، مع إضافة المزيد من البيانات المصنفة، تحسن النظام بشكل أكثر دراماتيكية مما كان عليه في مجموعة البيانات الأسهل، ليصل في النهاية إلى دقة تزيد عن ثلاثة وستين بالمائة مع الإشراف الكامل. أشار هذا إلى أنه بينما كانت القاعدة القائمة على التعلم الذاتي قوية، إلا أنه كلما كانت البيئة الواقعية أكثر فوضوية وتعقيداً، زادت قيمة وجود بضعة أمثلة إضافية مصنفة. ومع ذلك، حقق النظام مستوى عالياً من الأداء باستخدام نصف البيانات فقط، مما يثبت أن النموذج ذاتي التعلم قد تعلم تمثيلاً قوياً للحركة يمكنه التعامل مع التنوع البصري الكبير دون الحاجة إلى دليل يدوي كامل.
بعيداً عن النتائج النهائية، نظر الباحث عن كثب في كيفية تعلم النظام والموارد التي يستهلكها. وجد أن عملية التدريب كانت مستقرة ويمكن التنبؤ بها عبر جميع مستويات الإشراف، حيث وصل النموذج إلى حالة الاستقرار بسلاسة دون سلوك مضطرب. ومن حيث قوة الحوسبة، كان النهج فعالاً للغاية؛ فبسبب تجميد الجزء الرئيسي من النموذج وتدريب الطبقة العلوية الصغيرة فقط، ظل مقدار ذاكرة الكمبيوتر المطلوبة ثابتاً تقريباً، بغض النظر عن كمية البيانات المصنفة المستخدمة. وقد استغرق الوقت اللازم للتدريب وقتاً أطول مع زيادة البيانات، ببساطة لأن الكمبيوتر كان يتعين عليه معالجة المزيد من الأمثلة، لكن بصمة الذاكرة لم تنمو. وهذا يعني أن الطريقة قابلة للتوسع ولا تتطلب ترقيات مكلفة للأجهزة لمجرد التعامل مع مجموعة بيانات أكبر. كما بحثت الدراسة في الحركات التي أخطأ فيها النموذج، ووجدت أن الأخطاء كانت تتركز غالباً في الحركات المتشابهة بصرياً، وهو قصور طبيعي عند التمييز بين الاختلافات الدقيقة في الحركة البشرية.
في الختام، يوضح هذا العمل أن عصر الحاجة إلى مجموعات بيانات فيديو ضخمة ومصنفة بدقة لكل تطبيق جديد قد يقترب من نهايته. لقد أظهر الباحث أن نموذجاً تم تدريبه على فيديوهات غير مصنفة يمكن أن يعمل كأساس قوي للتعرف على الحركات البشرية، متطلباً فقط جزءاً ضئيلاً من جهد التصنيف اليدوي لتحقيق أداء عالٍ. وتشير النتائج إلى أنه بالنسبة للعديد من التطبيقات العملية، مثل مراقبة السلامة في المصانع أو تحليل التقنيات الرياضية، يمكن للمؤسسات الاعتماد على هذه الأنظمة المدربة مسبقاً لتقديم نتائج دقيقة دون التكلفة الباهظة لتوصيف كل إطار فيديو. وبينما لا تزال مجموعات البيانات الأكثر صعوبة تستفيد من أمثلة إضافية مصنفة، فإن القدرة الجوهرية موجودة بالفعل في النموذج الخاضع للإشراف الذاتي، مما يوفر حلاً عملياً وفعالاً من حيث الموارد لجلب الفهم الذكي للفيديو إلى العالم الحقيقي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.