Seeing Fast and Slow: Learning the Flow of Time in Videos
تقدم هذه الورقة نماذج ذاتية الإشراف تتعلم كيفية اكتشاف والتحكم في سرعة تشغيل الفيديو، مستفيدة من هذه القدرات لإنشاء مجموعة بيانات ضخمة للحركة البطيئة وتمكين تطبيقات متقدمة مثل توليد الفيديو المشروط بالسرعة والدقة الزمنية الفائقة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تشاهد فيلماً. أحياناً، تبدو الحركة محمومة ومتسارعة وكأنها فيديو تم تقديمه بسرعة، مثل سنجاب يتناول الإسبريسو. وفي أحيان أخرى، تبدو كأنها حلم، حيث تستغرقة ورقة ساقطة عشر ثوانٍ لتصل إلى الأرض. البشر بارعون بطبيعتهم في استشعار هذا "تدفق الوقت". إذا تم تسريع فيديو ما، فنحن نعرف أنه يبدو "خاطئاً" لأن تموجات الماء ستكون سريعة جداً أو لأن الشخص سيسقط كالحجر.
لكن بالنسبة للحواسيب، الوقت لغز. معظم نماذج الذكاء الاصطناعي لم ترَ سوى فيديوهات تُعرض بالسرعة القياسية (مثل 30 إطاراً في الثانية). هي لا تعرف حقاً ما هو "التصوير البطيء"؛ هي فقط ترى تتابعاً من الصور. إذا طلبت منها صنع فيديو بالتصوير البطيء، فإنها غالباً ما تقوم فقط بتشغيل الفيديو نفسه ببطء، مما يجعله يبدو متقطعاً وغير طبيعي، أو تتجاهل تعليماتك تماماً.
هذه الورقة البحثية، "رؤية السريع والبطيء" (Seeing Fast and Slow)، تشبه تعليم الكمبيوتر أخيراً مفهوم الزمن. لقد قام الباحثون من جامعة كورنيل، وجامعة نانتيانغ للعلوم والتكنولوجيا (NTU)، وجامعة واشنطن (UW)، ببناء نظام لا يمكنه فقط معرفة ما إذا كان الفيديو سريعاً أم بطيئاً، بل يمكنه أيضاً إنشاء فيديوهات جديدة بأي سرعة تريدها، من السرعة العادية إلى التصوير البطيء الشديد.
إليك كيف فعلوا ذلك، مشروحاً عبر تشبيهات بسيطة:
1. "محقق الصوت" (التعلم لكشف تغيرات السرعة)
المشكلة: كيف تعلم حاسوباً أن يكتشف متى يتسارع الفيديو أو يتباطأ دون الحاجة إلى بشر يقومون بتصنيف كل ثانية؟
الحل: أدرك الباحثون أن الصوت والحركة صديقان حميمان.
- التشبيه: فكر في مشغل الأسطوانات. إذا قمت بتسريع الأسطوانة، سيبدو الصوت حاداً وعالياً مثل صوت السناجب. وإذا أبطأتها، سيبدو الصوت عميقاً ومخيفاً.
- الحيلة: يستمع الكمبيوتر إلى الصوت المصاحب للفيديو. عندما تقفز طبقة الصوت (Pitch) فجأة، يعرف الكمبيوتر: "آه! لقد تسارع الفيديو للتو!". وعندما تنخفض الطبقة، يعرف: "لقًا قد تباطأ للتو!".
- النتيجة: باستخدام هذا الدليل الصوتي، علّم الكمبيوتر نفسه كيفية العثور على اللحظة التي تغيرت فيها السرعة بالضبط في آلاف الفيديوهات، مما خلق مكتبة ضخمة من أمثلة "تغير السرعة" دون الحاجة لمساعدة بشرية.
2. "رياضيات المسافر عبر الزمن" (التعلم لتخمين السرعة)
المشكلة: بمجرد أن يعرف الكمبيوتر متى تغيرت السرعة، كيف يعرف مقدار هذا التغيير؟ هل هي أسرع بمرتين؟ أم أبطأ بعشر مرات؟
الحل: استخدموا حيلة رياضية ذكية تسمى "التكافؤ" (Equivariance).
- التشبيه: تخيل أن لديك فيديو لعداء. إذا قمت بتشغيله بسرعة 2x، سيبدو العداء وكأنه يركض أسرع بمرتين. إذا أخذت هذا الفيديو (الذي يعمل بسرعة 2x) ثم قمت بتشغيله بسرعة 2x مرة أخرى، فيجب أن يبدو العداء وكأنه يركض بسرعة 4x. العلاقة هنا قابلة للتنبؤ.
- الحيلة: يأخذ الكمبيوتر فيديو، ويسرعه اصطناعياً، ثم يسأل نفسه: "إذا قمت بتسريع هذا بمقدار 2x، فيجب أن تزداد توقعاتي أيضاً بمقدار 2x". يتدرب الكمبيوتر على هذا مراراً وتكراراً، ويتعلم تقدير السرعة بدقة بمجرد النظر إلى كيفية تحرك الأشياء.
- النتيجة: أصبح الكمبيوتر بارعاً في هذا لدرجة أنه يمكنه تخمين سرعة الفيديو بدقة تقارب دقة الخبير البشري.
3. "آلة الزمن" (بناء مجموعة بيانات SloMo-44K)
المشكلة: لتعليم الكمبيوتر كيفية إنشاء التصوير البطيء، تحتاج إلى إظهار تصوير بطيء حقيقي له. لكن فيديوهات التصوير البطيء الحقيقية (التي تُصور بكاميرات عالية السرعة باهظة الثمن) نادرة وغير متوفرة بكثرة على الإنترنت.
الحل: استخدموا أدوات "محقق السرعة" و"المسافر عبر الزمن" الجديدة لمسح الإنترنت.
- التشبيه: تخيل أميناً للمكتبة يمكنه العثة فوراً إلى كل كتاب في المكتبة كُتب بلهجة معينة، حتى لو لم تكن الكتب مصنفة بتلك اللهجة.
- الحيلة: قاموا بمسح ملايين الفيديوهات من يوتيوب وفيميو. قام الذكاء الاصطناي الخاص بهم بتصفية المحتوى العادي والاحتفاظ فقط بمقاطع التصوير البطيء الحقيقية. انتهى بهم الأمر بامتلاك SloMo-44K، وهي مجموعة بيانات ضخمة تضم 44,000 مقطع تصوير بطيء. وهي أكبر مجموعة من نوعها، تحتوي على 18 مليون إطار من الحركة عالية السرعة.
4. "نحات الزمن" (إنشاء وإصلاح الفيديوهات)
مع هذه المعرفة الجديدة وهذه المجموعة الضخمة من البيانات، بنوا قوتين خارقتين:
التوليد المشروط بالسرعة (Speed-Conditioned Generation):
- ماذا يفعل: تعطي الذكاء الاصطناعي صورة ونصاً وصفياً (مثلاً: "طائر يهبط")، وتقول له: "اجعل هذا يحدث بتصوير بطيء شديد".
- السحر: بخلاف النماذج القديمة التي تكتفي بمجرد مط (Stretch) الفيديو، فإن هذا النموذج يفهم الفيزياء. هو يعرف أنه في التصوير البطيء، تتحرك أجنحة الطائر ببطء، وأن قطرات الماء تظل معلقة في الهواء. إنه يولد إطارات جديدة تماماً تبدو وكأنها صُوّرت بكاميرا عالية السرعة تبلغ قيمتها 10,000 دولار.
الدقة الزمنية الفائقة (سحر "إزالة الضبابية" - De-Blur):
- ماذا يفعل: تعطيه فيديوً ضبابياً ومنخفض الجودة (مثل تسجيل مهتز بهاتف لحادث سيارة) وتطلب منه تحويله إلى فيديو تصوير بطيء واضح وعالي السرعة.
- السحر: الذكاء الاصطناعي التقليدي يقوم فقط بتخمين شكل الإطارات المفقودة، مما يجعلها ضبابية غالباً. أما هذا النموذج، المدرب على بيانات عالية السرعة حقيقية، فهو يعرف تماماً كيف يحدث ضباب الحركة وكيف "يزيل الضبابية" عنه، ليكشف عن تفاصيل دقيقة كانت غير مرئية سابقاً.
لماذا يهم هذا؟
فكر في هذا كمنح الحواسيب حساً بالزمن.
- للأدلة الجنائية: يمكن أن يساعد الشرطة في معرفة ما إذا كان فيديو كاميرا المراقبة قد تم التلاعب به أو تسريعه لإخفاء جريمة.
- للإبداع: يمكن لصناع الأفلام توليد لقطات تصوير بطيء للانفجارات أو الحركات الرياضية دون الحاجة إلى كاميرات باهظة الثمن.
- لذكاء الآلة: يساعد الذكاء الاصطناعي على فهم العالم الحقيقي بشكل أفضل. إذا فهم الذكاء الاصطناعي مدى سرعة سقوط الكرة أو كيفية تطاير رذاذ الماء، فيمكنه التنقل في العالم المادي بشكل أكثر أماناً وفعالية.
باختصار، لقد علم الباحثون الحواسيب التوقف عن مجرد "مشاهدة" الفيديوهات والبدء في الشعور حقاً بمرور الوقت.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.