An Adaptive Cascaded Fast Partitioning Algorithm Based on Visual Perception and Multi-Level Machine Learning
تقترح هذه الورقة خوارزمية تقسيم سريع متتالية تكيفية لترميز الفيديو متعدد الاستخدامات (VVC) تدمج التحليل الإدراكي البصري والتعلم الآلي متعدد المستويات لتقليل تعقيد الترميز بشكل كبير مع الحفاظ على كفاءة ترميز عالية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في العالم الحديث، لم يعد الفيديو مجرد وسيلة لمشاهدة قصة، بل أصبح اللغة الأساسية لحياتنا الرقمية. فمن البث عالي الدقة الذي نشاهده على هواتفنا إلى تجارب الواقع الافتراضي الغامرة بزاوية 360 درجة، انفجر الطلب على المحتوى المرئي. ومع ذلك، فإن تقديم هذه الصور يتطلب كمية هائلة من البيانات. ولجعل هذه البيانات قابلة للإدارة من حيث التخزين والنقل، يستخدم المهندسون ترميز الفيديو، وهي عملية تضغط الفيديو الخام إلى ملف أصغر دون فقدان جودة الصورة. ويعد المعيار الأحدث لهذا الغرض، والمعروف باسم "ترميز الفيديو متعدد الاستخدامات" (Versatile Video Coding)، فعالاً للغاية، وقادراً على التعامل مع محتوى بدقة 4K و8K فائقة الووضوح التي لم تستطع الأنظمة القديمة التعامل معها. ومع ذلك، تأتي هذه القوة بثمن باهظ: فالحسابات الحاسوبية المطلوبة لضغط الفيديو مكثفة للغاية لدرجة أنها غالباً ما تجعل المعالجة في الوقت الفعلي مستحيلة على الأجهزة القياسية. ويكمن جوهر هذه المشكلة في كيفية قرار البرنامج لتقسيم إطار الفيديو إلى قطع أصغر لضغطها. فالطريقة الحالية تفحص كل طريقة ممكنة لتقطيع هذه القطع، وهي عملية شاملة ولكنها بطيئة بشكل مؤلم، تماماً مثل محاولة إيجاد أفضل طريق عبر مدينة عن طريق القيادة في كل شارع بمفرده لمعرفة أيها الأسرع.
لقد طور باحثون في جامعة تشينغتشو للصناعة الخفيفة نهجاً جديداً لتسريع هذه العملية دون التضحية بجودة الفيديو النهائي. فبدلاً من الفحص العشوائي لكل الاحتمالات، تعلمت طريقتهم جعل الكمبيوتر يتخذ قرارات ذكية وسريعة بناءً على ما يمكن للعين البشرية رؤيته بالفعل. لقد أدركوا أن الأجزاء ليست متساوية في الأهمية بالنسبة لإدراكنا؛ فبعض المناطق تكون ناعمة أو موحدة للغاية لدرجة أن العين البشرية لن تلاحظ لو تخطى الكمبيوتر تحليلها التفصيلي، بينما تتطلب المناطق الأخرى ذات الأنسجة المعقدة أو الحواف الحادة اهتماماً دقيقاً. ومن خلال تركيز العمل الحسابي الثقيل فقط على أجزاء الصورة التي تهمنا، وتخطي البقية، أنشأوا نظاماً أسرع وأكثر كفاءة.
إن قلب حلهم يكمن في عملية اتخاذ قرار مكونة من أربع مراحل تعمل كمرشح (فلتر)، حيث تضيق الخيارات مع تقدمها. المرحلة الأولى هي فحص سريع وفائق الخفة ينظر إلى سطوع الصورة. فإذا كان قسم من الفيديو ناعماً جداً والتغيرات في السطوع طفيفة للغاية بحيث لا يلاحظها البشر، يقرر النظام فوراً التوقف عن تحليل تلك المنطقة. تعتمد هذه الخطوة على نموذج للرؤية البشرية يفهم كيفية تفاعل أعيننا مع الضوء في الخلفيات المختلفة. وإذا اجتاز الجزء هذا الاختبار الأولي، ينتقل النظام إلى المرحلة الثانية، حيث يفحص نسيج المنطقة. وباستخدام مجموعة من القياسات البسيطة التي تصف الأنماط والحواف في الصورة، يقوم برنامج حاسوبي بتخمين واثق حول ما إذا كانت المنطقة تحتاج إلى التقسيم إلى قطع أصغر. وإذا كان البرنامج متأكداً جداً من إجابته، يتوقف عند هذا الحد، مما يوفر قدراً كبيراً من الوقت.
أما بالنسبة للمناطق الأكثر تعقيداً والتي تتطلب مزيداً من التحليل، فيدخل النظام المرحلة الثالثة، حيث يقدر صعوبة المهمة. فهو ينظر إلى النسيج ومدى ثقة التخمين السابق لتصنيف كتلة الفيديو على أنها ذات تعقيد منخفض، أو متوسط، أو عالٍ. هذا التصنيف أمر بالغ الأهمية لأنه يحدد مقدار الجهد الذي يجب أن يبذله النظام في الخطوة النهائية. فالكتلة ذات الأنماط البسيطة تحصل على فحص سريع ومحدود، بينما تحصل الكتلة ذات الأنماط الفوضوية والمفصلة على فحص أكثر شمولاً. وفي المرحلة الأخيرة، يستخدم النظام تقييم التعقيد هذا لتحديد اتجاهات التقطيع التي سيتم اختبارها بالضبط. فإذا كانت المنطقة بسيطة، فقد يختبر طريقة واحدة أو اثنتين فقط لتقسيم الكتلة، أما إذا كانت معقدة، فإنه يختبر جميع الاتجاهات الأربعة الممكنة. تضمن هذه الاستراتيجية التكيفية أن الكمبيوتر لا يهدر الطاقة في المهام السهلة، لكنه أيضاً لا يستعجل في المهام الصعبة.
اختبر الباحثون هذه الطة الجديدة مقابل النسخة القياسية غير المعدلة من برنامج ترميز الفيديو. وأظهرت النتائج تحسناً دراماتيكياً في السرعة؛ ففي المتوسط، قللت الخوارزمية الجديدة الوقت المستغرق لترميز الفيديو بنسبة 46.22 بالمائة. وهذا يعني أن فيديو كان يستغرق ساعة للمعالجة يمكن الآن إنجازه في نصف ذلك الوقت تقريباً. والأهم من ذلك، أن هذه السرعة جاءت مع انعدام شبه تام في الجودة. فقد قاس الباحثون الفرق في حجم الملف ووضوح الصورة ووجدوا أن الطريقة الجديدة زادت حجم الملف بنسبة 0.90 بالمائة فقط مقارنة بالمعيار القياسي. وفي عالم ضغط الفيديو، يعتبر مثل هذه الارتفاع البسيط ضئيلاً، مما يعني أن التجربة البصرية للمشاهد تظل دون تغيير فعلي.
كما كشفت الدراسة أن النظام يعمل بشكل مختلف اعتماداً على نوع الفيديو الذي تتم معالجته. فبالنسبة للفيديوهات ذات الأنسجة الناعمة والمنتظمة، مثل شخص يتحدث في استوديو، تمكن النظام من تخطي العديد من الخطوات وتحقيق توفير هائل في الوقت. أما بالنسبة للفيديوهات ذات الحركة السريعة أو المشاهد الفوضوية، مثل سوق مزدحم أو مباراة رياضية، فقد كان النظام أكثر حذراً، حيث قضى وقتاً أطول لضمان بقاء الجودة عالية. هذه المرونة هي ما يجعل هذا النهج فعالاً للغاية؛ فهو لا يعامل كل فيديو بنفس الطريقة، بل يكيف استراتيجيته مع المحتوى الذي يتعامل معه. ومن خلال الجمع بين الفهم العميق للرؤية البشرية والتعلم الآلي الذكي، وجد الباحثون طريقة لجعل مستقبل الفيديو عالي الدقة أكثر سهولة، مما يسمح بمعالجة أسرع وبث أكثر سلاسة دون الحاجة إلى حواسيب خارقة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.