← أحدث الأبحاث
💻 computer science

SalFormer360: a transformer-based saliency estimation model for 360-degree videos

تقدم الورقة البحثية SalFormer360، وهو نموذج جديد قائم على المحولات (transformer) يجمع بين مشفر SegFormer مضبوط بدقة مع فك تشفير مخصص وانحياز مركز الرؤية (Viewing Center Bias) لتحقيق أداء رائد في تقدير البروز (saliency estimation) لمقاطع الفيديو بـ 360 درجة عبر مجموعات بيانات مرجعية متعددة.

المؤلفون الأصليون: Mahmoud Z. A. Wahba, Francesco Barbato, Sara Baldoni, Federica Battisti

نُشر 2026-02-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Mahmoud Z. A. Wahba, Francesco Barbato, Sara Baldoni, Federica Battisti

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك ترتدي سماعة واقع افتراضي (VR). أنت تقف في منتصف كرة عملاقة بزاوية 360 درجة. يمكنك النظر للأعلى، للأسفل، لليسار، لليمين، أو الدوران حول نفسك بالكامل. المشكلة هي أن ملف الفيديو المطلوب لعرض كل شيء في تلك الكرة بجودة عالية سيكون ضخمًا للغاية — كأنك تحاول بث محتوى سينما كاملة إلى سماعة الرأس الخاصة بك. سيكون الأمر بطيئًا جدًا وسيستهلك كل سعة الإنترنت المتاحة لديك.

لحل هذه المشكلة، يستخدم المهندسون حيلة تسمى "بث مجال الرؤية" (viewport streaming). فبدلاً من إرسال الكرة بأكملها بدقة عالية، يتم إرسال الجزء الذي تنظر إليه بجودة عالية، بينما يظل باقي الأجزاء بجودة منخفضة. ولكن للقيام بذلك، يجب على الكمبيوتر أن يخمن أين ستنظر تاليًا.

هنا يأتي دور الورقة البحثية. فقد بنى المؤلفون عقلًا اصطناعيًا جديدًا يسمى SalFormer360 ليقوم بهذا التخمين.

المشكلة: "انحياز المركز" (The "Center Bias")

عندما تضع سماعة الواقع الافتراضي لأول مرة، فإنك عادة ما تبدأ بالنظر مباشرة إلى الأمام. أنت لا تدور حول نفسك بجنون فورًا؛ بل تميل إلى التركيز على مركز رؤيتك لفترة قبل الاستكشاف. هذا ما يسميه المؤلفون "انحياز مركز الرؤية".

تخيل الأمر كأنك تدخل غرفة جديدة. تقف عند المدخل وتنظر مباشرة إلى الجدار الذي أمامك. أنت لا تدور 360 درجة فورًا، بل تركز على المركز أولاً.

الحل: "المحقق المتحول" (A "Transformer" Detective)

ابتكر الفريق SalFormer360. لفهم كيفية عمله، تخيله كمحقق مدرب تدريبًا عاليًا يمتلك أداتين خاصتين:

  1. هيكل SegFormer (راصد الأجسام):
    يستخدم النموذج "محققًا" مدربًا مسبقًا صُمم في الأصل للعثور على الأجسام في الصور المسطحة ثنائية الأبعاد (مثل العثور على قطة في صورة). أدرك المؤلفون أن ما يجذب انتباهك في الفيديو (شخص، كرة، سيارة) هو غالبًا نفس الشيء الذي يبحث عنه "راصد الأجسام". لذا، أخذوا هذا المحقق ثنائي الأبعاد الموجود بالفعل وعلموه كيفية التعامل مع الشكل الغريب والممتد للفيديو بزاوية 360 درجة (والذي يشبه خريطة مسطحة للعالم).

  2. المُفكك المخصص (صانع الخرائط):
    بمجرد أن يرصد المحقق الأجسام المثيرة للاهتمام، يقوم "صانع خرائط" مخصص بتحويل تلك النقاط إلى خريطة حرارية. تُظهر هذه الخريطة بالضبط المكان الذي من المرجح أن ينظر إليه الإنسان.

  3. تعديل "انحياز المركز" (الذاكرة):
    هذا هو السر وراء نجاح النموذج. فالنموذج لا ينظر إلى الصورة فحسب، بل يتذكر أيضًا "القاعدة" التي تقول إن البشر يبدأون عادةً بالنظر إلى المركز.

  • في بداية الفيديو: يقول النموذج: "مهلاً، المستخدم وضع السماعة للتو. من المرجح أنه ينظر إلى المركز. لنرفع احتمالية التنبؤ بالمنتصف".
  • مع استمرار الفيديو: يدرك النموذج: "حسنًا، لقد أتيحت له الفرصة للنظر حوله الآن. قاعدة المركز أصبحت أقل أهمية الآن". ثم يقوم بخفض "صوت" انحياز المركز تدريجيًا ويركز أكثر على الأجسام الفعلية في المشهد.

ما مدى جودته؟

اختبر المؤلفون محققهم ضد العديد من "المحققين" الآخرين (نماذج الذكاء الاصطناعي الموجودة) باستخدام ثلاث مكتبات ضخمة من فيديوهات 360 درجة (رياضة، ألعاب، ومشاهد عامة).

  • النتائج: كان SalFormer360 هو الأفضل في تخمين أين سينظر الناس. لقد حسّن الدقة بنسبة تصل إلى 18.6% مقارنة بأفضل النماذج السابقة.
  • الكفاءة: على عكس النماذج الأخرى التي تشبه الشاحنات الثقيلة والبطيئة، فإن SalFormer360 يشبه سيارة رياضية خفيفة. إنه صغير بما يكفي ليعمل مباشرة على سماعة الواقع الافتراضي دون الحاجة إلى سوبر كمبيوتر في الخلفية. يمكنه إجراء التنبؤ في غض 5 ميلي ثانية فقط (أسرع من رمشة العين البشرية).

أين يواجه الصعوبات (الحالات "التحديّة")

تعترف الورقة البحثية بأن النموذج ليس مثاليًا. فهو يعاني في حالتين محددتين:

  1. الفوضى: إذا كان المشهد مليئًا بالحركة والانفجار ووجود أشياء كثيرة مثيرة للاهتمام في وقت واحد (مثل رحلة في مدينة ملاهي مزدحمة)، فإن النموذج يصاب بالارتباك ويقوم فقط بتخمين "المركز" بدلًا من اختيار النقطة الصحيحة.
  2. المشتتات: إذا كان هناك شعار لامع وماضٍ أو جسم غريب ليس هو التركيز الأساسي، فقد يخدع النموذج ويجعله يعتقد أن المستخدم ينظر إلى ذلك الشيء، حتى لو كان المستخدم ينظر في الواقع إلى الحدث الرئيسي.

الخلاصة

تقدم الورقة البحثية SalFormer360 كوسيلة ذكية وسريعة وفعالة للتنبؤ بمكان نظر مستخدمي الواقع الافتراضي. ومن خلال الجمع بين ذكاء اصطناعي قوي لرصد الأجسام وفهم بسيط للسلوك البشري (أننا نبدأ بالنظر إلى المركز)، فإنه يساعد في بث فيديوهات 360 درجة بسلاسة أكبر، مما يوفر البيانات ويجعل التجربة تبدو أكثر واقعية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →