Dual‑Domain Adaptive Fusion with Dynamic Sparse Attention for Low‑Light Image Enhancement
تقترح الورقة البحثية شبكة FDSA-Net، وهي شبكة انتباه متناثرة ديناميكية موجهة بالتردد تدمج كتلة انتباه قائمة على المحاور ووحدة دمج تكيفية متعددة المقاييس ثنائية المجال لتعزيز الصور منخفضة الإضاءة بكفاءة مع الحفاظ على التفاصيل الدقيقة، محققةً أداءً هو الأفضل في فئته (state-of-the-art) في العديد من المعايلات المرجعية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الرؤية الحاسوبية، تعتمد الآلات على الكاميرات لترى العالم، لكن هذه المستشعرات تعاني عندما يخبو الضوء. فغالباً ما تكون الصورة في الإضاءة المنخفضة عبارة عن فوضى طينية من الضجيج والتفاصيل المفقودة، مما يجعل من الصعب على الكمبيوتر التعرف على وجه، أو علامة طريق، أو مركبة متحركة. لعقود من الزمن، حاول العلماء إصلاح ذلك عبر تعليم الحواسيب كيفية تخمين شكل الضوء المفقود. تحاول بعض الطرق تفتيح الصورة عن طريق تمديد نطاق الألوان، بينما تحاول طرق أخرى فصل الضوء الساقط على جسم ما عن لونه الحقيقي. ومع ذلك، غالباً ما تضحي هذه النهج بشيء مقابل آخر: فقد تجعل الصورة أكثر سطوعاً ولكنها تسبب ضبابية في الحواف، أو قد تزيد من حدة التفاصيل ولكنها تُدخل ألواناً غريبة وغير طبيعية. لقد كان التحدي يكمن في إيجاد طريقة لاستعادة صورة مظلمة تكون ساطعة وحادة في آن واحد، دون فقدان الأنسجة الدقيقة التي تجعل المشهد يبدو واقعياً.
اقترح فريق من الباحثين في جامعة آنهوي للعلوم والتكنولوجيا حلاً جديداً لهذه المشكلة، وهو نظام أطلقوا عليه اسم FDSA-Net. فبدلاً من الاعتماد على طريقة واحدة فقط للنظر إلى الصورة، يعامل منهجهم الصورة كشيئين مختلفين في وقت واحد: مجموعة من الأشكال والألوان، ومجموعة من الاهتزازات أو الترددات. في العالم الفيزيائي، يمكن تفكيك كل صورة إلى مكونات ترددية، حيث تمثل الترددات المنخفضة المساحات الواسعة والناعمة مثل جدار أو سماء، بينما تمثل التردبات العالية التفاصيل الدقيقة والحادة مثل ملمس طوبة أو حافة ورقة شجر. وقد وجد الباحثون أن البرامج الحاسوبية الحالية غالباً ما تركز بشكل مفرط على الأشكال وتتجاهل الترددات، أو العكس، مما يؤدي إلى صور تبدو إما ضبابية أو ناعمة بشكل مصطنع. صُمم شبكتهم الجديدة لتولي الاهتمام بكلا الجانبين في آن واحد، مما يضمن أن تكون الصورة النهائية ساطعة، وملونة، وغنية بالتفاصيل.
جوهر هذا النظام الجديد هو طريقة ذكية لتحديد الأجزاء التي تحتاج إلى أكبر قدر من الاهتمام. تخيل حاسوباً يحاول النظر إلى صورة مظلمة؛ فبدلاً من التحديق في كل بكسل (نقطة) بنفس الكثافة، وهو أمر بطيء ومضيع للجهد، يستخدم النظام مرشحاً ديناميكياً للتركيز فقط على الأجزاء الأكثر أهمية. لقد بنى الباحثون آلية يمكنها تحديد عدد التفاصيل الضرورية تلقائياً لجزء معين من الصورة. فإذا كانت المنطقة مظلمة ومليئة بالضجيج، يولي النظام اهتماماً وثيقاً لبعض النقاط الرئيسية لفهم ماهيتها. أما إذا كانت المنطقة واضحة بالفعل، فإنه يقضي وقتاً أقل فيها. هذا النهج "المتفرق" يعني أن الكمبيوتر لا يهدر الطاقة على معلومات هي بالفعل واضحة أو غير ذات صلة. ومن خلال تركيز قوته فقط حيث تشتد الحاجة إليها، يمكن للنظام معالجة الصورة بشكل أسرع وأكثر دقة من الطرق السابقة التي حاولت تحليل كل شيء دفعة واحدة.
وللتعامل مع التفاصيل الدقيقة التي غالباً ما تضيع في الظلام، أضاف الباحثون فرعاً خاصاً لشبكتهم يعمل في مجال التردد. وبينما يتعامل الجزء الرئيسي من الشبكة مع الصورة كصورة قياسية، يقوم هذا الفرع الثاني بتحويل الصورة إلى طيف من الترددات. وهذا يسمح للكمبيوتر برؤية "اهتزازات" الصورة، مما يسهل رصد واستعادة الحواف الصغيرة والحادة التي تحدد معالم المشهد. ثم يأخذ النظام المعلومات من فرع الصورة الرئيسي وفرع التردد ويمزجهما معاً باستخدام وحدة دمج ذكية. تعمل هذه الوحدة مثل "الخلاط"، حيث تجمع بعنابة بين معلومات الإضاءة الواسعة من الفرع الرئيسي والتفاصيل عالية التردد من الفرع الآخر. والنتيجة هي صورة موحدة حيث يتم استعادة السطوع بشكل طبيعي، وتظل الأنسجة الدقيقة حادة وواضحة.
اختبر الباحثون نظامهم الجديد على عدة مجموعات قياسية من الصور منخفضة الإضاءة، بما في ذلك صور ملتقطة ليلاً وصور تم تعتيمها اصطناعياً لمحاكاة الإضاءة الضعيفة. وقارنوا نتائجهم بالعديد من الأساليب الموجودة حالياً، بما في ذلك تلك القائمة على التعلم العميق وتلك التي تستخدم النظريات الرياضية عن الضوء. أظهرت الاختبارات أن نهجهم الجديد أنتج الصور الأكثر وضوحاً. وفي أحد الاختبارات الرئيسية، حققت طريقتهم درجة 24.41 على مقياس السطوع والوضوح، وهي أعلى من أي طريقة أخرى اختبروها. كما سجلت 0.868 على مقياس يقيس مدى تشابه بنية الصورة الجديدة مع النسخة الأصلية الساطعة. وفي المقارنات البصرية، بدت الصور التي أنتجها نظامهم أكثر طبيعية، مع ألوان أفضل وأقل بكثير من العيوب الغريبة أو الضبابية مقارنة بالصور التي أنتجتها الأدوات الرائدة الأخرى.
بينما تبدو النتائج واعدة، يحرص الباحثون على الإشارة إلى أن نظامهم ليس مثالياً بعد لكل حالة. فالطريقة لا تزال تتطلب قدرة حوسبية كبيرة، مما يعني أنها قد لا تكون سريعة بما يكفي للتطبيقات التي تعمل في الوقت الفعلي مثل بث الفيديو المباشر على الهواتف الذكية. بالإضافة إلى ذلك، في بعض البقع شديدة السطوع داخل صورة مظلمة، يمكن للنظام أحياناً جعل الضوء شديداً للغاية، وهي مشكلة تُعرف باسم "الإفراط في التعزيز". وبالرغم من هذه القيود، فإن هذا العمل يفتح مساراً واضحاً للمستقبل. فمن خلال إثبات أن النظر إلى الصورة من خلال عدسات مكانية وترددية معاً، ومن خلال تركيز الانتباه فقط حيث يهم الأمر، يمكن استعادة مشهد من الظلام بمستوى من الدقة كان من الصعب تحقيقه سابقاً. يشير هذا النهج إلى أن مستقبل الرؤية في ظروف الإضاءة المنخفضة لا يكمن فقط في جعل الصور أكثر سطوعاً، بل في فهم الطبقات المعقدة للمعلومات التي تشكل الصورة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.