SQCAFusion: Multi-Scale Scene-Query Cross-Attention for Illumination-Adaptive Infrared and Visible Image Fusion
تقترح هذه الورقة البحثية إطار عمل SQCAFusion، وهو إطار لدمج الصور تحت الحمراء والمرئية متكيف مع الإضاءة، يستخدم آلية الانتباه المتقاطع متعدد المقاييس بين المشهد والاستعلام مع رموز مشهد قابلة للتعلم لتعديل الميزات ديناميكيًا أثناء الترميز المبكر، مما يؤدي إلى حل مشكلات عمى المشهد وتعزيز جودة الدمج تحت ظروف الإضاءة المتغيرة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم الرؤية الآلية، غالبًا ما تكون الكاميرات محدودة بفيزياء الضوء. فالكاميرا القياسية ترى العالم تمامًا مثل العين البشرية، حيث تلتقط ألوانًا غنية وأنسجة دقيقة، لكنها تعاني عندما تغيب الشمس أو يملأ الدخان الأجواء. وفي المقابل، تكتشف الكاميرات الحرارية الحرارة بدلاً من الضوء، مما يسمح لها برؤية الكائنات الحية بوضوح حتى في الظلام الدامس، ومع ذلك فإنها غالبًا ما تنتج صورًا رمادية ضبابية تفتقر إلى التفاصيل الحادة للصورة الفوتوغرافية العادية. ولعقود من الزمن، حاول المهندسون دمج هذين النوعين من الصور في صورة واحدة مثالية تحمل وضوح الصورة النهارية وقدرة جهاز الرؤية الليلية على استشعار الحرارة. وتعد هذه العملية، المعروفة باسم "دمج الصور" (image fusion)، حيوية لكل شيء، بدءًا من المركبات ذاتية القيادة التي تتنقل في الشوارع الضبابية وصولًا إلى المراقبة العسكرية في البيئات المعادية. ومع ذلك، فقد لاحق هذه المحاولات مشكلة مستمرة: معظم البرامج الحاسوبية المصممة لدمج هذه الصور هي برامج "عمياء عن المشهد"؛ فهي تعامل يومًا مشمسًا ساطعًا وليلة شديدة الظلام بنفس الطريقة تمامًا، وتفشل في إدراك أن قواعد دمج الصور يجب أن تتغير اعتمادًا على ظروف الإضاءة. وغالبًا ما تؤدي هذه العمى إلى نتائج حيث تضخم عتمة الليل الضجيج والتشويش، أو حيث تبهت الألوان الزاهية في يوم مشمس، مما يترك الصورة النهائية موحلة ومربكة.
لقد طور فريق من الباحثين في جامعة شنغهاي للهندسة العلوم نهجًا جديدًا لحل هذه المشكلة تحديدًا، حيث أنشأوا نظامًا أطلقوا عليه اسم "SQCAFusion". وبدلاً من الانتظار حتى نهاية العملية لتعديل ظروف الإضاءة، يطلب منهجهم من الكمبيوتر فهم البيئة في بداية العملية تمامًا. تخيل مترجمًا، قبل قراءة كتاب، يتحقق أولاً من وقت اليوم ليقرر ما إذا كان سيستخدم لغة رسمية أو غير رسمية؛ وبالمثل، يقوم هذا النظام الجديد أولاً بتحليل المشهد لتحديد ما إذا كان نهارًا أم ليلًا. ثم يستخدم هذه المعرفة لتوجيه عملية الدمج بنشاط من البداية، بدلاً من مجرد تطبيق إصلاح في النهاية. وقد وجد الباحثون أنه من خلال حقن هذا "الوعي بالمشهد" مباشرة في المراحل المبكرة لاستخراج الميزات، يمكن للكمبيوتر أن يقرر ديناميكيًا مقدار الوزن الذي يعطيه للصورة المرئية مقابل الصورة الحرارية. فإذا كانت الصورة المرئية مظلمة ومليئة بالضجيج، يتعلم النظام الوثوق ببيانات الحرارة أكثر، مع الحفاظ في الوقت نفسه على الحواف الحادة للعالم المرئي. وإذا كان المشهد ساطعًا، فإنه يعطي الأولوية للأنسجة والألوان الغنية للكاميرا القياسية.
يكمن جوهر هذا الابتكار في آلية تعمل كمرشح ديناميكي. ينشئ النظام مجموعة من الرموز الرقمية (tokens) التي تمثل ظروف الإضاءة للمشهد. تعمل هذه الرموز بعد ذلك كاستعلام (query)، تطلب من الكمبيوتر النظر في ميزات الصورة وتقرير أي أجزاء مهمة وأيها مجرد ضجيج. يحدث هذا عبر مستويات متعددة، مما يعني أن النظام يفحص كل من الأشكال العامة للأجسام والتفاصيل الدقيقة للأنسجة في آن واحد. ومن خلال القيام بذلك، يمكن للكمبيوتر كبح الضجيج الحبيبي الذي غالبًا ما يصاحب الصور في الإضاءة المنخفضة دون طمس الأهداف المهمة، مثل المشاة أو المركبات. كما قدم الباحثون استراتيجية تدريب ذكية للتعامل مع صعوبة التعلم من البيانات السيئة. فعندما يتم تدريب الكمبيوتر على صور مظلمة جدًا، يمكن للضجيج أحيانًا أن يخدع عملية التعلم ويجعله يعتقد أن التشويش الحبيبي هو في الواقع حافة أو جسم حقيقي. ولمنع حدوث ذلك، تم تعليم النظام تقليل توقعاته تلقائيًا لجودة الصورة المرئية عندما يكتشف مشهدًا مظلمًا، مما يسمح للنموذج بتجاهل الضجيج مع الاستمرار في التقاط الهيكل الحقيقي للمشهد بأمانة.
تم اختبار نتائج هذا الإطار الجديد مقابل مجموعة واسعة من الأساليب الموجودة باستخدام عدة مجموعات بيانات مختلفة، بما في ذلك مشاهد شوارع حضرية، وسيناريوهات التمويه العسكري، وبيئات الطرق المعقدة. وفي الاختبارات القياسية على مجموعة بيانات تضم أكثر من ألف زوج من الصور، تفوقت الطريقة الجديدة على جميع الخوارزميات الرائدة السابقة في المقاييس الرئيسية للاحتفاظ بالمعلومات والوضوح البصري. لقد نجحت في الحفاظ على مزيد من التفاصيل وإنشاء صور ذات تباين أعلى من منافسيها. ولعل الأمر الأكثر إثارة للإعجاب هو أن النظام أظهر قدرة رائعة على التعميم؛ فعندما اختبره الباحثون على مجموعات بيانات جديدة تمامًا لم يسبق له رؤيتها — تتراوح من مشاهد حركة المرور عالية الدقة إلى الصور الحرارية العسكرية أحادية القناة — لم يحتاج النموذج إلى إعادة تدريب أو تعديل. لقد حافظ على أدائه العالي، منتجًا صورًا واضحة وحادة تحافظ على تميز الأهداف الحرارية مع الاحتفاظ بالمظهر الطبيعي للخلفية. وفي ظروف الإضاءة المنخفضة حيث أنتجت الأساليب الأخرى هالات ضبابية أو فقدت التفاصيل تمامًا، حافظ هذا النهج الجديد على حواف الأجسام حادة والخلفيات نظيفة.
تؤكد الدراسة أن مفتاح تحسين دمج الصور لا يكمن فقط في امتلاك أجهزة قوية، بل في منح البرمجيات القدرة على فهم السياق الذي تعمل فيه. ومن خلال الابتعاد عن النهج الجامد الذي يناسب الجميع والتوجه نحو نظام ديناميكي يتكيف مع ظروف الإضاءة في الوقت الفعلي، ابتكر الباحثون أداة أكثر قوة للتطبيقات في العالم الحقيقي. ويشير العمل إلى أن أنظمة الرؤية المستقبلية ستحتاج إلى أن تكون مدركة للسياق للتعامل مع الطبيعة غير المتوقعة للعالم المادي. وبينما يعتمد النموذج الحالي على فهم شامل للمشهد، يشير الباحثون إلى أن الإصدارات المستقبلية يمكن أن تركز على تفاصيل أدق، مما قد يسمح بالتكيف في الوقت الفعلي في بيئات أكثر تعقيدًا. أما الآن، فإن هذا المنهج يمثل خطوة كبيرة للأمام في جعل الرؤية الآلية موثوقة في الظلام، مما يضمن عدم ضياع التفاصيل الحرجة في الظلال.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.