تقدم هذه الورقة البحثية gQIR، وهو نهج مبتكر يعمل على تكييف نماذج الانتشار الكامنة الضخمة من النص إلى الصورة لإعادة بناء صور عالية الجودة ووفية ضوئياً من كشوفات فوتونية ثنائية، ضئيلة، ومشوشة في وضع الاندفاع لاستشعار SPAD، متفوقاً بشكل كبير على الأساليب الحالية في الظروف القصوى المحدودة الفوتونات.
تخيل أنك تحاول التقاط صورة واضحة وعالية الدقة لسيارة سباق مسرعة، لكن يُسمح لك فقط بالتقاط فوتون واحد أو اثنين (جسيمات ضوئية متناهية الصغر) تصطدم بمستشعر الكاميرا طوال فترة التقاط الصورة.
في العالم الحقيقي، هذا هو ما يحدث مع كاميرات SPAD. هذه المستشعرات فائقة الحساسية تُستخدم للتصوير فائق السرعة (مثل التقاط رصاصة وهي تكسر الزجاج أو محرك نفاث يدور). المشكلة تكمن في أن البيانات الخام التي تنتجها فوضوية للغاية. الأمر يشبه محاولة تجميع أحجية (Puzzle) مكونة من 1000 قطعة، بينما 99% من القطع مفقودة، والقطع الموجودة لديك مغطاة بضجيج إحصائي (Static noise).
تقدم الورقة البحثية تقنية gQIR (إعادة بناء الصور الكمية التوليدية)، وهي طريقة ذكاء اصطائي تعمل كـ "مصور فوتوغرافي خارق" لإصلاح هذه الصور المحطمة. إليك كيف تعمل، مقسمة إلى مفاهيم بسيية:
1. المشكلة: الكاميرا "الجائعة"
فكر في الكاميرا العادية كدلو يجمع المطر. إذا أمطرت بغزارة، ستحصل على دلو ممتلئ (صورة واضحة). أما كاميرا SPAD فهي مثل مكيال صغير جداً في وقت جفاف. هي لا تلتقط سوى قطرات قليلة جداً.
النتيجة: تبدو الصورة الخام كضجيج رقمي أبيض وأسود مشتت. إنها ثنائية (إما حدث اصطدام فوتون أو لم يحدث).
التحدي: لصنع صورة، عليك التقاط "دفقات" (Burst) من آلاف اللقطات الصغيرة والمشوشة هذه ودمجها معاً. ولكن نظرًا لأن الأجسام تتحرك بسرعة كبيرة، فإن القطع لا تتطابق، ولا يوجد ضوء كافٍ لتخمين الشكل الذي يجب أن تبدو عليه الصورة.
2. الحل: "المحقق الفني" (gQIR)
بدلاً من مجرد محاولة تنظيف الضجيج رياضياً (مثل برامج تحرير الصور التقليدية)، يستخدم gQIR ذكاءً اصطناعياً توليدياً (تحديداً نموذجاً تدرب على ملايين الصور من الإنترنت) لـ "تخيل" التفاصيل المفقودة.
فكر في الأمر كالتالي:
الطريقة القديمة: لديك صورة باهتة ومظلمة لكلب. تحاول زيادة حدة البكسلات، فتظل الصورة باهتة.
طريقة gQIR: تعرض الصورة الباهتة والمظلمة للذكاء الاصطناعي وتقول له: "أنا أعرف أن هذا كلب، رغم أنني بالكاد أستطيع رؤيته". فيرد الذكاء الاصطناعي: "حسناً، أنا أعرف كيف تبدو الكلاب. سأقوم بملء تفاصيل الفراء، والعينين، والأنف بناءً على ذاكرتي لملايين الكلبة، مع الحفاظ على الشكل الذي قدمته لي".
3. العملية المكونة من ثلاث مراحل (خط الإنتاج)
بنى المؤلفون مصنعاً من ثلاث مراحل لتحويل هذه الفوضى إلى تحفة فنية:
المرحلة 1: "المترجم" (محاذاة VAE) يتعلم الذكاء الاصطناعي أولاً لغة كاميرا SPAD. يأخذ "النقاط" الثنائية المشوشة ويترجمها إلى تمثيل داخلي نظيف. الأمر يشبه تعليم مترجم يتحدث فقط لغة "الضجيج الإحصائي" كيف يفهم "اللغة الإنجليزية". لقد فعلوا ذلك بعناية حتى لا ينسى الذكاء الاصطناعي ما تعلمه عن الصور الحقيقية (وهي مشكلة تسمى "النسيان الكارثي").
المرحلة 2: "المعزز الفني" (التعزيز الإدراكي) الآن بعد أن أصبحت الصورة نظيفة ولكنها قد تبدو مسطحة، تستخدم هذه المرحلة "خيال" الذكاء الاصطناعي. تقوم بإضافة الحواف الحادة، والقوام، والألوان التي فاتت الكاميرا. الأمر يشبه رساماً ينظر إلى رسم تخطيطي ويضيف لمسات الفرشاة النهائية النابضة بالحياة لجعله يبدو حقيقياً. يتم هذا في خطوة واحدة، مما يجعله سريعاً.
المرحلة 3: "المسافر عبر الزمن" (دمج الدفقات) هذا هو السحر بالنسبة للأجسام المتحركة. تلتقط الكاميرا دفقات من الإطارات (مثل كاميرا التصوير السريع المتتابع).
المشكلة: إذا قمت بمتوسط هذه الإطارات فقط، فستظهر السيارة المتحركة كأنها بقعة مموهة.
الحل: يستخدم gQIR "محولاً" (Transformer) خاصاً (نوع من أنواع عقول الذكاء الاصطناعي) لينظر إلى جميع الإطارات، ويحدد بدقة كيف تحرك الجسم، ويدمجهم بشكل مثالي. الأمر يشبه مخرجاً يأخذ 100 لقطة مختلفة لمشهد ما، ويقوم بتركيبها معاً لإنشاء لقطة واحدة مثالية وسلسة حيث تكون السيارة حادة والخلفية مستقرة.
4. لماذا هذا مهم؟
السرعة: يمكنه إعادة بناء الصور من كاميرات تصور بسرعة 100,000 إطار في الثانية. هذا سريع بما يكفي لرؤية رصاصة في الهواء أو بالون ينفجر.
الألوان: الطرق السابقة كانت تستطيع إنتاج صور بالأبيض والأسود فقط. أما هذه الطريقة فتعالج الألوان من خلال استنتاج النقاط الحمراء والخضراء والزرقاء المفقودة من البيانات المتفرقة.
العالم الحقيقي: اختبروا التقنية في سيناريوهات حقيقية قاسية (مثل إطلاق دبابة لطلقة أو انفجار غاز البروبان) وكانت النتائج أفضل من أي طريقة سابقة، حيث أنتجت صوراً تبدو وكأنها التقطت بكاميرا عادية باهظة الثمن.
الخلا الخلاصة
gQIR يشبه إعطاء فنان معصوب العينين بعض الأدلة المتفرقة وقول: "ارسم صورة واقعية لهذا المشهد". من خلال الجمع بين البيانات الخام من مستشعرات فائقة الحساسية وبين "المنطق السليم" لذكاء اصطناعي ضخم تدرب على الإنترنت، يمكنه إعادة بناء صور ملونة عالية السرعة وجميلة من لا شيء تقريباً. إنه يحول "الضجيج" إلى "فن".
تتناول الورقة التحدي الجوهري المتمثل في إعادة بناء صور عالية الجودة من أعداد فوتونات ضئيلة للغاية، وتحديداً باستخدام مستشعرات الديود الضوئي للانهيار أحادي الفوتون (SPAD).
التحدي: تعمل مستشعرات SPAD في "وضع بيرنولي" (Bernoulli mode)، حيث تسجل قيمًا ثنائية (1 إذا تم اكتشاف فوتون، و0 خلاف ذلك) لكل بكسل في كل تعريض. تهيمن الضوضاء الناتجة عن حركة الفوتونات (shot noise)، وعيوب التكميم (quantization artifacts)، والندرة الشديدة على الإطارات الفردية (quanta frames).
الفجوة: تفشل خطوط المعالجة التقليدية ونماذج التعلم العميق القياسية (المدربة على ضوضاء غاوسية أو بيانات الكاميرات القياسية) في هذا النطاق. فهي لا تستطيع التعامل مع إحصائيات بيرنولي غير الغاوسية، أو الندرة الشديدة، أو التفاعل المعقد بين تقدير الحركة، والمحاذاة، وإزالة الضوضاء المطلوب لـ "دفقات الكوانتا" (quanta bursts) (تسلسلات من الإطارات الثنائية).
الصعوبة المحددة: تعاني الطرق القائمة على التعلم حالياً من صعوبة التعامل مع الحركة فائقة السرعة (تصل إلى 100 ألف إطار في الثانية) والتشوه الشديد، مما يؤدي غالباً إلى ضبابية أو فشل في محاذاة الإطارات. علاوة على ذلك، ركزت الأعمال السابقة بشكل كبير على المستشعرات أحادية اللون؛ بينما تعد إعادة بناء الألوان أكثر صعوبة بسبب ندرة الفوتونات في كل قناة لونية (بسبب مصفوفة CFA).
2. المنهجية: إطار عمل gQIR
يقترح المؤلفون gQIR، وهو إطار عمل ثلاثي المراحل ومنظم يعمل على تكييف نماذج الانتشار الكامنة (Latent Diffusion Models) الضخمة (تحديداً Stable Diffusion) المستخدمة في تحويل النص إلى صورة (T2I) لتناسب مجال محدود الفوتونات.
المرحلة 1: مشفر VAE المتوافق مع الكوانتا (إزالة الضوضاء وإزالة الموزاييك بشكل مشترك)
الهدف: رسم خريطة لمدخلات الكوانتا الموزاييك والثنائية والمشوشة إلى الفضاء الكامن لنموذج انتشار مدرب مسبقاً مع الحفاظ على الدقة الهيكلية.
المشكلة المعالجة: يؤدي الضبط الدقيق القياسي لمشفرات VAE لإزالة التدهور إلى "النسيان الكارثي" (catastrophic forgetting)، حيث يتعلم المشفر "طريقاً مختصراً" لإخراج صورة ثابتة وممهدة بغض النظر عن المدخلات.
الابتكارات الرئيسية:
الترميز المتوسط الحتمي (Deterministic Mean Encoding): بدلاً من أخذ عينات عشوائية من التوزيع اللاحق، يستخدم المشفر المتوسط الحتمي (μ) لتجنب تضخيم التباين الناتج عن ضوضاء الفوتونات.
فقدان محاذاة الفضاء الكامن (LSA Loss): يتم تدريب المشفر على محاذاة التمثيل الكامن للمدخلات المشوشة مع التمثيل الكامن للحقيقة الأرضية (التي يتم إنشاؤها بواسطة مشفر مدرب مسبقاً ومجمد). وهذا يمنع المشفر من الانهيار.
دالة الخسارة: تجمع بين فقدان LSA، وفقدان MSE في مساحة البكسل، والفقد الإدراكي (LPIPS).
المرحلة 2: التعزيز الإدراكي (الضبط الدقيق التنافسي)
الهدف: تحسين عملية إعادة البناء، وتعزيز التفاصيل عالية التردد والواقعية الفوتوغرافية.
النهج:
استخدام LoRA (التحوير منخفض الرتبة) لضبط شبكة U-Net الكامنة لنموذج الانتشار.
استخدام التدريب التنافسي (GAN) لتقطير مقدمة الانتشار متعددة الخطوات إلى مولد ذي خطوة واحدة. وهذا أمر بالغ الأهمية للكفاءة نظراً لمعدلات البيانات الهائلة لمستشعرات SPAD.
يتم تهيئة المولد بأوزان الانتشار المدربة مسبقاً لضمان استقرار تدريب GAN (تدرجات أولية صغيرة).
المرحلة 3: تصوير الدفقات الكامنة (الدمج المكاني الزماني)
الهدف: دمج دفقة زمنية من إطارات الكوانتا في صورة واحدة متماسكة، مع التعامل مع الحركة والمحاذاة.
النهج:
محاذاة الفضاء الكامن: بدلاً من محاذاة البكسلات الخام (التي تكون غير موثوقة بسبب الضوضاء)، تقوم الطريقة بإعادة بناء الإطارات الوسيطة، وتقدير التدفق البصري (باستخدام RAFT)، وتحويل (warp) التمثيلات الكامنة إلى إطار مركزي.
FusionViT: محول (Transformer) مكاني زماني خفيف الوزن (pseudo-3D miniViT) يقوم بدمج التمثيلات الكامنة المحاذية ديناميكياً. وعلى عكس المتوسط البسيط (الذي يسبب الضبابية)، يقوم FusionViT بوزن التمثيلات الكامنة تكيفياً بناءً على الحركة والقرب من الإطار المرجعي.
التعديل المتبقي (Residual Modulation): يتم إضافة التمثيل الكامن المدمج متبقياً (residually) إلى الإطار الكامن المركزي مع تعديل قياسي قابل للتعلم للحفاظ على الاتساق الزماني ومنع انحراف المحتوى.
3. المساهمات الرئيسية
تكييف المقدمات التوليدية: أول نجاح في تكييف نماذج الانتشار الضخمة (Stable Diffusion) مع النطاق المتطرف، المنفصل، والنادر لتصوير دفقات الكوانتا.
إطار عمل ثلاثي المراحل: إطار مبتكر يفصل بين المحاذاة/إزالة الضوضاء (VAE)، والتعزيز الإدراكي (Adversarial LoRA)، والدمج الزماني (FusionViT)، مما يحل بفعالية مقايضة "المحاذاة مقابل إزالة الضوضاء".
مجموعات بيانات جديدة:
أول مجموعة بيانات حقيقية لتدفقات SPAD الملونة.
بنية اختبار مرجعية جديدة لـ الحركة المتطرفة + التشوه (XD) تغطي من 2 ألف إلى 100 ألف إطار في الثانية.
أداء رائد (State-of-the-Art): أظهر تحسناً كبيراً مقارنة بالطرق الكلاسيكية (QBP) والأساليب الحديثة القائمة على التعلم (QUIVER, QuDI) من حيث الدقة والجودة الإدراكية، خاصة تحت الحركة فائقة السرعة.
4. النتائج التجريبية
تم تقييم الطريقة على معايير اصطناعية وبيانات واقعية (بما في ذلك مجموعة بيانات XD الجديدة).
إعادة بناء الإطار الواحد:
يتفوق على النماذج المرجعية المضبوطة بدقة (NAFNet, Restormer) في الجودة الإدراكية (ManIQA, ClipIQA, MUSIQ) مع الحفاظ على دقة تنافسية.
تميل النماذج المرجعية إلى تنعيم الأنسجة عالية التردد؛ بينما يحافظ gQIR على التفاصيل الحادة والملامح الوجهية.
إعادة بناء الدفقات (Burst Reconstruction):
كمياً: في مجموعة بيانات XD (2k–100k fps)، حقق gQIR نسبة PSNR بلغت 30.33 dB، متفوقاً بشكل كبير على QUIVER (20.10 dB) و QBP (12.78 dB).
نوعياً: نجح في إعادة بناء الأنسجة الحادة والهياكل المتماسكة في السيناريوهات المتطرفة (مثل المقذوفات عند 100 ألف إطار في الثانية، كسر الزجاج، ومحركات النفاثات) حيث تفشل الطرق الأخرى أو تنتج ضبابية حركة شديدة.
دراسات الاستئصال (Ablation Studies):
أكدت أن الترميز الحتمي و فقدان LSA ضروريان لمنع انهيار المشفر.
أظهرت أن المرحلة الثالثة (FusionViT) توفر أفضل توازن بين دقة إعادة البناء والاستقرار الزماني (تقليل الوميض/انحراف المحتوى).
التحقق من الواقع: نجح النموذج في إعادة بناء صور من نموذج أولي ملون لـ SPAD بدقة 1 ميجابكسل دون تصحيح صريح لعيوب المستشعر (مثل البكسلات الساخنة)، مع الاحتفاظ بالتدرج الطبيعي للسطوع (vignetting).
5. الأهمية والأثر
تحول جذري: ينقل تصوير الكوانتا من خطوط المعالجة الكلاسيكية المخصصة لمهمة معينة إلى المقدمات التوليدية العامة، مما يثبت أن النماذج واسعة النطاق يمكن تكييفها مع مشاكل الاستشعار الفيزيائية المقيدة وغير الغاوسية.
التصوير فائق السرعة: يتيح التصوير عالي الدقة في مجالات لم يكن من الممكن الوصول إليها سابقاً بالكاميرات التقليدية (مثل التقاط المقذوفات أو الانفجارات بتفاصيل وألوان واضحة).
تقدم تصوير الألوان في SPAD: يحل التحديات الخاصة بإعادة بناء الألوان في البيئات محدودة الفوتونات، وهي خطوة حاسمة نحو كاميرات SPAD ملونة عملية.
الاتجاهات المستقبلية: يشير المؤلفون إلى وجود قيود تتعلق بظروف الإضاءة المنخفضة جداً (PPP ≤ 1) وقدرات HDR، مما يقترح عملاً مستقبلياً على ربط النماذج بعدد الفوتونات وتطوير مشفرات قادرة على التعامل مع HDR.
باختصار، يمثل gQIR طفرة في التصوير الحسابي من خلال الاستفاف من القوة الدلالية والهيكلية للنماذج التوليدية الضخمة لإعادة بناء صور واضحة وواقعية من أقل كمية ممكنة من بيانات الفوتونات.