Enhancing Hyperspectral Image Prediction with Contrastive Learning in Low-Label Regime
تُظهر هذه الدراسة أن إطار التعلم التبايني ثنائي المراحل يعزز بشكل كبير أداء تصنيف الصور فائقة الطيف أحادية الملصق ومتعددة الملصقات في ظل ظروف ندرة البيانات، مع الحفاظ على دقة قوية حتى مع تقليل بيانات التدريب بنسبة 50% من خلال الاستفادة من ما قبل التدريب ذاتي الإشراف وبنية مبسطة تعمل على تكييف المشفر مع سمات المصنف.
تخيل أنك تحاول تعليم روبوت التعرف على أنواع التضاريس المختلفة — مثل الغابات، والطرق، والحقول — من صور الأقمار الصناعية. عادةً، لتعليم الروبوت، تحتاج إلى مكتبة ضخمة من الصور حيث يقوم إنسان برسم مربعات بعناية حول كل شجرة وطريق وتسميتها. هذا يشبه توظيف فريق من الخبراء لقضاء سنوات في تسمية كل بكسل في الصورة. إنه أمر مكلف، وبطيء، وغالباً ما يكون من المستحيل الحصول على قدر كافٍ من البيانات المصنفة.
تقترح هذه الورقة حلاً ذكياً: علم الروبوت كيف يتعلم بمفرده أولاً، ثم أعطه درساً سريعاً.
إليك كيف تعمل طريقتهم، مقسمة إلى خطوات بسيطة:
1. مرحلة "التعلم الذاتي" (التعلم التبايني)
قبل أن يرى الروبوت أي صورة مصنفة، يدع الباحثون الروبوت ينظر إلى جبل من صور الأقمار الصناعية غير المصنفة.
التشبيه: تخيل أنك تظهر للروبوت صورتين مختلفتين قليلاً لنفس البقعة من الأرض (ربما إحداهما مقلوبة أو مدورة). مهمة الروبوت هي اكتشاف: "مهلاً، هاتان الصورتان تبدوان كشيء واحد!"
الهدف: من خلال القيام بذلك ملايين المرات مع أزواج مختلفة، يتعلم الروبوت الأنماط الجوهرية للعالم. إنه يتعلم أن "الأشجار تبدو كأشجار" و"الطرق تبدو كطرق" دون أن يخبره أحد بأسماء الأشياء. إنه يبني خريطة داخلية قوية لما تبدو عليه الأشياء.
2. مرحلة "الدرس السريع" (الضبط الدقيق)
بمجرد أن يمتلك الروبوت هذه الخريطة الداخلية القوية، يعطيه الباحثون كمية صغيرة من البيانات المصنفة (50% فقط أو حتى أقل مما هو مطلوب عادةً).
التشبيه: الآن، الروبوت يشبه طالباً يعرف بالفعل كيف يقرأ ويكتب (من مرحلة التعلم الذاتي). يحتاج المعلم فقط لإظهار بعض البطاقات التعليمية له مع أسماء الأشياء. ولأن الروبوت يفهم بالفعل الأشكال والأنسجة، فإنه يتعلم الأسماء بسرعة كبيرة.
التحول: وجد الباحثون أنه إذا سمحوا للروبوت بـ "إعادة تعلم" خريطته الداخلية قليلاً أثناء تعلم الأسماء (وهي عملية يسمونها "CL-tune")، فإنه يصبح أفضل. إنه يشبه الطالب الذي يعدل فهمه لـ "الشجرة" ليتطابق تماماً مع تعريف المعلم لـ "شجرة البلوط".
3. نوعان من الاختبارات
اختبر الباحثون هذا على طريقتين مختلفتين للنظر إلى البيانات:
التصنيف الأحادي (لعبة "البكسل المركزي"): ينظرون إلى مربع صغير من الصورة ويسألون: "ما هو الشيء الرئيسي في المركز تماماً؟" (مثلاً: "هذا طريق").
التصنيف المتعدد (لعبة "ماذا يوجد في الصندوق؟"): ينظرون إلى نفس المربع الصغير ويسألون: "ما هي كل الأشياء الموجودة في هذا الصندوق؟" (مثلاً: "هذا الصندوق يحتوي على طريق، وبعض العشب، وظل"). هذا أصعب لأن المشاهد الواقعية تكون فوضوية ومختلطة.
النتائج الكبيرة
نصف البيانات، نفس النتائج: حتى عندما قللوا كمية بيانات التدريب المصنفة إلى النصف (أو أكثر)، كان الروبوت الخاص بهم يؤدي بشكل جيد تماماً مثل الروبوتات الأخرى التي تدربت على كامل البيانات.
أفضل من الطريقة القديمة: تفوقت طريقتهم على الطرق التقليدية التي حاولت تعلم كل شيء من الصفر باستخدام البيانات المصنفة فقط.
"سحر" السياق: عندما قاموا بتصور ما كان الروبوت "يفكر" فيه، رأوا شيئاً مفاجئاً. على الرغم من أنهم لم يخبروا الروبوت أبداً عن الجغرافيا أو الموقع، إلا أن الروبوت قام تلقائياً بتجميع الأشياء التي تنتمي لبعضها البعض. على سبيل المثال، أدرك أن "الظلال" غالباً ما تظهر بالقرب من "المباني" وأن "العشب" يكون بالقرب من "الأشجار". لقد تعلم هذه الروابط الخفية بمجرد النظر إلى الأنماط في البيانات غير المصنفة.
لماذا هذا مهم
تجادل الورقة بأن هذا النهج يمثل تغييراً جذرياً في التصوير الفائق الطيفي (الذي يرى ألواناً أكثر مما تراه العين البشرية). ولأن تصنيف هذه البيانات صعب ومكلف للغاية، فإن القدرة على الحصول على نتائج ممتازة باستخدام نصف البيانات المصنفة فقط تعني أننا نستطيع نشر هذه التقنيات بشكل أسرع وأرخص في العالم الحقيقي.
باختاً: بدلاً من إجبار الطالب على حفظ القاموس قبل أن يتمكن من القراءة، تعلم هذه الطريقة الطالب كيفية التعرف على أشكال الحروف أولاً، بحيث لا يحتاج إلا إلى قاموس صغير جداً لتعلم الكلمات.
ملخص تقني: تعزيز التنبؤ بالصور فائقة الطيف باستخدام التعلم التبايني في ظل ندرة البيانات المصنفة
بيان المشكلة
يواجه تحليل الصور فائقة الطيف (HSI) تحديات كبيرة بسبب ندرة البيانات المصنفة، والبعد العالي للمعلومات الطيفية، وتعقيد تدريب نماذج التعلم العميق. تتطلب أساليب التعلم الخاضعة للإشراف التقليدية غالباً بيانات موسومة واسعة النطاق، وهي عملية مكلفة وتتطلب جهداً بشرياً كبيراً وعرضة للأخطاء. علاوة على ذلك، تركز الأساليب الحالية بشكل أساسي على التصنيف أحادي الملصق على مستوى البكسل، وغالباً ما تهمل التأثير السياقي للبكسلات المجاورة. هذا القصور يمثل مشكلة خاصة في حالات الإشارات الطيفية المختلطة حيث قد يحتوي البكسل الواحد على مواد متعددة، أو في تطبيقات مثل تصنيف غطاء الأرض حيث يكون تحديد أجسام متعددة داخل المشهد أمراً بالغ الأهمية. وبينما أظهر التعلم ذاتي الإشراف (SSL) والتعلم التبايني (CL) نتائج واعدة في الرؤية الحاسوبية، إلا أن تطبيقهما على الصور فائقة الطيف لا يزال غير مستكشف بشكل كافٍ، لا سيما في مهام التصنيف متعدد الملصقات على مستوى الرقعة (patch-level) تحت ظروف البيانات المحدودة.
المنهجية
يقترح البحث إطار عمل للتصنيف يتكون من مرحلتين مبسطتين، يستفيد من التعلم التبايني ذاتي الإشراف لتعزيز الأداء في سيناريوهات نقص البيانات المصنفة.
المرحلة الأولى: التدريب المسبق ذاتي الإشراف يقوم المؤلفون بتدريب مشفر أساسي وشبكة إسقاط باستخدام بيانات غير موسومة.
تعزيز البيانات (Data Augmentation): لكل رقعة مدخلة، يتم إنشاء عرضين معززين (أزواج موجبة) عبر عمليات قلب أفقي وعمودي عشوائية.
البنية الهيكلية: يتكون المشفر من طبقات متصلة بالكامل مع تفعيل ReLU وDropout. يقوم المشفر بخرائط العروض المعززة إلى تمثيلات خفية (h1,h2). وتقوم رأس الإسقاط (رأس مكون من طبقتين متصلتين بالكامل) بخرائط هذه التمثيلات إلى تضمينات متجهة (z1,z2).
الهدف: يتم تدريب النموذج باستخدام دالة خسارة "التقاطع المتدرج الحراري الطبيعي" (NT-Xent). تعمل دالة الخسارة هذه على تعظيم التشابه بين تضمينات العرضين المعززين لنفس الرقعة مع تقليل التشابه مع تضمينات الرقع الأخرى (الأزواج السالبة) ضمن الدفعة (batch).
النتيجة: يتعلم المشفر استخراج ميزات ثابتة وتمييزية من البيانات غير الموسومة دون إشراف صريح للفئات.
المرحلة الثانية: الضبط الدقيق الخاضع للإشراف يتم التخلص من رأس الإسقاط ودمج المشفر المدرب مسبقاً مع مصنف.
استراتيجية التدريب: يقيم المؤلفون سيناريوهين:
CL-tune: يتم إلغاء تجميد طبقات المشفر، مما يسمح بإعادة تدريب الأوزان جنباً إلى جنب مع المصنف باستخدام البيانات الموسومة.
CL-freeze: يتم تجميد طبقات المشفر، ويتم تدريب المصنف فقط.
المهام: يتم تقييم إطار العمل على مهمتين:
التصنيف متعدد الملصقات: يتم تخصيص ملصقات للرقع تشير إلى وجود فئات متعددة (مواد مختلطة).
التصنيف أحادي الملصق: يتم تخصيص ملصق للرقعة بناءً على البكسل المركزي فقط، اتباعاً للممارسات القياسية.
دوال الخسارة: تُستخدم دالة "التقاطع الثنائي المتمركز مع اللوغاريتمات" (Binary Cross Entropy with Logits Loss) للمهام متعددة الملصقات، بينما تُستخدم دالة "التقاطع المتمركز" (Cross-Entropy Loss) للمهام أحادية الملصق.
المساهمات الرئيسية
المتانة تجاه البيانات المحدودة: تثبت الدراسة أن الطريقة القائمة على التعلم التبايني تظل متينة حتى عندما يتم تقليل كمية بيانات التدريب الموسومة بنسبة تصل إلى 50%. تحافظ الطريقة على أداء تنافسي يضاهي التقنيات الخاضعة للإشراف بالكامل المدربة على مجموعات بيانات كاملة.
التصنيف متعدد الملصقات على مستوى الرقعة: يعالج هذا العمل المنطقة غير المستكشفة جيداً المتمثلة في التصنيف متعدد الملصقات على مستوى الرقعة في الصور فائقة الطف. من خلال التدريب على رقع صغيرة تحتوي على مجموعات فرعية من المشهد، تحدد الطريقة مواد متعددة داخل الرقعة، مما يلتقط السياق المكاني ويخفف من تأثير الإشارات الطيفية المختلطة.
أداء أحادي الملصق بدون معالجة مسبقة: تحقق الطريقة دقة تصنيف أحادي الملصق متفوقة على الطرق التقليدية الخاضعة للإشراف والأساليب المرجعية ذاتية الإشراف الأخرى، ولا سيما دون الحاجة إلى تقنيات معالجة مسبقة معقدة مثل تحليل المكونات الرئيسية (PCA) أو الملامح المورفولوجية.
رؤى نوعية حول التمثيلات: من خلال تصور t-SNE، يكشف المؤلفون أن المشفر القائم على التعلم التبايني يلتقط الميزات السياقية والانتقالية (مثل القرب المكاني وتشابه المواد) حتى بدون تدريب صريح على مثل هذه المعلومات. يشير هذا إلى أن النموذج يستكشف ضمناً المعلومات المكانية المتأصلة في البيانات.
النتائج التجريبية
تم التحقق من المنهجية باستخدام أربع مجموعات بيانات عامة: Pavia University (PaviaU)، وSalinas، وHouston 2013، وHouston 2018.
أداء تعدد الملصقات: تفوقت استراتيجية CL-tune بشكل كبير على استراتيجية CL-freeze وعلى ثلاثة نماذج مرجعية خاضعة للإشراف بالكامل (مخططات Iterative وJoint وCascade). في PaviaU وSalinas، حسنت CL-tune الدقة بنسبة 1.73%–4.37% و1.25%–2.46% على التوالي مقارنة بأفضل النماذج المرجعية الخاضعة للإشراف. والأهم من ذلك، عند التدريب على 50% فقط من البيانات الموسومة، حقق نموذج CL-tune دقة مطابقة تقريباً للنماذج الخاضعة للإشراف بالكامل المدربة على 100% من البيانات.
أداء أحادي الملصق: تفوق المصنف القائم على CL على الأساليب الراسخة بما في ذلك HSI-CNN وTRI-CNN وSSCL و3D-CNN. ومن الجدير بالذكر أنه حقق دقة أعلى من طريقة 3D-CNN مع استخدام مجموعة بيانات أصغر بكثير (حوالي 9% من إجمالي العينات الموسومة لـ PaviaU) وبنية أبسط بدون PCA.
تأثير تقليل البيانات: بينما انخفض الأداء طبيعياً مع تقليل البيانات، أظهرت النماذج ذات أحجام التمثيل الخفي الأكبر (64 مقابل 32) قدرة أكبر على الصمود، لا سيما في مجموعات البيانات ذات التنوع الفئوي العالي (PvaniaU، وHouston 2013).
معلم درجة الحرارة (Temperature Parameter): أكدت التجارب أن معلم قياس درجة الحرارة (T) بقيمة 0.1 حقق الدقة المثلى، محققاً التوازن بين ثقة النموذج والقدرة على التعميم.
الأهمية والادعاءات
يزعم البحث أن أهميته الأساسية تكمن في إثبات أن بنية مبسطة ومختصرة، معززة بالتعلم التبايني ذاتي الإشراف، يمكنها بفعالية التغلب على قيود ندرة البيانات الموسومة في التصوير فائق الطيف.
يؤكد المؤلفون أن طريقتهم تقدم بديلاً قابلاً للتطبيق للهياكل المعقدة للتعلم العميق (مثل ResNet) ومسارات المعالجة المسبقة الثقيلة. ومن خلال تمكين إعادة تدريب المشفر جنباً إلى جنب مع المصنف (CL-tune)، يتكيف النموذج في قدراته على استخراج الميزات مع المتطلبات المحددة للمهمة اللاحقة، مما يؤدي إلى تحسين أداء التصنيف. علاوة على ذلك، تشير التحليلات النوعية إلى أن التعلم التبايدي يعزز بطبيعته تعلم التمثيلات التي تشفر العلاقات المكانية والسياقية، مما يعزز قدرة النموذج على التمييز بين الفئات حتى في سيناريوهات الرقع المختلطة والمعقدة. ويُقدم هذا النهج كحل قوي للتطبيقات الواقعية حيث يكون الحصول على مجموعات بيانات موسومة واسعة النطاق أمراً غير عملي.