LGM-Net: Morphology-Guided Multi-scale Representation Learning for Stellera chamaejasme Detection in Complex Grasslands
تقترح هذه الورقة البحثية شبكة LGM-Net، وهي كاشف يعتمد على نموذج YOLOv12n وموجه بالمورفولوجيا، يتميز بوحدات LESE وGSSPAN وMGDHead المبتكرة لمعالجة تحديات مثل تباين الحجم وضعف الحدود بفعالية، محققاً دقة فائقة وأداءً في الوقت الفعلي في اكتشاف نبات Stellera chamaejasme السام ضمن بيئات العشب المعقدة.
في السهول العشبية الشاسعة التي تعصف بها الرياح في هضبة التبت، تدور رحى صراع صامت من أجل البقاء بين الجذور ونصال العشب. هذه النظم البيئية حيوية، فهي تثبت التربة في مكانها، وتنظم المناخ، وتغذي الماشية، لكنها تتعرض للتهديد من غازٍ سام محدد: نبات "ستيلرا شاماياسم" (Stellera chamaejasme). هذا النبات، الذي يُطلق عليه غالباً اسم العشب "السام للذئاب"، يزدهر حيث تعاني المراعي بالفعل. فهو ينتشر بعدوانية، مما يؤدي إلى مزاحمة الأعلاف المغذية وتسميم الحيوانات التي تتناوله. لعقود من الزمن، حاول علماء البيئة رسم خرائط لانتشاره وإدارة نموه، معتمدين على فرق من البشر الذين يسيرون في الحقول لعدّ وتحديد تلك الأعشاب. كانت هذه الطريقة بطيئة، ومرهقة، ومن المستحيل توسيع نطاقها عبر التضاريس الوعرة والشاسعة للهضبة. وفي السنوات الأخيرة، لجأ العلماء إلى الطائرات بدون طيار (الدرونز) والكاميرات لنقل العمل إلى الجو، آملين أن يتركوا مهمة العد للآلات. ومع ذلك، فإن تعليم الكمبيوتر رصد هذه الأعشاب من الأعلى أمر صعب بشكل مفاجئ؛ فغالباً ما تكون النباتات صغيرة، أو مختبئة خلف عشب أكثر طولاً، أو تبدو متطابقة تقريباً مع النباتات غير الضارة المحيطة بها. عندما تحلق طائرة بدون طيار فوق حقل ما، يرى الكمبيوتر مزيجاً فوضوياً من الأنسجة الخضراء، والظلال، والضوء المتغير، مما يجعل من السهل تفويت عشب صغير أو الخلط بين كتلة من العشب ونبات سام.
لقد طور فريق من الباحثين في جامعة تشينغهاي طريقة جديدة لمساعدة الحواسيب على رؤية هذه الأعشاب بوضوح. فقد ابتكروا نظام برمجيات متخصصاً، أطلقوا عليه اسم "LGM-Net"، مصمماً خصيصاً للعثور على نبات "ستيلرا شاماياسم" في الواقع الفوضوي والمعقد للمراعي الحقيقية. وبدلاً من مجرد البحث عن شكل أو لون بسيط، بُني نظامهم لفهم البنية الفيزيائية للنبات؛ فهو يولي اهتماماً دقيقاً للتفاصيل الصغيرة التي تميز العشب: مثل الحافة المسننة لورقة الشجر، وملمس عنقود الزهرة، والطريقة التي يقف بها النبات مقابل الخلفية. لقد درب الباحثون هذا النظام باستخدام آلاف الصور الملتقطة من الأرض ومن طائرات بدون طيار تحلق على ارتفاع منخفض، تغطي ظروفاً جوية مختلفة، وأوقاتاً متباينة من اليوم، ومراحل نمو مختلفة للنبات. لقد علموا البرنامج كيفية تجاهل الضجيج المربك للبيئة والتركيز فقط على السمات المورفولوجية (الشكلية) المحددة — أي الشكل والهيئة — التي تخص ذلك العشب السام.
إن نتائج هذا النهج الجديد كبيرة؛ فعند اختباره على مجموعتهم الخاصة من صور المراعي، حدد النظام العشب بشكل صحيح في ما يقرب من 88 بالمائة من الحالات، وهو تحسن ملحوظ مقارنة بالطرق القياسية السابقة. كما أظهر أداءً جيداً على مجموعة بيانات عامة منفصلة من النباتات الغازية، مما أثبت قدرته على التكيف مع أنواع مختلفة من النباتات والبيئات. وما يجعل هذا النظام فعالاً بشكل خاص هو كيفية تعامله مع المواقف الأكثر صعوبة: عندما يكون العشب مخفياً جزئياً بواسطة نباتات أخرى، أو عندما تكون الإضاءة ضعيفة، أو عندما يكون العشب صغيراً جداً وبعيداً. وفي الاختبارات التي شملت تجمعات كثيفة من الأعشاض حيث تتداخل وتختبئ خلف بعضها البعض، حقق النظام دقة تقترب من 96 بالمائة. لقد تمكن من التمييز بين النبات السام والأعشاب الشبيهة به حتى عندما كانت النباتات في مراحل نمو مختلفة، من الشتلات الصغيرة إلى الأزهار الكاملة.
وجد الباحثون أن نظامهم يعمل من خلال محاكاة الطريقة التي قد ينظر بها خبير بشري إلى المشهد، ولكن بسرعة واتساق لا يمكن للإنسان مضاهاتهما. فهو يقوم أولاً بمسح الصورة للعثين على التفاصيل المحلية الصغيرة مثل الحواف والأنسجة، ثم يدمج تلك التفاصيل مع رؤية أوسع للمشهد لفهم السياق. تسمح هذه العملية المكونة من خطوتين بتصفية الإنذارات الكاذبة الناتجة عن الظلال أو الأعشاب ذات المظهر المشابه. كما أن النظام سريع بما يكفي للعمل في الوقت الفعلي، حيث يعالج الصور بسرعة تسمح للطائرة بدون طيار بمسح حقل وتحديد المناطق الإشكالية فوراً. ورغم أن هذه التكنولوجيا ليست بعد حلاً مثالياً لكل السيناريوهات الممكنة، إلا أن الباحثين أثبتوا أنها قوية بما يكفي للتعامل مع الظروف غير المتوقعة للمراعي عالية الارتفاع. ويقدم هذا العمل أداة عملية لمديري الأراضي الذين يحتاجون إلى مراقبة صحة هذه النظم البيئية، مما يوفر وسيلة للكشف المبكر عن الأعشاب السامة وحماية الماشية والتنوع البيولوجي الذي يعتمد على هذه المناظر الطبيعية الهشة.
ملخص تقني: شبكة LGM-Net للكشف عن نبات Stellera chamaejasme
بيان المشكلة يُعد نبات Stellera chamaejasme عشبًا سامًا مرتبطًا بتدهور شديد في المراعي، مما يشكل تهديدات للتنوع البيولوجي، وسلامة الماشية، واستقرار النظام البيئي. ويعد الكشف الدقيق عنه أمرًا بالغ الأهمية للمراقبة البيئية، ومع ذلك فإنه يواجه تحديات كبيرة في بيئات المراعي المعقدة. تعاني طرق الكشف الحالية من:
تباين الحجم: يظهر النبات بأحجام متفاوتة للغاية اعتمادًا على مرحلة النمو والمسافة.
تشابه الخلفية: تشابه بصري عالٍ في اللون والملمس بين النبات والنباتات الأصلية المحيطة به.
الانسداد والحدود الضعيفة: غالبًا ما تكون الأهداف موزعة بكثافة، أو محجوبة جزئيًا، أو تمتلك حدودًا مجزأة.
التباين البيئي: تؤدي ظروف الإضاءة والتضاريس والطقس المعقدة إلى تدهور تمثيل السمات. تعتبر المسوحات اليدوية التقليدية غير فعالة، بينما تفتقر الاستشعار عن بُعد التقليدي إلى الدقة اللازمة لتحديد الأفراد من النباتات بدقة متناهية. وعلى الرغم من أن نماذج التعلم العميق مثل YOLO قد أظهرت واعدًا، إلا أنها غالبًا ما تعاني من فقدان الكشف وعدم دقة التحديد المكاني عند تطبيقها في هذه الظروف المحددة والصعبة.
المنهجية يقترح المؤلفون LGM-Net، وهو إطار عمل لتعلم التمثيل متعدد المقاييس الموجه بالمورفولوجيا (الشكل الظاهري) بناءً على بنية YOLOv12n. يعامل إطار العمل الكشف عن الأجسام في المراعي المعقدة كعملية تحسين متسلسلة تتضمن الحفاظ على التفاصيل المورفولوجية، والمحاذاة الدلالية عبر المقاييس، والتنبؤ الموجه بالمورفولوجيا. ويتكون من ثلاثة مكونات رئيسية:
الآلية: تقوم بنمذجة التبعيات القنوية العالمية والمعلومات المورفولوجية المحلية متعددة المقاييس بشكل مشترك. وتستخدم فرعًا قنويًا عالميًا (التجميع المتوسط التكيفي + عمليات التلافيف 1×1) وفرعين محليين متوازيين يستخدمان التلافيف بعمق (depthwise convolutions) مع نويات 3×3 و5×5 لالتقاط الأنماط المكانية المتكاملة.
الابتكار: تستخدم آلية قياس متبقي قابلة للتعلم (α) توازن ديناميكيًا بين السمات الدلالية الأصلية والاستجابات المعززة بالانتباه، مما يمنع الاضطراب المفرط للسمات مع الحفاظ على الأنسجة والحواف دقيقة التفاصيل.
عنق الهرم المكاني للانتباه الانتقائي العالمي (GSSPAN):
الآلية: يستخدم DySample لرفع العينات الديناميكي القابل للتعلم لتقليل عدم الاتساق المكاني بين مستويات الهرم. كما يدمج وحدة الانتباه الهرمي المكاني الانتقائي العالمي (GSSPA) التي تجمع بين اختيار القنوات العالمي والإدراك المكاني متعدد المقاييس (باستخدام رسم الخرائط المتطابقة والتجميع المتوسط عند مقاييس مختلفة).
الابتال: تستخدم آلية بوابية قابلة للتعلم توازن ديناميكيًا بين مساهمات الانتباه القنوي والمكاني، مما يضمن الاختيار التكيفي للسمات وتحسين المحاذاة الدلالية عبر المقاييس.
رأس الكشف الموجه بالمورفولوجيا (MGDHead):
الوظيفة: يعزز قوة التنبؤ للأهداف الصغيرة ذات الحدود الضعيفة.
الآلية: يقدم آلية انتباه موجهة بالمورفولوجيا تلتقط الاستجابات القنوية المرتبطة باللون العالمي والأنماط المكانية المرتبطة بالشكل المحلي.
الابتكار: يقوم الرأس بتعزيز الاستجابات البصرية المرتبطة بالمورفولوجيا والأنماط الهيكلية المحلية بشكل تكيفي، مما يقلل من تداخل الخلفية مع تحسين التصنيف والتحديد المكاني للأهداف دقيقة التفاصيل.
المساهمات الرئيسية
إطار العمل: اقتراح إطار عمل لتعلم التمثيل الهرمي الموجه بالمورفولوجيا (LGM-Net) الذي يعالج تدهور المعلومات المورفولوجية وعدم الاتساق الدلالي أثناء انتشار السمات متعددة المقاييس.
وحدة LESE: تطوير وحدة تحسن تمثيل الأهداف الصغيرة، والمحجوبة، والمبهمة مورفولوجيًا من خلال دمج نمذجة القنوات العالمية مع استخراج السمات المحلية متعددة المقاييس.
GSSPAN: تصميم عنق لدمج الميزات متعددة المقاييس يستخدم رفع العينات الديناليكي والانتباه الانتقائي لتعزيز الاتساق الدلالي والمحاذاة المكانية، مما يحسن المتانة للأجسام الكثيفة.
MGDHead: تقديم رأس كشف يعزز استجابات السمات المرتبطة بالمورفولوجيا بشكل تكيفي لتحسين الأداء في الخلفيات المعقدة.
النتائج التجريبية تم تقييم النموذج على مجموعة بيانات Stellera chamaejasme الخاصة بنا (1,721 صورة، تم تعزيزها إلى حوالي 6,800) ومجموعة بيانات النباتات الغازية العامة.
الأداء على مجموعة بيانات Stellera chamaejasme: حققت LGM-Net دقة (Precision) بنسبة 88.7%، واستدعاء (Recall) بنسبة 83.82%، ومتوسط الدقة المتوسطة (mAP50) بنسبة 88.07%. وقد تفوقت بذلك على نموذج YOLOv12n الأساسي (85.11% mAP50) بمقدار 2.96 نقطة مئوية.
الأداء على مجموعة بيانات النباتات الغازية: حققت LGM-Net نسبة mAP50 بلغت 77.42%، متجاوزة YOLOv12n (75.29%) بمقدار 2.13 نقطة مئوية.
الكفاءة: يحافظ النموذج على سرعة استنتاج تبلغ 78±2 إطار في الثانية (FPS) على بطاقة NVIDIA GeForce RTX 5060، مما يلبي متطلبات الوقت الفعلي للفحص بواسطة الطائرات بدون طيار (>30 FPS).
تحليل السيناريوهات: أظهر النموذج متانة عبر الخلفيات المعقدة (84.71% mAP50)، والانسداد الكثيف (95.95% mAP50)، وتغيرات الإضاءة والتضاريس (90.92% mAP50).
دراسات الاستئصال (Ablation Studies): أكدت التجارب أن كل وحدة (LESE، GSSPAN، MGDHead) تساهم بشكل إيجابي، حيث قدمت LESE أكبر مكسب فردي في mAP50. وأظهرت المقارنات مع آليات الانتباه الأخرى (SE، ECA، EMA، CoordAtt) تفوق أداء LESE.
التصور البصري: أشارت تصورات مجال الاستقبال الفعال (ERF) والخرائط الحرارية إلى أن LGM-Net يوسع مجال الاستقبال، ويركز التنشيطات على الهياكل المورفولوجية المستهدفة، ويقلل ضوضاء الخلفية بشكل أكثر فعالية من النموذج الأساسي.
الأهمية والادعاءات يزعم البحث أن LGM-Net يظهر القدرة على المراقبة الفورية للأعشاب السامة وتقييم تدهور المراعي. ومن خلال معالجة تحديات تباين الحجم، وتشابه الخلفية، والحدود الضعيفة عبر التعلم الموجه بالمورفولوجيا، يوفر الأسلوب حلاً قويًا للحماية البيئية والإدارة. ويؤكد المؤلفون أن إطار العمل ينجح في تحقيق التوازن بين دقة الكشف وكفاءة الحوسبة، مما يجعله مناسبًا للنشر على أجهزة الحافة (edge devices) للمراقبة المستمرة لمساحات واسعة.
الاتجاهات المستقبلية يشير المؤلفون إلى أن العمل المستقبلي سيركز على مزيد من تخفيف وزن النموذج (lightweighting) للنشر على أجهزة الحافة، ودمج طرق النمذجة العالمية (مثل Transformers)، ودمج بيانات الاستشعار متعددة الوسائط (المعلومات متعددة الأطياف أو الزمنية) لتعزيز التعميم في سيناريوهات بيئية أوسع.