تقدم هذه الورقة البحثية مسار معالجة للتعلم العميق لمسابقة BirdCLEF 2026 يحقق مراقبة للتنوع البيولوجي متعدد الأصناف رفيعة المستوى في منطقة البانتانال عبر الاستفادة من التدريب المسبق عبر الفئات، وكشف مفارقة غير متوقعة بين جودة المعايرة والوسم الزائف، وتطبيق التنعيم التصنيفي لتحسين تحديد الأنواع عبر 234 نوعاً.
المؤلفون الأصليون:Arunodhayan Sampathkumar, danny kowerko
إن العالم الطبيعي يتحدث، ولكننا، في معظم الأحيان، لا نستمع إليه بتركيز كافٍ. ففي المساحات الرطبة الشاسعة في البانتانال، أكبر منطقة رطبة مدارية في العالم، تتواصل آلاف الأنواع من الطيور والضفادع والحشرات والثدييات عبر الصوت يومياً. ولفهم صحة هذا النظام البيئي، لجأ العلماء إلى المراقبة الصوتية السلبية. وتتضمن هذه الطريقة وضع وحدات تسجيل ذاتية التشغيل في البرية لالتقاط الجوقة المستمرة للحياة. وتنتج هذه الأجهزة تيرابايتات من البيانات الصوتية، وهي كمية هائلة جداً بحيث يصعب على الآذان البشرية فرزها يدوياً. ولتفسير هذا الطوفان من البيانات، يعتمد الباحثون على الذكاء الاصطناعي، وتحديداً نماذج التعلم العميق المدربة على التعرف على البصمات الصوتية الفريدة لمختلف الأنواع. لطالما كان التحدي يكمن في أن هذه النماذج الحاسوبية كانت تُعلّم حصرياً تقريباً الاستماع إلى الطيور. وبينما تعد الطيور صاخبة ومتنوعة، إلا أنها ليست سوى جزء واحد من القصة؛ فالأراضي الرطبة مليئة أيضاً بطنين الحشرات، ونقيق البرمائيات، ونداءات الثدييات، وكلها مؤشرات حيوية على الصحة البيئية، لكنها كانت مهمشة إلى حد كبير من قبل أنظمة الاستماع السابقة.
لقد شرع فريق من الباحثين من جامعة كمنيتس للتكنولوجيا في بناء نظام استماع يمكنه سماع الجوقة بأكملها، وليس الطيور فحسب. لقد دخلوا مسابقة BirdCLEF 2026، وهي تحدٍ عالمي لتحديد 234 نوعاً مختلفاً في البانتانال. كانت هذه المهمة تحديداً صعبة لأن القائمة المستهدفة لم تشمل 162 نوعاً من الطيور فحسب، بل شملت أيضاً 35 نوعاً من الضفادع، و28 نوعاً من الحشرات، و8 أنواع من الثدييات، ونوعاً واحداً من الزواحف. واجه الفريق عقبة كبيرة: كانت بيانات التدريب التي لديهم منحازة بشدة؛ إذ إن ما يقرب من 98 بالمائة من المقاطع الصوتية المصنفة التي تمكنوا من استخدامها لتعليم حواسيبهم كانت أصوات طيور، مما ترك الأنواع الأخرى مع القليل جداً للتعلم منه. ولحل هذه المشكلة، طوروا نهجاً جديداً غير طريقة تعلم الحاسوب للاستماع بشكل جذري. فبدلاً من تدريب نموذجهم على أغاني الطيور فقط، قاموا بتغذيته بمكتبة ضخمة من الأصوات لـ 9,257 نوعاً مختلفاً، بما في ذلك الضفادع والحشرات والثدييات. سمح هذا التعليم الأوسع لـ "دماغ" الحاسوب الأساسي بالتعرف على السمات الصوتية للحياة غير الطيور، مما أدى إلى نظام يمكنه تحديد النطاق الكامل للحياة البرية بدقة ملحوية.
اكتشف الباحثون أن هذا التدريب الأوسع كان العامل الأهم في نجاحهم. فمن خلال تعليم النموذج التعرف على أصوات من خمس مجموعات مختلفة من الحيوانات، حسنوا قدرته على تحديد الأنواع المستهدفة بهامش ملموس مقارنة بالنماذج المدربة على الطيور فقط. وكان هذا أمراً حاسماً لأن ما يقرب من ثلث الأنواع التي احتاجوا للعثور عليها لم تكن طيوراً. وبدون هذا الأساس متعدد الأنواع، افتقر الحاسوب إلى المفردات اللازمة للتمييز بين نقيق الضفدع وأغنية الطائر أو طنين الحشرة. كما كشف الفريق عن درس مفاجئ ومناقض للمنطق حول كيفية تعلم هذه النماذج الحاسوبية من البيانات غير المصنفة. ففي محاولتهم لتعليم الحاسوب باستخدام الكم الهائل من التسجيلات غير المصنفة من الأراضي الرطبة، وجدوا أن النموذج الذي يتميز بثقة عالية ومعايرة جيدة كان في الواقع ينتج مواد تعليمية أسوأ من نموذج أقل ثقة. فالنموذج الأكثر ثقة مال إلى أن يكون شديد الحذر، حيث يعطي احتمالات منخفضة للأصوات غير المؤكدة، مما يؤدي إلى دروس ضعيفة للمرحلة التالية من التعلم. وفي المقابل، كانت التخمينات الأكثر جرأة للنموذج الأقل ثقة أكثر فائدة للتدريب. يشير هذا الاكتشاف إلى أنه في المستقبل، لا يعني جعل النموذج أكثر ثقة دائماً أنه سيكون معلماً أفضل لنفسه.
ولتحسين نتائجهم النهائية، أضاف الفريق خطوة نهائية ذكية لم تتطلب وقتاً إضافياً للتدريب. فقد أدركوا أن الحيوانات في البرية لا تظهر بشكل عشوائي، بل تتبع أنماطاً بناءً على أشجار عائلاتها؛ فمن المرجح أن يوجد نوع معين من الضفادع في نفس الأماكن التي توجد فيها ضفادع أخرى من نفس الجنس. قام الباحثون ببرمجة نظامهم ليقوم بتوجيه توقعاته بلطف بناءً على هذه العلاقات المعروفة. فإذا كان الحاسوب غير متأكد بشأن نقيق ضفدع معين، فإنه ينظر فيما توصل إليه بشأن الضفادع الأخرى في نفس العائلة ويعدل إجابته وفقاً لذلك. هذا التعديل الصغير، الذي يمزج التنبؤ بنوع معين مع متوسط التنبؤ لأقاربه، وفر دفعة ثابتة ومجانية لدقة النظام. وكانت النتيجة النهائية هي نظام حقق مستوى عالياً من الدقة في تحديد الأنواع، محتلاً المركز الثالث بين جميع المشاركات التي لم يتم اختيارها للفوز بالجائزة الكبرى. إن عمل الفريق يثبت أنه لمراقبة التنوع البيولوجي حقاً، يجب أن نعلم آلاتنا الاستماع إلى النظام البيئي بأكمله، وليس فقط إلى أعضائه الأكثر صخباً. ومن خلال توسيع بيانات التدريب لتشمل التنوع الكامل للحياة وفهم غرائب كيفية تعلم هذه النماذج، يمكن للعلماء بناء أدوات تقدم صورة أوضح وأكثر اكتمالاً للعالم الطبيعي.
ملخص تقني: ما وراء الطيور في التدريب المسبق لمراقبة التنوع البيولوجي في البانتانال
بيان المشكلة
يوفر الرصد الصوتي السلبي (PAM) حلاً قابلاً للتوسع لتقييم التنوع البيولوجي، ومع ذلك، لا يزال التعرف الآلي على الأنواع أمراً صعباً في النظم البيئية متعددة الأصناف. يتمثل التحدي المحدد الذي يعالجه هذا العمل في مسابقة BirdCLEF 2026، والتي تستهدف 234 نوعاً عبر خمس فئات تصنيفية (الطيور، البرمائيات، الحشرات، الثدييات، والزواحف) في أراضي البانتانال الرطبة في البرازيل.
تتمثل الصعوبات الجوهرية المحددة فيما يلي:
التعقيد متعدد الأصناف: النماذج الحالية للتعلم العميق تعتمد بشكل أساسى على أصوات الطيور. وهي تفتقر إلى تمثيلات السمات الصوتية اللازمة للتمييز بين نداءات الضفادع، وطنين الحشرات، وأصوات الثدييات، رغم أن الأصناف غير الطيور تشكل 3.08% من الأنواع المستهدفة.
عدم التوازن الشديد في الفئات: مجموعة التدريب المصنفة منحازة بشدة؛ حيث تمثل الطيور 97.9% من المقاطع المصنفة رغم أنها تمثل 69.2% فقط من الأنواع المستهدفة. أما الأصناف غير الطيور وأنماط صوت الحشرات المحددة، فلديها عدد ضئيل جداً أو معدوم من الأمثلة التدريبية المصنفة.
قيود التعلم شبه الموجه: يجب الاستفيد من جزء كبير من بيانات التقييم (10,658 مشهداً صوتياً غير مصنف) عبر التسمية المستعارة (pseudo-labeling)، لكن جودة هذه التسميات حساسة لمعايرة النموذج وعتبات الثقة.
المنهجية
يقترح المؤلفون خط معالجة شامل للتعلم العميق يتضمن تدريباً مسبقاً منهجياً، وتعلمًا شبه موجه، وطرق تجميع (ensemble)، ومعالجة لاحقة.
1. البيانات والمعالجة المسبقة
المدخلات: مقاطع صوتية مدتها 5 ثوانٍ، تمت إعادة أخذ عينات منها بتردد 32 كيلو هرتز، وتحويلها إلى مخططات طيفية لوغاريتمية (log-mel spectrograms) بحجم 256×256.
متن التدريب المسبق الخارجي: لمعالجة نقص بيانات غير الطيور، تم تجميع متن يتكون من 760,008 مقطعاً يمتد عبر 9,257 نوعاً. ويشمل هذا بيانات الطيور من XenoCanto/BirdCLEF وبيانات غير الطيور (البرمائيات، الحشرات، الثدييات، والزواحف) من iNaturalist.
التعزيز (Augmentation): تشمل التقنيات المستخدمة SpecAugment، وXY masking، والترشيح العشوائي، وخلط الضوضاء الخلفية، وخلط التسميات المستعارة الناعمة.
2. بنية النموذج
العمود الفقري (Backbone): نموذج EfficientNetV2-S، تم تهيئته بأوزان ImageNet وضبطه بدقة.
الرأس (Head): رأس كشف الأحداث الصوتية (SED) يتكون من:
GeMFreq Pooling: تجميع متوسط التردد المعمم لتجميع السمات على طول محور التردد.
AttHead: رأس تصنيف قائم على الانتباه مع فروع متوازية للانتباه والتصنيف.
فرع بديل: فرع ProtoSSM يستخدم تضمينات Perch ونموذج حالة فضائية (SSM) ثنائي الاتجاه لالتقاط الاعتمادات الزمنية طويلة المدى.
3. استراتيجية التدريب
التدريب المسبق متعدد الأصناف: يتم أولاً تدريب العمود الفقري مسبقاً على متن خارجي يضم 9,257 نوعاً قبل ضبطه بدقة على بيانات المسابقة.
التعلم شبه الموجه (التسمية المستعارة): يتم توليد تسمات مستعارة ناعمة من المشاهد الصوتية غير المصنفة. وتتمثل إحدى النتائج الحاسمة في "مفارقة جودة المعايرة" (الموضحة أد below)، حيث أنتج نموذج معلم أضعف (AUROC 0.930) بمتوسط ثقة أعلى (0.861) تسميات مستعارة أفضل من نموذج معلم أقوى وأفضل معايرة (AUROC 0.946) بمتوسط ثقة أقل (0.257).
التجميع (Ensemble): يقوم النظام النهائي بدمج تنبؤات من:
عدة متغيرات من EfficientNetV2-S (رأس SED).
نماذج HGUNet-SED.
فرع ProtoSSM. يتم تحسين نسب الدمج (على سبيل المثال، 65/35 لـ SED/ProtoSSO).
4. الاستدلال والمعالجة اللاحقة
التعزيز وقت الاختبار (TTA): يتم تطبيق إزاحات زمنية (إزاحة 2.5 ثانية) لتوليد مقاطع إضافية.
التنعيم التصنيفي (Taxonomic Smoothing): خطوة معالجة لاحقة منخفضة التكلفة تدمج تنبؤات الأنواع الفردية مع متوسط تنبؤات جنسها التصنيفي (α=0.15) وفئتها (α=0.05).
النشر: تم تحويل النماذج إلى تنسيق OpenVINO IR ليعمل على المعالجات المركزية (CPU) فقط للوفاء بقيد وقت التشغيل البالغ 90 دقيقة.
المساهمات الرئيسية
يسلط البحث الضوء على ثلاث مساهمات رئيسية مستمدة من 288 تجربة منهجية:
تدريب العمود الفقري مسبقاً لمتعدد الأصناف: إن توسيع التدريب المسبق من بيانات الطيور فقط إلى متن متنوع يضم 9,257 نوعاً (بما في ذلك غير الطيور) يحقق تحسناً قدره +0.016 AUROC مقارنة بالتدريب المسبق للطيور فقط. وهذا يثبت أن التنوع التصنيفي في التدريب المسبق أكثر فائدة من مجرد زيادة عدد أنواع الطيور.
مفارقة جودة المعايرة: حدد المؤلفون ظاهرة غير متوقعة في توليد التسميات المستعارة: حيث أنتج نموذج معلم أفضل معايرة تسميات مستعارة أقل جودة وأدى إلى تدهور الأداء اللاحق مقارنة بنموذج معلم أقل معايرة ولكنه أكثر ثقة. يشير هذا إلى أن إعادة معايرة الثقة أو "تشكيلها" (sharpening) ضروري قبل عملية التدريب الذاتي التكرارية في مجال الصوتيات الحيوية.
التنعيم التصنيفي: تقنية معالجة لاحقة تستفيد من أنماط التواجد المشترك البيئي المعروفة عبر دمج التنبؤات مع المتوسطات التصنيفية. توفر هذه الطريقة زيادة ثابتة قدرها +0.001 AUROC دون تكاليف تدريب إضافية.
النتائج
حقق الخط المقترح الأداء التالي على لوحات صدارة BirdCLEF 2026:
لوحة الصدارة العامة (Public Leaderboard): AUROC 0.960 (بعد التنعيم التصنيفي).
لوحة الصدارة الخاصة (Private Leaderboard): AUROC 0.959 (بعد التنعيم التصنيفي).
الترتيب: المركز 19 من بين المشاركات المختارة والمركز 3 من بين المشاركات غير المختارة.
أكدت دراسات الاستئصال (Ablation studies) أن التدريب المسبق متعدد الأصناف قدم أكبر مكسب منفرد في الأداء (+0.016)، يليه تجميع البنى المتنوعة وفرع ProtoSSM. أظهر النظام تعميماً قوياً قبل المعالجة اللاحقة، حيث حققت الإعدادات التي تستخدم رأس SED مع TTA واستراتيجية تجميع HGUNet المختلطة درجات متطابقة في لوحة الصدارة العامة والخاصة بلغت 0.959، مما يشير إلى عدم وجود فرط في التخصيص (overfitting) لمجموعة البيانات العامة. ومع ذلك، فإن خطوة التنعيم التصنيفي النهائية، رغم رفعها للدرجة العامة إلى 0.960، قللت قليلاً من الدرجة الخاصة إلى 0.954 (من 0.959 التي تحققت بدون التنعيم)، مما يشير إلى وجود فرط تخصيص طفيف لتوزيع التواجد المشترك للأنواع في مجموعة التقييم العامة.
الأهمية والادعاءات
يزعم المؤلفون أن هذا العمل يقدم إرشادات عملية للمراقبة متعددة الأصناف في تطبيقات الحفاظ على البيئة. وتحديداً:
ما وراء علم الطيور: تثبت النتائج أن تطبيقات الرصد الصوتي السلبي (PAM) التي تتوسع لما وراء مراقبة الطيور، تتطلب تدريباً مسبقاً على بيانات متنوعة تصنيفياً لضمان أداء النموذج.
أفضل الممارسات للتعلم شبه الموجه: يوفر تحديد "مفارقة جودة المعايرة" قاعدة استدلالية جديدة لتصميم خطوط أنابيب التدريب الذاتي، مما يشير إلى أن الثقة الخام قد تكون مقياساً أكثر قيمة لاختيار التسميات المستعارة من مقاييس المعايرة في هذا المجال.
الكفاءة: يوفر التنعيم التصنيفي طريقة مجانية حسابياً لتحسين الدقة من خلال الاستفادة من الأولويات البيئية، وإن كان يتطلب مراعاة دقيقة فيما يتعلق بالتعميم على مجموعات البيانات الخاصة.
يؤكد المؤلفون أن نتائجهم مدعومة بأدلة قابلة للتكرار من دراسات استئصال واسعة النطاق، كما أن جميع الأكواد وأوزان النماذج متاحة علناً لتسهيل الأبحاث المستقبلية.