Detection and Classification of Cetacean Echolocation Clicks using Image-based Object Detection Methods applied to Advanced Wavelet-based Transformations
تقترح هذه الأطروحة وتتحقق من صحة CLICK-SPOT، وهو إطار عمل للتعلم العميق يستفيد من التحويلات القائمة على المويجات بدلاً من المخططات الطيفية التقليدية لتحسين الكشف والتصنيف التلقائي لنقرات صدى الصوت لدى الحيتانيات في البيئات المائية المعقدة والمليئة بالضجيج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول الاستماع إلى محادثة في غرفة مزدحمة وصاخبة حيث يهمس الجميع، ويصرخون، ويصفقون. الآن، تخيل أن هذه المحادثة تحدث تحت الماء، حيث "الأشخاص" هم حيتان قاتلة، و"التصفيق" هو استخدامهم للسونار للصيد والتحدث مع بعضهم البعض.
هذا هو التحدي الذي واجهه كريستوفر هاور في رسالة الماجستير الخاصة به. لقد أراد بناء برنامج كمبيوتر يمكنه الاستماع تلقائيًا إلى تسجيلات صوتية لساعات تحت الماء، والعثور على الأصوات المحددة التي تصدرها الحيتان القاتلة (والتي تسمى "نقرات" - clicks)، ومعرفة أي من هذه الأصوات هو حديث الحوت وأيها مجرد صوت يرتد عن صخرة أو سطح الماء (وهو ما يسمى "صدى" - echo).
إليك قصة كيف فعل ذلك، مقسمة إلى مفاهيم بسيطة.
المشكلة: "عنق الزجاجة البشري"
الحيتان القاتلة كائنات اجتماعية وتستخدم النقرات باستمرار. أحيانًا ينقرون للصيد (مثل نبضة السونار)، وأحيانًا ينقرون لمجرد الدردشة.
- المشكلة: لفهم ما تقوله الحيتان، يحتاج العلماء إلى الاستماع إلى آلاف الساعات من الصوت وتحديد كل نقرة يدويًا.
- الواقع: يستغرق الخبير البشري حوالي 12 ساعة لتصنيف دقيقة واحدة فقط من الصوت. إذا نقرت الحوت 150 مرة في ثانية واحدة، فعلى الإنسان العثور على كل نقرة، وتحديدها، وتقرير ما إذا كانت نقرة أم صدى لكل واحدة منها. الأمر يشبه محاولة عد حبات الرمل على الشاطئ عن طريق التقاطها واحدة تلو الأخرى. إنه أمر مستحيل التنفيذ على نطاق واسع.
الحل: تعليم الكمبيوتر كيف "يرى" الصوت
أدرك كريستوفر أن أجهزة الكمبيوتر بارعة في النظر إلى الصور، لكنها سيئة في الاستماع إلى الموجات الصوتية الخام. لذا، قرر تحويل الصوت إلى صور.
1. العدسات الثلاث (الموجة، المخطط الطيفي، والمخطط الموجي)
فكر في التسجيل الصوتي كقطعة من الموسيقى.
- الموجة (Waveform): تشبه النظر إلى النوتة الموسيقية. تظهر ارتفاع وانخفاض مستوى الصوت بمرور الوقت.
- المخطط الطيفي (Spectrogram): يشبه الخريطة الحرارية. يوضح أي النغمات (الترددات) تعمل في أي وقت. ولكن، هناك عقبة: لا يمكنك رؤية الوقت الدقيق لبدء النغمة والتردد الدقيق في نفس الوقت بشكل مثالي (مثل محاولة التقاط صورة لسيارة سريعة؛ إذا ركزت على السرعة، ستبدو السيارة ضبابية).
- المخطط الموجي (Scalogram) (العدسة السحرية): استخدم كريستوفر خدعة رياضية خاصة تسمى "تحويل الويفلت" (Wavelet Transform). تخيل هذا كـ عدسة كاميرا ذكية تقوم بالتقريب تلقائيًا للأصوات السريعة وعالية النبرة (مثل النقرة) وتبتعد للتركيز على الأصوات البطيئة ومنخفضة النبرة. منح هذا الكمبيوتر صورة أوضح للنقرات الصغيرة التي تحدث في أجزاء من الثانية.
قام بدمج هذه المناظر الثلاثة في صورة ملونة واحدة (الأحمر = الموجة، الأخضر = المخطط الموجي، الأزرق = المخطط الطيفي). بالنسبة للكمبيوتر، لم تكن نقرة الحوت تبدو كصوت؛ بل بدت كقمع ساطع وحاد يبرز من خلفية صاخبة.
العمل التحريلي: YOLO و"الصندوق"
استخدم كريستوفر نظام ذكاء اصطناعي شهير يسمى YOLO (You Only Look Once - تنظر مرة واحدة فقط).
- التشبيه: تخيل أن YOLO هو حارس أمن يراقب حشدًا. مهمته هي رسم صندوق حول أي شخص يبدو مريبًا.
- التحدي: في البداية، كان الحارس كسولاً للغاية. كان يرسم صندوقًا واحدًا ضخمًا حول مجموعة كاملة من الأشخاص (دفقة من النقرات) بدلًا من وضع صندوق حول كل شخص على حدًا.
- الإصلاح: أضاف كريستوفر خطوة "معالجة لاحقة". استخدم أداة رياضية (التدرج من الدرجة الأولى - First Order Gradient) للعثور على "القمم" الدقيقة داخل ذلك الصندوق الضخم. كان الأمر يشبه أخذ ذلك الصندوق الضخم وتقطيعه بحيث يحصل كل شخص على صندوق صغير خاص به.
العقل: المحقق "السياقي"
هذا كان الجزء الأصعب: كيف يعرف الكمبيوتر ما إذا كان الصوت عبارة عن "نقرة" أم "صدى"؟
- المشكلة: الصدى يبدو تمامًا مثل النقرة الأصلية. إنه يشبه سماع صوتك في وادٍ سحيق. إذا سمعت صوتًا واحدًا فقط، فمن المستحيل معرفة ما إذا كان صوتك أم صدى الوادي.
- الخدعة البشرية: يعرف علماء الأحياء أن النقرات تأتي عادةً في نمط إيقاعي (مثل ضربات الطبل)، بينما الأصداء هي مجرد انعكاسات عشوائية.
- خدعة الذكاء الاصطناعي: علم كريستوفر ذكاءً اصطناعيًا ثانيًا، يسمى الغابة العشوائية (Random Forest)، ليكون "محقق السياق". بدلًا من النظر إلى صوت واحد بمعزل عن غيره، نظر هذا المحقق إلى "الجوار".
- السؤال: "هل حدثت نقرة قبل ملي ثانية واحدة (2 مللي ثانية)؟"
- السؤال: "هل هذا الصوت أضعف من الصوت الذي سبقه؟"
- السؤال: "هل يبدو النمط كإيقاع منتظم؟"
- الحكم: إذا كان النمط يتوافق، فهي "نقرة". إذا كان مجرد ارتداد عشوائي، فهو "صدى".
النتائج: من "ربما" إلى "صحيح غالباً"
اختبر كريستوفر نظامه، الذي أسماه CLICK-SPOT، مقابل الطرق القديمة:
- الطرق القديمة (PAMGuard): مثل جهاز كشف المعادن الذي يصدر صوتًا عند كل علبة صودا وكل عملة معدنية. وجد 39% فقط من النقرات الحقيقية بشكل صحيح وكان مرتبكًا جدًا.
- النظام الجديد (CLICK-SPOT): وجد 96% من النقرات بشكل صحيح واستطاع التمييز بين النقرة والصدى بدقة بلغت حوالي 82%.
لماذا هذا مهم؟
قبل هذا، كان على العلماء قضاء سنوات في تصنيف البيانات يدويًا. الآن، يمكنهم معالجة تلك البيانات بشكل أسرع بكثير.
- العقبة: الكمبيوتر بطيء حاليًا. يستغرق 25 دقيقة من وقت الكمبيوتر لتحليل دقيقة واحدة فقط من الصوت. إنه ليس سريعًا بما يكفي للاستماع إلى الحيتات مباشرة أثناء سباحتها بجانب القارب.
- المستقبل: الهدف هو جعله أسرع بحيث يمكن استخدامه على متن قارب في الوقت الفعلي. أيضًا، نظرًا لأن النظام يتعلم التعرف على "أشكال النقرات"، فمن الممكن إعادة تدريبه للاستماع إلى الدلافين، أو حيتان العنبر، أو حتى حيوانات أخرى تستخدم السونار.
باخت-مختصر: بنى كريستوفر عينين رقميتين وعقلًا ذكيًا يمكنهما النظر إلى تسجيل تحت الماء فوضوي، وإيجاد "النبضات" الصغيرة للحيتان القاتلة، ومعرفة ما إذا كانت هذه النقرات هي حديث الحيتان أم أنها مجرد أصداء، مما يوفر على العلماء آلاف الساعات من العمل.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.