Bangla-WhisperDiar: Fine-Tuning Whisper and PyAnnote for Bangla Long-Form Speech Recognition and Speaker Diarization
تقدم هذه الورقة البحثية Bangla-WhisperDiar، وهو نظام قوي يعمل على ضبط نماذج Whisper وPyAnnote من خلال تعزيز البيانات المكثف ومسار معالجة مخصص لتحقيق أداء يضاهي أحدث ما توصل إليه العلم في التعرف على الكلام طويل المدى وتحديد هوية المتحدث باللغة البنغالية، محققاً معدل خطأ في الكلمات قدره 0.2441 ومعدل خطأ في تحديد الهوية قدره 0.2392.
المؤلفون الأصليون:Mohammed Aman Bhuiyan, Md Sazzad Hossain Adib, Samiul Basir Bhuiyan, Amit Chakraborty, Aritra Islam Saswato, Ahmed Faizul Haque Dhrubo, Mohammad Ashrafuzzaman Khan
المؤلفون الأصليون: Mohammed Aman Bhuiyan, Md Sazzad Hossain Adib, Samiul Basir Bhuiyan, Amit Chakraborty, Aritra Islam Saswato, Ahmed Faizul Haque Dhrubo, Mohammad Ashrafuzzaman Khan
تخيل أن لديك تسجيلاً طويلاً وفوضوياً لمحادثة باللغة البنغالية — ربما تكون دراما إذاعية، أو مناظرة إخبارية، أو تجمعاً عائلياً. التسجيل مليء بضجيج الخلفية، وأشخاص يتحدثون في وقت واحد، ولهجات مختلفة. هدفك هو القيام بشيئين:
النسخ (Transcription): تحويل الكلمات المنطوقة إلى نص مكتوب.
تحديد المتحدثين (Speaker Identification): معرفة من قال ماذا ومتى بالضبط.
هذه الورقة البحثية، التي تحمل عنوان "Bangla-WhisperDiar"، هي تقرير من فريق باحثين في جامعة نورت ساوث في بنغلاديش. لقد صمموا نظاماً لحل هاتين المشكلتين خصيصاً للغة البنغالية، وهي لغة غالباً ما يتم تجاهلها من قبل أدوات الذكاء الاصطناوي الضخمة المصممة للغة الإنجليزية.
إليك كيف فعلوا ذلك، مشروحاً عبر تشبيهات من الحياة اليومية:
المشكلتان الرئيسيتان
تخيل التسجيل ككرة ضخمة متشابكة من خيوط الصوف.
المشكلة 1 (ASR - التعرف التلقائي على الكلام): تحتاج إلى فك تشابك الخيوط وكتابة كل كلمة بوضوح.
المشكلة 2 (Diarization - تقسيم المتحدثين): تحتاج إلى فرز الخيوط حسب اللون، لتعرف أي خيط ينتمي إلى "المتحدث أ" وأيها ينتمي إلى "المتحدث ب".
الحل: آلة مكونة من جزأين
الجزء 1: الناسخ (ASR)
بدأ الفريق بعقل اصطناعي جاهز يسمى Whisper (وتحديداً نسخة تم تعديلها مسبقاً لتناسب اللغة البنغالية). ومع ذلك، لم تكن النسخة القياسية مثالية لتسجيلاتهم الطويلة والمحددة والمليئة بالضجيج.
"المعسكر التدريبي" (الضبط الدقيق - Fine-Tuning): تخيل أنك تأخذ طالباً يعرف الأبجدية بالفعل وتضعه في معسكر تدريبي صارم. قام الباحثون بتغذية الذكاء الاصطناعي بآلاف الساعات من الصوت باللغة البنغالية.
"اختبار الضغط" (تعزيز البيانات - Data Augmentation): لجعل الذكاء الاصطناعي قوياً، لم يكتفوا بإعطائه صوتاً نقياً، بل أضافوا له بشكل اصطناعي الضجيج، والصدى، والتردد (مثل التحدث في حمام أو في شارع مزدحم) إلى بيانات التدريب. الأمر يشبه تدريب عداء ماراثون عبر جعله يركض في المطر والطين حتى يتمكن من التعامل مع أي طقس في يوم السباق.
"المحرر" (تطبيع النص - Text Normalization): قد يرتبك الذكως الاصطناعي بشأن الأرقام (على سبيل المثال، كتابة "1990" بدلاً من "تسعة عشر وتسعين"). أضاف الفريق "كتاب قواعد" للذكاء الاصطناعي يجبره على تحويل الأرقام إلى كلمات وتنظيف علامات الترقيم الفوضوية، مما يضمن أن النص النهائي يبدو ككتاب حقيقي.
النتيجة: حقق نظامهم أخطاء أقل بكثير من النسخة القياسية. لقد قللوا معدل الخطأ بشكل كبير، مما يعني أن النص المكتوب أكثر دقة.
الجزء 2: محقق المتحدثين (Diarization)
الآن، احتاج الفريق لمعرفة من يتحدث. استخدموا أداة تسمى PyAnnote، وهي تشبه كاميرا ذكية تكتشف متى يبدأ الناس في الكلام ومتى يتوقفون.
نهج "المتخصص": بدلاً من إعادة تدريب نظام الكاميرا بالكامل، أدركوا أنهم يحتاجون فقط لتعليم الكاميرا التعرف على أنماط الكلام في اللغة البنغالية.
استراتيجية "الاستبدال": أخذوا "عقل" نظام PyAnnote الذي يكتشف مقاطع الكلام واستبدلوه بنسختهم الخاصة، التي دربوا عليها خصيصاً على المحادثات البنغالية. وحافظوا على بقية النظام (الجزء الذي يجمع الأصوات معاً) كما هو تماماً.
"فريق التنظيف" (المعالجة اللاحقة - Post-Processing): أحياناً يصبح الذكاء الاصطناعي مضطرباً ويعتقد أن لحظة صمت قصيرة جداً هي متحدث جديد. أضاف الفريق مرشحاً (فلتر) لتجاهل أي "متحدث" يتحدث لأقل من 0.3 ثانية، مما يزيل هذه الإنذارات الكاذبة.
النتيجة: كان نظامهم أفضل بكثير في فصل الأصوات عن الأدوات القياسية، حيث حدد بشكل صحيح من تحدث ومتى في حوالي 76% من الحالات (بمعدل خطأ قدره 23.92%، وهو تحسن هائل مقارنة بالنموذج الأساسي).
"الخلطة السرية"
ما الذي جعل هذا العمل يعمل بشكل أفضل من مجرد استخدام الأدوات الجاهزة؟
التدريب المخصص: لم يستخدموا الإعدادات الافتراضية فحسب؛ بل غدوا الذكاء الاصطناعي ببيانات بنغالية محددة.
الفوضى المحاكية: من خلال تدريب الذكاء الاصطناعي على صوت مليء بالضجيج والصدى والتشويه، تعلم كيفية تجاهل الفوضى في العالم الحقيقي.
التحرير الذكي: لم يكتفوا بجعل الذكاء الاصطناعي يخرج نصاً خاماً؛ بل أضافوا خطوة "مدقق إملائي" لإصلاح الهلوسة التكرارية (حيث يكرر الذكاء الاصطناوي العبارات) وتوحيد الأرقام.
الخلاصة
نجح الفريق في بناء مسار عمل (Pipeline) يمكنه أخذ تسجيل بنغالي طويل وفوضوي وتحويله إلى نص نظيف مع تسميات دقيقة للمتحدثين.
بالنسبة للنسخ (Transcription): خفضوا معدل الخطأ بنسبة تقارب 30% مقارنة بالنموذج القياسي.
بالنسبة لتحديد المتحدث (Speaker ID): خفضوا معدل الخطأ بأكثر من 40% مقارنة بالنموذج القياسي.
لقد جعلوا الكود الخاص بهم متاحاً للعامة، مما يثبت أنه مع التدريب الصحيح وبعض "اختبارات الضغط"، يمكن للذكاء الاصطناعي التعامل مع تعقيدات اللغة البنغالية بنفس كفاءة تعامله مع اللغة الإنجليزية.
ملخص تقني: Bangla-WhisperDiar
بيان المشكلة
تتناول الورقة تحديين حاسمين في فهم اللغة البنغالية المنطوقة، وتحديداً في سياق التسجيلات الصوتية طويلة المدى:
التعرف الآلي على الكلام (ASR) للغة البنغالية طويلة المدى: تحويل التسجيلات البنغالية الممتدة، والعفوية، ومتعددة المتحدثين إلى نصوص. وتتعقد هذه المهمة بسبب الاختلافات اللهجوية، وأنماط الكلام الحواري، والضوضاء البيئية، والتعقيد المورفولوجي للخط البنغالي.
تجزئة المتحدث (Speaker Diarization): تحديد "من تحدث متى" في التسجيلات الطويلة، والتي غالباً ما تحتوي على تداخل في الكلام وظروف صوتية متغيرة.
على الرغم من الانتشار العالمي للغة البنغالية (التي يتحدث بها أكثر من 230 مليون شخص)، إلا أن اللغة لا تزال تفتقر إلى الموارد الكافية في تكنولوجيا الكلام. فالأنظمة المتطورة عادة ما تكون محسنة للغات عالية الموارد مثل الإنجليزية، مما يؤدي إلى أداء دون المستوى للغة البنغالية، خاصة في البيئات الصوتية المتنوعة والواقعية.
المنهجية
يقترح المؤلفون مساراً كاملاً لكلتا المهمتين، بالاعتماد على الضبط الدقيق (fine-tuning) لنماذج مدربة مسبقاً مع استخدام تعزيز بيانات واسع النطاق ومعالجة مسبقة خاصة بالمجال.
1. مسار التعرف الآلي على الكلام (ASR) للبنغالية طويلة المدى
بُني نظام ASR على بنية Whisper-Medium، وتحديداً النسخة tugstugi_bengaliai-regional-asr_whisper-medium التي تم تدريبها مسبقاً على الكلام الإقليمي البنغالي.
المعالجة المسبقة للبيانات وتقطيعها: يتم تقسيم الصوت طويل المدى (يصل إلى أكثر من ساعة واحدة) إلى قطع غير متداخلة مدة كل منها 25 ثانية، وهو الحد العملي لمشفر (encoder) نموذج Whisper. ولتوليد تسميات الحقيقة الأرضية (ground-truth) لهذه القطع، نفذ المؤلفون خوارزمية محاذاة ضبابية متسلسلة؛ تستخدم نوافذ بحث ثنائية الاتجاه ونسبة تسجيل RapidFuzz لضبط النص الكامل للحقيقة الأرضية مع فرضيات الـ ASR، مع الحفاظ على ترتيب القراءة واستيعاب عمليات الإدراج أو الحذف الطفيفة.
تطبيع النص (Text Normalization): يضمن مسار تطبيع خاص باللغة البنغالية الاتساق، ويشمل ذلك تحويل الأرقام الإنجليزية إلى كلمات بنغالية (مع التعامل مع السنوات التقويمية 1000-2099)، وإزالة رموز Unicode غير البنغالية، ودمج المسافات البيضاء.
تعزيز البيانات (Audio Augmentation): لتحسين المتانة، يتم تطبيق مسار تعزيز عشوائي على 30% من مقاطع التدريب، ويشمل ذلك:
تشويه القص (clipping distortion)، وترشيح تمرير النطاق (لمحاكاة صوت الهاتف)، وتغيير طبقة الصوت (pitch shifting)، وتمديد الوقت.
استراتيجية التدريب: يخضع النموذج لعملية ضبط دقيق لكامل الأوزان (وليس التكيف الموفر للمعلمات مثل LoRA) باستخدام مُحسن 8-bit AdamW لإدارة قيود ذاكرة الفيديو (VRAM). يستخدم التدريب دقة مختلطة (fp16)، وجدول تعلم بتناقص جيب التمام (cosine learning rate schedule)، وفحص التدرج (gradient checkpointing).
الاستدلال والمعالجة اللاحقة: يستخدم الاستدلال البحث الشعاعي (beam search) مع تخزين مؤقت ثابت لـ KV. تتضمن المعالجة اللاحقة تطبيع Unicode، وإزالة الرموز ذات العرض الصفري، وعملية تكرار قائمة على التعبيرات النمطية (regex) لإزالة التكرارات الهلوسية (العبارات متعددة الكلمات، الكلمات المفردة، والـ n-grams).
2. مسار تجزئة المتحدث (Speaker Diarization)
يستخدم نظام التجزئة إطار عمل PyAnnote.Audio، وتحديداً نموذج pyannote/segmentation-3.0.
البنية: يتكون المسار من ثلاث مراحل: التجزئة (كشف أدوار المتحدثين)، وتضمين المتحدث (استخراج تمثيلات المتحدث)، والتجميع (تجميع المقاطع حسب الهوية).
استراتيجية الضبط الدقيق: يتبنى المؤلفون نهج تبديل التجزئة (segmentation-swap)؛ حيث يقومون بضبط مكون التجزئة فقط (الأساس PyanNet) على مجموعة البيانات الموضحة في المسابقة باستخدام PyTorch Lightning، بينما يتم الاحتفاظ بمكونات تضمين المتحدث والتجميع المدربة مسبقاً دون تعديل.
إعداد البيانات: يتم تحويل التسميات إلى تنسيقات PyAnnote القياسية (RTTM, UEM, LST). تتكون مجموعة التدريب من 10 تسجيلات مشروحة يدوياً، مع تخصيص آخر تسجيلين للتحقق من الصحة.
المعالجة اللاحقة: يتم تطبيق مرشح الحد الأدنى للمدة (0.3 ثانية) لإزالة المقاطع القصيرة جداً التي قد تنتج عن سوء تصنيف الضوضاء.
المساهمات الرئيسية
مسار بيانات شامل: تطوير مسار معالجة آلية للصوت البنغالي طويل المدى، يتميز بمحاذاة الحقيقة الأرضية الموجهة بـ ASR عبر المطابقة الضبابية وتطبيع نص خاص باللغة البنغالية.
استراتيجية تعزيز قوية: تنفيذ مجموعة متنوعة من تعزيزات الصوت (الضوضاء، الارتداد، الصدى، التشويه، وتغيير الطبقة/الوقت) المصممة لتحسين مرونة النموذج ضد التدهور الصوتي في العالم الحقيقي.
بروتوكولات الضبط الدقيق:
الضبط الدقيق لكامل أوزان Whisper-Medium لـ ASR، مما يثبت جدوى العمل على وحدات معالجة الرسوميات الاستهلاكية باستخدام محسنات 8-bit.
تقنيات المعالجة اللاحقة: تقديم تقنيات إزالة الهلوسة لـ ASR وتصفية المقاطع القصيرة لتجزئة المتحدث لتعزيز جودة المخرجات.
النتائج
تم تقييم الأنظمة المقترحة باستخدام معيار DL Sprint 4.0 (مجموعة بيانات BengaliLoop).
أداء ASR: حقق النظام المضبوط بدقة معدل خطأ في الكلمات (WER) قدره 24.41% على مجموعة الاختبار. ويمثل هذا تحسناً كبيراً مقارنة بأساس Tugstugi البالغ 34.07%، وانخفاضاً نسبياً قدره 28.4% عن الأساس. ساهمت المعالجة اللاحقة في خفض إضافي من 25.76% إلى 24.41%.
أداء التجزئة: حقق النظام معدل خطأ في التجزئة (DER) قدره 23.92%، وهو انخفاض بنسبة 40.3% مقارنة بأساس PyAnnote المسبق التدريب (40.08%). وقد تفوق هذا على كل من النهج الكلاسيكي القائم على VAD والأساس العصبي المدرب مسبقاً.
الكفاءة: عالج نظام ASR تسجيلاً مدته 3 ساعات و38 دقيقة بعامل وقت حقيقي (RTF) قدره 0.1659 على وحدة GPU T4 واحدة، وتحسن إلى 0.0190 مع تحسين تعدد وحدات GPU. عالجت وحدة التجزئة نفس البيانات بعامل وقت حقيقي قدره 0.1054.
نتائج المسابقة: في مجموعة الاختبار الخاصة، حقق النظام WER بنسبة 24.75% وDER بنسبة 26.13%.
الأهمية والادعاءات
تدعي الورقة أن أهميتها الرئيسية تكمن في إثبات أن التكيف مع المجال أمر بالغ الأهمية للغات منخفضة الموارد مثل البنغالية، حتى عند البدء بنماذج قوية متعددة اللغات.
فعالية الضبط الدقيق: تؤكد النتائج أن الضبط الدقيق على بيانات خاصة بالمجال (الحوار البنغالي) يسد بشكل كبير الفجوة بين النماذج العامة المدربة مسبقاً والاحتياجات التطبيقية المحددة.
الكفاءة الاستراتيجية: يسلط المؤلفون الضوء على أن الضبط الدقيق الانتقائي (فقط مكون التجزئة لتجزئة المتحدث) هو استراتيجية فعالة توازن بين مكاسب الأداء والكفاءة الحسابية، حيث يعمم مكون تضمين المتحدث بشكل جيد عبر اللغات.
جودة البيانات: يؤكد العمل على أن تطبيع النص الخاص باللغة البنغالية والمحاذاة الصارمة للبيانات ضروريان لتقليل ضوضاء التدريب وتحسين اتساق التسميات.
المتانة: توضح الدراسة أن تعزيز البيانات المكثف يمكن أن يحاكي بفعالية الظروف الصوتية في العالم الحقيقي، مما يجعل النماذج قوية ضد الضوضاء والتشويه الموجود في التسجيلات طويلة المدى.
يخلص المؤلفون إلى أنه بينما تظل القيود الحسابية ونقص البيانات المشروحة تحديات قائمة، فإن نهجهم يوفر أساساً قوياً وقابلاً للتوسع لمعالجة الكلام باللغة البنغالية، مع التخطيط لأعمال مستقبلية لاستكشاف بنيات مشتركة لـ ASR-Diarization وضغط النماذج للنشر على الأجهزة الطرفية.