UrduSpeech: A 156-Hour Urdu Speech Corpus with 12-Dimension Paralinguistic Annotations
تقدم هذه الورقة UrduSpeech، وهو متن صوتي للغة الأردية واسع النطاق وعالي الدقة يحتوي على 156 ساعة من الصوت مع تعليقات توضيحية لغوية مصاحبة ذات 12 بُعداً ومعياراً مرجعياً موحداً، تم تطويره من خلال مسار عمل مدفوع بنماذج اللغات الكبيرة لمعالجة وضع اللغة المحدود في تكنولوجيا الكلام.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل عالم الذكاء الاصطناعي (AI) كمكتبة ضخمة. لسنوات عديدة، تم تزويد هذه المكتبة بكتب باللغات الإنجليزية والماندارين والإسبانية، لكن القسم المخصص للغة الأردية — وهي لغة يتحدث بها أكثر من 230 مليون شخص — كان شبه فارغ. الأمر يشبه محاولة تعليم روبوت التحدث بلغة باستخدام بضع منشورات مبعثرة ومغبرة فقط.
تقدم هذه الورقة البحثية UrduSpeech، وهو "رف كتب" جديد وضخم صُمم لإصلاح هذا الخلل. إليك شرح بسيط لما بناه الباحثون وكيف فعلوا ذلك.
1. المشكلة: لغة تُرِكت خلف الركب
تتميز الأردية بأنها تُكتب من اليمين إلى اليسار (مثل العربية) وغالباً ما تخلط كلمات إنجليزية داخل الجمل (بشكل يشبه الشخص الذي ينتقل بين لهجتين أثناء سرد قصة). وبسبب هذه الخصائص، غالباً ما ترتبك أدوات الذكاء الاصطناعي القياسية، حيث تعامل الأردية كأنها الهندية أو تفشل في فهم متى يغير المتحدث لغته. أراد الباحثون بناء مورد يحترم هذه التحديات المحددة.
2. الحل: "مكتبة صوتية" مدتها 156 ساعة
أنشأ الفريق UrduSpeech، وهو مجموعة من 156 ساعة من الصوت عالي الجودة. ولو أردت وضع ذلك في الاعتبار، فإذا استمعت إليها دون توقف، فسيستغرق الأمر أكثر من ستة أيام لإنهائها.
لم يقوموا بمجرد إلقاء ضوضاء عشوائية في مجلد، بل نظموا هذه المكتبة إلى ثلاثة "غرف" (مجموعات فرعية):
- US-Std: الأردية الباكستانية القياسية (النسخة الرسمية "النموذجية").
- US-CS: الأردية الممزوجة برمز لغوي (حيث يخلط المتحدثون بشكل طبيعي بين الأردية والإنجليزية، مثل قول: "أحتاج إلى chai و coffee").
- US-EngPk: الإنجليزية بلكنة باكستانية.
3. كيف بنوا ذلك: خط إنتاج "الفلتر الذكي"
كان جمع هذه البيانات يشبه محاولة العثور على جواهر محددة وسط كومة من الصخور. قاموا بجمع 200 ساعة من الصوت من الإنترنت (يوتيوب) والأرشيفات القديمة (مثل البرامج التلفزيونية من فترة الثمانينيات). ولتنقية هذه البيانات، استخدموا عملية مكونة من ثلاث خطوات:
- الخطوة 1: ملغي الضجيج: استخدموا أدوات ذكاء اصطنا-ئي لإزالة الضوضاء الخلفية (مثل حركة المرور أو الرياح) وفصل الأصوات المختلفة في المحادثة، لضمان تسجيل المتحدث الرئيسي فقط.
- الخطوة 2: "المحرر الصارم" (LLM): استخدموا ذكاءً اصطناعياً قوياً (Gemini 2.5 Pro) ليعمل كمحرر صارم. تلقى هذا الذكاء تعليمات خاصة: "لا تترجم الكلمات الإنجليزية إلى نص أردي؛ أبقِها كما تُنطق"، و"لا تخلط بين الأردية والهندية". كما تحقق من الصوت بحثاً عن 12 "وسم شعور" (paralinguistics) مختلفاً، مثل عمر المتحدث، والعاطفة، وملمس الصوت (هل هو أجش أم ناعم؟)، واللكنة.
- الخطوة 3: شبكة الأمان البشرية: قبل اعتماد البيانات نهائياً، استمع متحدثون أصليون باللغة الأردية إلى عينات للتأكد من أن الذكاء الاصطناعي لم يرتكب أخطاء. لقد عملوا كفاحصي جودة نهائيين.
4. معيار "الدرجة الذهبية"
لإثبات جودة مكتبتهم، أنشأوا مجموعة "الدرجة الذهبية" ومدتها 9 ساعات. وهي مجموعة صغيرة منتقاة بعناية فائقة تم فحصها وتصحيحها يدوياً من قبل البشر. استخدموا هذه المجموعة لاختبار نماذج النسخ النصي المختلفة.
النتيجة: وجدوا أن معظم نماذج الذكاء الاصطناعي الحالية تعاني مع الأردية، حيث تخطئ في الكلمات أو تخلط بين النصوص. ومع ذلك، فإن النموذج الذي اختاروه (Gemini 2.5 Pro) كان أداؤه أفضل بكثير، حيث تصرف كمتحدث أصلي يفهم الفروق الدقيقة في اللغة.
5. ماذا يوجد داخل المكتبة؟
تحتوي المجموعة النهائية على 71,792 مقطعاً صوتياً منفصلاً. إنها متنوعة للغاية:
- المحتوى: تتضمن كل شيء من الأخبار والدراما إلى الشعر، والمدونات المرئية (vlogs)، وحتى أشكالاً نادرة من الشعر المنطوق مثل "بيت بازي" (Bait-Bazi).
- الأشخاص: تتميز بمزيج متوازن من الرجال والنساء، ومتحدثين من جميع الأعمار، من الأطفال إلى كبار السن.
- الجودة: عندما استمع البشر إلى الصوت، منحوه درجة عالية (4.6 من 5)، مما أكد أن الأصوات واضحة وأن النصوص دقيقة.
6. لماذا هذا مهم؟
فكر في مجموعات بيانات الأردية السابقة كمجرد غرفة صغيرة مغلقة بها بضعة كراسي. UrduSpeech هو قاعة واسعة ومفتوحة بها آلاف المقاعد، مليئة بأشخاص من جميع الخلفيات يتحدثون بكل الطرق التي يتحدثون بها فعلياً.
لقد جعل الباحثون هذه المكتبة مجانية ومفتوحة ليستخدمها أي شخص. ومن خلال توفير هذه البيانات عالية الجودة والمنظمة جيداً، يأملون في مساعدة مطوري الذكاء الاصطناعي على بناء أدوات أفضل لمتحدثي الأردية، لضمان عدم ترك هذه اللغة الرئيسية خلف الركب في المستقبل الرقمي.
باخت مختصر: لقد بنوا مكتبة صوتية ضخمة ومنظمة بدقة للأردية، وأصلحوا الأخطاء التي وقعت فيها أدوات الذكاء الاصطنا الأخرى، وأثبتوا أنه مع العمل الجماعي الصحيح بين الإنسان والآلة، يمكن فهم حتى الكلام المختلط والمعقد بشكل مثالي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.