← أحدث الأبحاث
⚡ electrical engineering

OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models

يُعد OmniVoice نموذجاً متطوراً للغاية لتحويل النص إلى كلام متعدد اللغات بأسلوب التعلم الصفري، حيث يتوسع ليشمل أكثر من 600 لغة عبر استخدام بنية غير تكرارية منفصلة بأسلوب نماذج اللغة الانتشارية المبتكرة لربط النص مباشرة بالرموز الصوتية، محققاً وضوحاً فائقاً وتغطية لغوية واسعة من خلال استراتيجية قناع عشوائي لكامل دفتر الرموز والتهيئة المسبقة باستخدام النماذج اللغوية الكبيرة.

المؤلفون الأصليون: Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Povey

نُشر 2026-04-02
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Povey

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد بناء مترجم عالمي لا يكتفي بترجمة النصوص فحسب، بل يمكنه نطقها بصوت أي شخص، في أي مكان، بأكثر من 600 لغة مختلفة. هذا هو هدف OmniVoice، وهو نموذج ذكاء اصطناعي جديد ابتكره باحثون في شاومي (Xiaomi).

إليك قصة كيفية بنائه، مشروحة دون استخدام المصطلات التقنية المعقدة.

1. المشكلة: "رقصة الخطوتين" كانت متعثرة للغاية

قبل ظهور OmniVoice، كانت معظم مولدات الصوت بالذكاء الاصطناعي تعمل مثل سباق التتابع بين عداءين:

  • العداء الأول (المترجم): يأخذ النص ويحوله إلى "مخطط دلالي" تقريبي (مثل خريطة لما يعنيه الجمل).
  • العداء الثاني (المغني): يأخذ ذلك المخطط ويحاول تحويله إلى موجات صوتية فعلية.

العيب: إذا ارتكب العداء الأول خطأً طفيفًا في المخطط، فسيتعين على العداء الثاني العمل بناءً على تعليمات سيئة. والنتيجة هي صوت يبدو آليًا، أو لكنة غريبة. الأمر يشبه محاولة رسم لوحة فنية رائعة بناءً على صورة ضبابية؛ حيث تضيع التفاصيل في المنتصف.

2. الحل: "الفنان المباشر"

يتجاوز OmniVoice عملية سباق التتابع هذه تمامًا. إنه فنان ذو مرحلة واحدة.
بدلاً من تمرير مخطط إلى مغنٍ، ينظر OmniVoice إلى النص والصوت المرجعي، ثم يرسم الموجات الصوتية مباشرة. إنه ينتقل من "النص" \leftarrow "الصوت المثالي" في حركة واحدة سلسة.

3. كيف تعلم التحدث بـ 600 لغة

لتعليم الذكاء الاصطناعي التحدث بـ 600 لغة (بما في ذلك العديد من اللغات النادرة ذات البيانات القليلة جدًا)، كان على الباحثين أن يكونوا أذكياء.

  • المكتبة: لم يكتفوا باستخدام مكتبة واحدة؛ بل بنوا مكتبة ضخمة باستخدام 581,000 ساعة من الملفات الصوتية مفتوحة المصدر. هذا يشبه الاستماع إلى الصوت على مدار الساعة طوال أيام الأسبوع لمدة 66 عامًا متواصلة!
  • خدعة "كتاب الرموز الكامل": تخيل أنك تتعلم عزف البيانو باستخدام 88 مفتاحًا. معظم نماذج الذكاء الاصطناعي تتدرب عبر الضغط على مفتاح واحد في كل مرة، مرارًا وتكرارًا. أما OmniVoice فهو مثل عازف البيانو الذي يضغط على جميع المفاتما الـ 88 معًا بشكل عشوائي أثناء التدريب. هذه الممارسة الفوضوية وعالية السرعة تساعده على تعلم "موسيقى" اللغة بشكل أسرع وأكثر كفاءة.
  • بداية "الدماغ الذكي": عادة ما يكون تعليم ذكاء اصطناعي جديد مثل تعليم طفل الكلام من الصفر. لكن OmniVoice بدأ بـ "دماغ" مُدرب مسبقًا (نموذج لغوي كبير، أو LLM) يعرف بالفعل كيف تعمل اللغة البشرية. الأمر يشبه استئجار ممثل محترف للقيام بدور جديد بدلاً من تدريب طفل رضيع. وهذا يضمن أن يبدو الصوت طبيعيًا وأن تُنطق الكلمات بشكل صحيح، حتى في اللغات التي لم يرها الذكاء الاصطناعي كثيرًا من قبل.

4. القوى الخارقة

ليس OmniVoice مجرد صندوق صوت؛ بل هو أداة متعددة الاستخدامات:

  • إلغاء الضجيج: إذا أعطيته تسجيلًا يبدو وكأنه سُجل في حديقة عاصفة، يمكن لـ OmniVoice "تنظيف" الصوت وجعله يبدو كما لو تم تسجيله في استوديو هادئ. إنه يفصل الشخص عن الضجيج.
  • مصمم الأصوات: إذا لم يكن لديك تسجيل لشخص ما، يمكنك فقط كتابة: "صوت عميق وغاضب لرجل في الستين من عمره". يمكن لـ OmniVoice إنشاء هذا الصوت من الصفر.
  • إصلاح "اللكنة": إذا تعثر الذكاء الاصطناعي في كلمة صعبة (مثل حرف صيني له عدة نطق)، يمكنك تزويده بـ "ورقة غش صوتية"، وسينطقها بشكل صحيح في كل مرة.

5. النتائج

عندما اختبروا OmniVoice مقابل أفضل أدوات الصوت التجارية (مثل ElevenLabs) ونماذج الذكاء الاصطناعي الرائدة الأخرى:

  • وضوح النطق: تحدث بوضوح في كل لغة تقريبًا تم اختبارها.
  • التشابه: بدا مشابهًا بشكل مذهل للشخص الذي يحاكيه.
  • التغطية: هو أول نموذج ينجح في التعامل مع أكثر من 600 لغة في نظام واحد، مما يسد الفجوة للغات المئات التي تم تجاهلها سابقًا من قبل التكنولوجيا.

الخلا الخلاصة

OmniVoice يشبه منح صوت للعالم. من خلال تجاوز العملية القديمة المتعثرة المكونة من خطوتين، واستخدام نهج "مباشر إلى الصوت" مدرب على مكتبة ضخمة ومتنوعة من البيانات المفتوحة، نجح في إنشاء نظام يمكنه التحدث بأي لغة تقريبًا، وبأي صوت، بجودة عالية. إنها قفزة هائلة نحو جعل تكنولوجيا الكلام عالمية حقًا.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →