← أحدث الأبحاث
🤖 AI

Fish Audio S2 Technical Report

تقدم هذه الورقة نظام Fish Audio S2، وهو نظام مفتوح المصدر لتحويل النص إلى كلام يستفيد من مسار تدريب متعدد المراحل لتمكين التوليد متعدد المتحدثين ومتعدد الأدوار مع اتباع التعليمات باللغة الطبيعية، مع توفير أوزان جاهزة للإنتاج ومحرك استدلال فعال يعتمد على SGLang.

المؤلفون الأصليون: Shijia Liao, Yuxuan Wang, Songting Liu, Yifan Cheng, Ruoyi Zhang, Tianyu Li, Shidong Li, Yisheng Zheng, Xingwei Liu, Qingzheng Wang, Zhizhuo Zhou, Jiahua Liu, Xin Chen, Dawei Han

نُشر 2026-03-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Shijia Liao, Yuxuan Wang, Songting Liu, Yifan Cheng, Ruoyi Zhang, Tianyu Li, Shidong Li, Yisheng Zheng, Xingwei Liu, Qingzheng Wang, Zhizhuo Zhou, Jiahua Liu, Xin Chen, Dawei Han

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك ممثلاً صوتياً رقمياً موهوباً للغاية، ولكنه حتى الآن كان مجرد "لاعب بمهارة واحدة فقط". كان بإمكانه قراءة النص بشكل مثالي، ولكن إذا طلبت منه أن يهمس بسر، أو يبدو غاضباً، أو يغير الشخصية في منتصف الجملة، فغالباً ما كان يرتبك أو يبدو آلياً.

Fish Audio S2 هو الترقية التي تحول هذا الممثل الرقمي إلى ممثل "منهجي" حقيقي يمكنه اتباع كل رغباتك، بمجرد التحدث إليه بلغة إنجليزية بسيطة.

إليك تفصيل لكيفية قيامهم بذلك، باستخدام بعض التشبيهات من الحياة اليومية:

1. نظام "الدماغ المزدوج" (البنية التحتية)

تحاول معظم أنظمة الذكاء الاصطناوتي الصوتي القيام بكل شيء في وقت واحد: معرفة ماذا يقال وكيف يقال في آن واحد. الأمر يشبه مطالبة طاهٍ بكتابة وصفة، وتقطيع الخضرووات، وطهي الوجبة كلها في ثانية واحدة. إنه أمر فوضوي وبطيء.

يقسم Fish Audio S2 المهمة إلى دورين متخصصين:

  • الدماغ البطيء (المخرج): هذا الجزء يشبه مخرج الأفلام. يقرأ النص ويقرر الصورة الكبيرة: "حسناً، هذه الجملة يجب أن تُقال همساً"، أو "الآن الشخصية تتحول إلى شرير". هو يتولى التعامل مع المعنى والتدفق.
  • الدماغ السريع (مهندس الصوت): هذا الجزء عبارة عن فني فائق السرعة. يستمع إلى تعليمات المخرج ويقوم فوراً بتوليد الموجات الصوتية الفعلية، مضيفاً التفاصيل الدقيقة مثل الأنفاس، أو بحة الصوت، وتغيرات طبقة الصوت.

من خلال فصل هذه المهام، يمكن للنظام التفكير بعمق في القصة بينما ينتج في الوقت نفسه صوتاً عالي الجودة بسرعة مذهلة.

2. مصنع "الفلتر الذكي" (خط معالجة البيانات)

لتعليم الذكاء الاصطناوي التحدث جيداً، تحتاج إلى ملايين الساعات من التسجيلات الصوتية. لكن الإنترنت مليء بالصوت السيئ: ضوضاء في الخلفية، أصوات متداخلة، وأشخاص يتمتمون.

بدلاً من توظيف آلاف البشر للاستماع إلى كل مقطع، بنى Fish Audio مصنعاً ذاتي التنظيف:

  • مفتش الجودة: روبوت ذكي يستمع إلى الصوت ويرفض فوراً أي شيء يبدو سيئاً (مثل حارس ملهى يمنع الدخول).
  • المترجم: روبوت آخر لا يكتفي بكتابة ما قيل فحسب، بل يصف أيضاً كيف قيل. إذا ضحك شخص بتوتر، يكتب الروبوت: [ضحكة متوترة] بجانب النص مباشرة.

الخدعة السحرية: عادةً ما تكون الروبوتات التي تنظف البيانات مختلفة عن الروبوتات التي تصحح واجبات الذكاء الاصطناعي. استخدم Fish Audio نفس الروبوتات لكليهما. وهذا يعني أن الذكاء الاصطناوي يتم تقييمه بناءً على نفس المعايير التي تعلم منها، لذا لا يصاب بالارتباك بسبب "انزياح التوزيع" (وهي طريقة معقدة لقول إن القواعد تتغير بين مرحلة التعلم ومرحلة الاختبار).

3. "المدرب الصارم" (التعلم المعزز)

بمجرد أن يعرف الذكاء الاصطناوي الأساسيات، فإنه يحتاج لتعلم كيفية اتباع التعليمات المعقدة. هنا يأيد التعلم المعزز (Reinforcement Learning). فكر في هذا كمدرب صارم لا يكتفي بقول "عمل جيد" أو "عمل سيئ".

يستخدم المدرب بطاقة تقييم متعددة الأبعاد:

  1. هل قلت الكلمات الصحيحة؟ (الدقة الدلالية)
  2. هل بدوت طبيعياً؟ (الجودة الصوتية)
  3. هل بدوت كالشخص الصحيح؟ (تشابه المتحدث)

إذا حاول الذكاء الاصطناوي تخطي كلمة أو تجاهل تعليمات مثل "تحدث ببطء"، يقوم المدرب فوراً بخصم النقاط. يتعلم الذكاء الاصطناوي من خلال التجربة والخطأ، محاولاً آلاف الاختلافات حتى يحصل على الدرجة المثالية.

4. النتيجة "فائقة التعبير"

بسبب هذه الترقية، يمكن لـ Fish Audio S2 القيام بأشياء كانت مستحيلة سابقاً بالنسبة للنماذج مفتوحة المصدر:

  • تأثير "الحرباء": يمكنك إعطاؤه نصاً يحتوي على شخصيات متعددة، وسيقوم بتغيير الأصوات بشكل طبيعي في منتصف الجملة دون الحاجة لإعادة بدء عملية التوليد.
  • "نسخة المخرج": يمكنك كتابة تعليمات مثل "قل هذا الجزء وأنت تبكي، ثم انتقل إلى الهمس" وسيفعل ذلك بالضبط. إنه يفهم اللغة الطبيعية، وليس مجرد الأكواد.
  • "عداء الماراثون": يمكنه قراءة فصل كامل من كتاب دون أن يفقد صوته أو يتعب، محافظاً على نفس النبرة والجودة من البداية وحتى النهاية.

5. محرك "السرعة الخارقة"

أخيراً، لم يبنوا عقلاً ذكياً فحسب، بل بنوا سيارة سريعة لتقوده. لقد استخدموا محركاً خاصاً (SGLang) مخصصاً عادةً لروبوتات الدردشة النصية.

  • النتيجة: إنه يولد الصوت بسرعة تجعل الأمر يبدو كالسحر. يمكنك البدء في سماع الصوت في أقل من 100 مللي ثانية (أسرع من رمشة عين الإنسان)، ويمكنه توليد الصوت بسرعة تزيد 5 مرات عن الوقت الفعلي. إنه يشبه امتلاك ممثل صوتي يمكنه تسجيل كتاب صوتي كامل في الوقت الذي تستغرقه لتحضير كوب من القهوة.

الخلاصة

يمثل Fish Audio S2 قفزة كبيرة للأمام لأنه لا يعامل توليد الصوت كمجرد "قراءة نص بصوت عالٍ"، بل كـ تمثيل. من خلال الجمع بين عقل ذكي مكون من جزئين، ومصنع بيانات ذاتي التنظيف، ونظام تدريب صارم، فقد خلقوا ذكاءً اصطناعياً صوتياً مفتوح المصدر، سريعاً، تعبيرياً، ويفهم التعليمات البشرية بشكل أفضل من أي شيء آخر متاح اليوم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →