← أحدث الأبحاث
⚡ electrical engineering

PitchFlower: A flow-based neural audio codec with pitch controllability

يُعد PitchFlower ترميزًا صوتيًا عصبيًا قائمًا على التدفق، يحقق توليدًا صوتيًا عالي الجودة وقابلاً للتحكم في طبقة الصوت من خلال توظيف استراتيجية تدريب تعتمد على تسطيح وإزاحة منحنيات التردد الأساسي (F0) مع التكييف مع الطبقة الحقيقية، مما يؤدي بفعالية إلى فصل طبقة الصوت عن جرس الصوت وتصفية العيوب الناتجة عن بيانات التدريب المتدهورة.

المؤلفون الأصليون: Diego Torres, Axel Roebel, Nicolas Obin

نُشر 2026-09-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Diego Torres, Axel Roebel, Nicolas Obin

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إن الصوت البشري آلة معقدة، قادرة على نقل ما هو أكثر من مجرد الكلمات؛ فهي تنقل نسيجاً غنياً من العواطف، والهوية، والقصد. لعقود من الزمن، سعى العلماء والمهندسون لإيجح طرق للتلاعب بهذه الخصائص رقمياً، آملين في تغيير طبقة صوت المتحدث لتتطابق مع نوتة موسيقية أو تغيير نبرته لتبدو أكثر بهجة، كل ذلك مع الحفاظ على طبيعة الصوت. تعتمد الطرق التقليدية للقيام بذلك على تفكيك الصوت إلى أجزائه الميكانيكية، تماماً كما يحلل صانع الآلات الوترية الخشب والأوتار في كمان. وبينما يمكن لهذه التقنيات القديمة تغيير الطبقة، إلا أنها غالباً ما تترك خلفها جودة آلية واصطناعية، مما يجرد الصوت من دفئه ويجعله يبدو كآلة. وفي السنوات الأخيرة، قدم الذكاء الاصطناعي مساراً جديداً، باستخدام كميات هائلة من البيانات لتعلم كيفية إعادة إنتاج الكلام بواقعية مذهلة. ومع ذلك، ظل تعليم هذه الأنظمة الذكية كيفية تغيير ميزة واحدة محددة، مثل طبقة الصوت، دون تغيير هوية المتحدث أو معنى كلماته عن طريق الخطأ، تحدياً مستعصياً.

لقد طور فريق من الباحثين في معهد "إيركام" (IRCAM) في باريس نظاماً جديداً يسمى "بيتش فلاور" (PitchFlower) يعالج هذه المشكلة باستراتيجية بسيطة بشكل مدهش. كان هدفهم هو إنشاء برنامج ترميز صوتي رقمي (codec) - وهي أداة لضغط وإعادة بناء الصوت - تتيح للمستخدمين تغيير طبقة الصوت بدقة ضبط النغمات الموسيقية، ولكن بالجودة الطبيعية لتسجيل بشري. ولتحقيق ذلك، صمموا عملية تدريب تجبر الذكاء الاصطناعي على فصل مفهوم طبقة الصوت عن كل ما يجعل الصوت مميزاً بهوية صاحبه. وبدلاً من محاولة تعليم النظام التعرف على طبقة الصوت مباشرة، قاموا بتضليله عمداً خلال مرحلة التعلم. فقد أخذوا تسجيلات لأشخاص يتحدثون، وقاموا بتسطيح الارتفاع والانخفاض الطبيعي في أصواتهم، ثم قاموا بتغيير طبقة الصوت عشوائياً للأعلى أو للأسفل قبل تغذية هذا الصوت المعدل في النظام.

كان النظام مكلفاً بمهمة صعبة: كان عليه الاستماع إلى هذا الصوت المسطح والمزاح، ثم إعادة بناء التسجيل الأصلي الطبيعي. وللنجاح في ذلك، مُنح تلميحاً سرياً: طبقة الصوت الحقيقية والأصلية. ومن خلال إجبار النظام على تجاهل طبقة الصوت المشوهة التي يسمعها والاعتماد بدلاً من ذلك على التلميح المقدم، شجع الباحثون الذكاء الاصطناعي على تعلم أن طبقة الصوت هي معلومة منفصلة عن بقية تفاصيل الصوت. وكان الجزء الحاسم في هذا الإعداد هو وجود "عنق زجاجة"، وهو قناة ضيقة يجب أن تمر من خلالها معلومات الصوت. عملت هذه الزجاجة كمرشح، مما منع النظام من مجرد حفظ طبقة الصوت الأصلية وأجبره على الاعتماد على التلميح المقدم لإعادة بناء الصوت. وبمجرد تدريبه، يمكن للنظام أن يأخذ أي صوت جديد، ويسطح طبقة صوته، ثم يستخدم قيمة طبقة صوت محددة لتوجيه عملية إعادة البناء، مما يؤدي فعلياً إلى تغيير نوتة المغني أو نبرة المتحدث دون فقدان النسيج الطبيعي للصوت.

كانت النتائج مذهلة. فعند اختباره مقابل الطرق التقليدية القديمة، أنتج "بيتش فلاور" صوتاً أكثر وضوحاً وطبيعية بشكل ملحوظ، وخالياً من الآثار المعدنية التي غالباً ما تشوب التلاعب الرقمي بالصوت. لقد أدى أداءً يضاهي أكثر طرق الذكاء الاصطناعي تقدماً المتاحة حالياً، ولكن مع ميزة واضحة في سهولة التحكم في طبقة الصوت. وجد الباحثون أنه على الرغم من أن النظام قد تم تدريبه باستخدام صوت تمت معالجته بواسطة تكنولوجيا قديمة وغير مثالية، إلا أن النموذج الجديد تعلم تصفية تلك العيوب. لم يقم النظام بمجرد نسخ عيوب بيانات التدريب الخاصة به؛ بل تعلم كيفية توليد صوت عالي الجودة من الصفر، ليعمل كمنظف قوي يزيل الضجيج مع الحفاظ على الطابع الأساسي للصوت.

كما استكشفت الدراسة سبب نجاح هذه الطريقة من خلال مقارنتها بطرق أخرى لمحاولة فصل ميزات الصوت. فقد اختبروا طرقاً تستخدم حِيلاً رياضية معقدة لإخفاء معلومات طبقة الصوت، وأخرى تعتمد على كميات كبيرة من البيانات الإضافية لتعليم النظام كيف ينبغي أن يكون الكلام. غالباً ما أدت هذه الأسالط البديلة إلى أصوات أقل وضوحاً أو فقدت الهوية الفريدة للمتحدث. في المقابل، أثبتت الطريقة البسيطة المتمثلة في إرباك طبقة الصوت أثناء التدريب، جنباً إلى جنب مع قناة المعلومات الضيقة، أنها الحل الأكثر توازناً. فقد سمحت بتحكم دقيق في طبقة الصوت مع الحفاظ على صوت بشري ومفهوم. وأشار الباحثون إلى أن النظام يعمل بشكل أفضل ضمن نطاق معين من طبقات الصوت، على غرار الحدود الطبيعية للصوت البشري، وأن دفعه بعيداً جداً خارج هذه الحدود قد يؤدي إلى تدهور الجودة.

ولعل الاكتشاف الأكثر أهمية هو مرونة النظام. إن حقيقة قدرته على إنتاج صوت عالي الجودة بعد تدريبه على صوت مشوه وغير مثالي تشير إلى أن نماذج التعلم العميق أكثر قوة مما كان يُعتقد سابقاً. فهي قادرة على تعلم الجوهر الحقيقي للصوت حتى عندما تكون المدخلات تالفة أو متغيرة. يفتح هذا الاكتشاف الباب أمام أدوات مستقبلية يمكنها التلاعب بجوانب أخرى من الكلام، مثل العاطفة أو اللهجة، باستخدام تقنيات مماثلة. ومن خلال إثبات أن استراتيجية الاضطراب البسيطة يمكن أن تفك بفعالية الميزات المعقدة، قدم الباحثون مساراً واضحاً وقابلاً للتوسع لإنشاء تقنيات صوتية أكثر قدرة على التحكم وأكثر طبيعية في الصوت. إن العمل يثبت أنه في بعض الأحيان، تكون الطريقة الأكثر فعالية لتعليم الآلة فهم سمة بشرية معقدة هي أولاً إظهار نسخة مكسورة من تلك السمة وطلب إصلاحها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →