VoxKnesset: A Large-Scale Longitudinal Hebrew Speech Dataset for Aging Speaker Modeling
تقدم هذه الورقة VoxKnesset، وهي مجموعة بيانات مفتوحة الوصول واسعة النطاق تضم 2,300 ساعة من الخطابات البرلمانية العبرية الطولية الممتدة من عام 2009 إلى 2025، والتي تُستخدم لتقييم وتوضيح تحديات التحقق من هوية المتحدث والتنبؤ بالعمر بمرور الوقت، مما يكشف عن تدهور كبير في أداء النماذج القياسية مع تقدم المتحدثين في العمر.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك صديقاً تعرفه منذ 15 عاماً. إذا طلبت من حاسوب اليوم أن يتعرف على صوته، فسيكون الأمر سهلاً. ولكن إذا طلبت من نفس الحاسوب التعرف عليه باستخدام تسجيل من قبل 15 عاماً، فقد يصاب بالارتباك. لماذا؟ لأن أصوات البشر تتغير مع تقدمهم في العمر، تماماً كما تتغير وجوههم؛ تصبح أعمق، أو أكثر بحّة، أو أكثر نعومة.
معظم الأنظمة الحاسوبية اليوم تتدرب على "لقطات ثابتة"؛ فهي تسمع الصوت مرة واحدة وتفترض أنه لن يتغير أبداً. تقدم هذه الورقة البحثية حلاً لهذه المشكلة: مكتبة ضخمة جديدة من الأصوات تسمى VoxKnesset.
إليك تفصيل ما قام به الباحثون، باستخدام بعض التشبيهات من الحياة اليومية.
1. المشكلة: فجوة "السفر عبر الزمن"
فكر في تقنيات الذكاء الاصطناًعي الصوتي الحالية (مثل سيري أو أليكسا) كأنها مصور فوتوغرافي يلتقط لك صورة واحدة فقط، ثم يحاول التعرف عليك بعد عام. إذا زاد وزنك، أو نبتت لك لحية، أو مجرد تقدمت في السن، فلن تطابق الصورة الواقع.
لسنوات، لم يمتلك العلماء بيانات كافية لتعليم الحواسيب كيف تتغير الأصوات بمرور الوقت. كان لديهم:
- صور عالية الجودة: ولكن صورة واحدة فقط لكل شخص (مثل صور الكتاب السنوي للمدرسة).
- فيديوهات طويلة الأمد: ولكنها كانت مشوشة، صغيرة، أو تفتقر إلى أسماء وأعمار دقيقة مرتبطة بها.
لقد كانوا بحاجة إلى "فيديو بتسريع زمني" (Time-Lapse) للأصوات البشرية يكون دقيقاً وضخماً في آن واحد.
2. الحل: "آلة الزمن البرلمانية"
وجد الباحثون المكان المثالي للحصول على هذه البيانات: الكنيست الإسرائيلي (البرلمان).
لماذا هناك؟
- "المسرح": يتحدث أعضاء البرلمان في نفس الغرفة، وبميكروفونات متشابهة، لعقود من الزمن. إنه بيئة محكومة.
- "طاقم العمل": يوجد مئات من أعضاء البرلمان، وبعضهم يخدم لأكثر من 15 عاماً.
- "النص": تحتفظ الحكومة بسجلات دقيقة وموثقة لمن تحدث، ومتى، وماذا قال بالضبط. لا يوجد تخمين للأعمار من صور مشوشة؛ السجلات رسمية.
لقد بنوا VoxKessaet، وهي مجموعة بيانات تحتوي على 2300 ساعة من الكلام باللغة العبرية لـ 393 شخصاً مختلفاً، تم تسجيلها على مدار 16 عاماً (2009–2025). إنه يشبه امتلاك كاميرا "تايم لابس" على 393 شخصاً مختلفاً، تلتقط أصواتهم من سن الثلاثين وصولاً إلى الثمانين.
3. التجربة: اختبار ذكاء "التقدم في السن" الاصطناعي
أخذ الفريق هذه المكتبة الجديدة واختبر أفضل نماذج الذكاء الاصطناًي الصوتي في العالم ليرى كيف تتعامل مع التقدم في السن. طرحوا ثلاثة أسئلة كبيرة:
أ. هل يستطيع الذكاء الاصطناعي تحديد عمر الشخص؟
- النتيجة: نعم، ولكن بشرط.
- التشبيه: تخيل أنك تحاول تخمين عمر شخص ما من خلال النظر إلى صورة واحدة. قد تصيب. ولكن إذا حاولت تخمين مقدار تقدمه في السن بين صورتين التقطتا بفارق 10 سنوات، فسيصاب الذكاء الاصطناعي بالارتباك.
- الاستنتاج: كان الذكاء الاصطناعي جيداً في تخمين عمر الشخص بناءً على لقطة واحدة (دراسة مقطعية). ولكن إذا سألته عن تتبع التغيير بمرال الوقت، فقد فشل. لم يستطع التمييز بين "الشخص (أ) مسن" وبين "الشخص (أ) أصبح أكبر سناً".
ب. هل يؤدي التقدم في السن إلى كسر أمن الصوت؟
- النتيلة: نعم، بشكل كبير.
- التشبيه: تخيل أن صوتك هو مفتاح لمنزلك. إذا فقدت بعض الوزن أو أصبت بنزلة برد، فقد لا يزال المفتاح مناسباً. ولكن إذا تقدمت في السن 15 عاماً، فقد لا يناسب المفتاح القفل على الإطلاق.
- الاستنتاج: اختبر الباحثون "التحقق من المتحدث" (استخدام الصوت ككلمة مرور). عبر فجوة زمنية مدتها 15 عاماً، تضاعف معدل الخطأ أكثر من مرتين. النظام الذي كان بدقة 98% أصبح أقل موثوقية بكثير. هذه مشكلة كبيرة للبنوك أو أنظمة الأمن التي تعتمد على الهوية الصوتية.
ج. هل يمكننا إصلاح ذلك؟
- النتيجة: نعم، إذا دربنا الذكاء الاصطناًي بشكل مختلف.
- التشبيه: بدلاً من تعليم الذكاء الاصطناًي التعرف على "صورة ثابتة"، علمناه أن يتعرف على "فيلم سينمائي".
- الاستنتاج: عندما قاموا بتدريب نموذج خصيصاً على أزواج من التسجيلات لنفس الشخص (على سبيل المثال: "هذا هو نفس الرجل، بفارق 5 سنوات")، تعلم الذكاء الاصطناًي تتبع عملية الشيخوخة. استطاع أخيراً رؤية "الإشارة الزمنية" — التغييرات الطفيفة التي تحدث مع نمو الإنسان وكبر سنه.
4. لماذا هذا مهم؟
الأمر لا يتعلق فقط بالمتحدثين بالعبرية أو السياسيين. بل يتعلق بمستقبل كيفية تفاعلنا مع الآلات.
- الأمن: إذا كان صوتك هو كلمة مرورك، فنحن بحاجة لمعرفة كيفية تحديث كلمة المرور هذه مع تقدمك في السن، حتى لا يتم قفل حسابك البنكي بعد 10 سنوات.
- الصحة: قد يستخدم الأطباء تحليل الصوت للكشف عن أمراض مثل باركنسون أو ألزهايمر. وللقيام بذلك، يحتاجون لمعرفة كيف يبدو "التقدم الطبيعي في السن" حتى لا يخلطوا بين التغيير الطبيعي والمرض.
- العدالة: معظم الذكاء الاصطناًي يتم تدريبه على الأصوات الشابة. تساعد هذه مجموعة البيانات في جعل الذكاء الاصطناًي يعمل بشكل أفضل لكبار السن، الذين غالباً ما يتم تهميشهم في عالم التكنولوجيا.
الخلاصة
أصدر المؤلفون هذه المجموعة الضخمة من البيانات (VoxKnesset) للجمهور. إنهم يقدمون للعالم "فيديو بتسريع زمني" للأصوات البشرية لمساعدة المهندسين على بناء ذكاء اصطناًي أكثر ذكاءً وشبهاً بالبشر، ذكاء اصطناًي يفهم أننا جميعاً نتغير مع مرور الوقت.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.