← أحدث الأبحاث
⚡ electrical engineering

In-Sync: Adaptation of Speech Aware Large Language Models for ASR with Word Level Timestamp Predictions

تقدم هذه الورقة طريقة لتكييف النماذج اللغوية الكبيرة المدركة للكلام للتنبؤ بالطوابع الزمنية على مستوى الكلمة مباشرةً إلى جانب النصوص باستخدام استراتيجيات تدريب مبتكرة خفيفة الوزن، مما يحسن دقة المحاذاة وأداء التعرف التلقائي على الكلام بشكل عام.

المؤلفون الأصليون: Xulin Fan, Vishal Sunder, Samuel Thomas, Mark Hasegawa-Johnson, Brian Kingsbury, George Saon

نُشر 2026-04-28
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Xulin Fan, Vishal Sunder, Samuel Thomas, Mark Hasegawa-Johnson, Brian Kingsbury, George Saon

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تشاهد فيلماً مع ترجمة نصية. من الناحية المثالية، يجب أن تظهر الكلمات على الشاشة في اللحظة ذاتها التي ينطق فيها الممثل بها، تماماً بالملي ثانية. إذا كانت الترجمة سريعة جداً، فإنها تفسد عنصر المفاجأة؛ وإذا كانت بطيئة جداً، فإنها تبدو غير متصلة بالواقع.

في عالم الذكاء الاصطناعي، "التعرف التلقائي على الكلام" (ASR) هو التقنية التي تحول الكلمات المنطوقة إلى نص. تقليدياً، يقوم الذكاء الاصطناعي بذلك عبر خطوتين منفصلتين وثقيلتين: أولاً، يستمع إلى ما قيل (النسخ النصي)، ثم تحاول أداة ثانية منفصلة "تخمين" متى قيلت كل كلمة (المحاذاة).

هذه الورقة البحثية، التي تحمل عنوان "IN-SYNC"، تقترح طريقة تجعل الذكاء الاصطناعي يفعل الأمرين معاً في نفس الوقت، وبإيقاع مثالي.

المشكلة: صراع "الدماغين"

فكر في الطريقة التقليدية كشخص يحاول كتابة مذكرات بينما يصرخ شخص آخر في أذنه: "مهلاً! أخبرني بالضبط في أي ثانية كتبت تلك الكلمة!". ينشغل الكاتب عن الكتابة، ويرتكب أخطاءً إملائية، ويكون التوقيت دائماً غير دقيق قليلاً لأن المهمتين تتصارعان على الانتباه.

عندما حاول الباحثون تعليم الذكاء الاصطناعي القيام بالأمرين معاً، واجهوا حالة من "شد الحبل". فكان الذكاء الاصطناعي يركز بشدة على الساعة (الطوابع الزمنية) لدرجة أنه يبدأ في ارتكاب أخطاء في الكلمات الفعلية (النسخ النصي)، أو العكس صحيح.

الحل: برنامج التدريب "In-Sync"

ابتكر الباحثون في IBM وUIUC ثلاث "تمارين تدريبية" ذكية لمساعدة الذكاء الاصطناعي على إتقان كلا المهمتين دون أن يتعثر في نفسه:

1. عداء الماراثون (تعزيز طول الكلام)
تخيل أنك تعلم طفلاً كيفية معرفة الوقت، لكنك لا تريه سوى ساعة تظهر الدقائق فقط. سيكون بارعاً في قول "إنها الخامسة بعد خمس دقائق"، لكنه سيضيع تماماً عندما تسأله عن الوقت بعد ثلاث ساعات.
معظم بيانات تدريب الذكقة الاصطناعي تستخدم مقاطع قصيرة، لذا يتعلم الذكاء الاصطناعي "الأوقات القصيرة" فقط. قام الباحثون بـ "لصق" المقاطع الصوتية معاً لإنشاء "ماراثونات" أطول. هذا علّم الذكاء الاصطناعي كيفية تتبع الوقت حتى أثناء الخطابات الطويلة والمتواصلة.

2. السلم الموسيقي (تنظيم تضمين الطابع الزمني)
فكر في الطوابع الزمنية مثل النوتات على البيانو. لا تتوقع من أغنية أن تقفز من نوتة منخفضة جداً إلى نوتة عالية جداً وتعود مجدداً بشكل فوري؛ فالموسيقى تتدفق بترتيب منطقي.
أجبر الباحثون الذكاء الاصطناعي على التعامل مع الوقت كسلم موسيقي سلس. لقد أضافوا قاعدة تقول: "إذا حدثت الكلمة (أ) في الثانية 1 والكلمة (ب) في الثانية 2، فيجب أن تتبع الكلمة (ج) ذلك التدفق التصاعدي منطقياً". هذا يمنع الذكاء الاصطناعي من حدوث "خلل" والتنبؤ بأن كلمة ما قد حدثت في الماضي.

3. اختبار "التعثر" (تقليل فرض المعلم)
تخيل طالباً يتدرب على البيانو. إذا كان المعلم يعزف كل نوتة له بشكل مثالي، فسيصبح الطالب "كسولاً"؛ فهو لا يعرف كيف يعزف إلا إذا كان المعلم يوجهه. وفي اللحظة التي يتوقف فيها المعلم، سيفشل الطالب.
في تدريب الذكاء الاصطناعي، عادة ما نعطي النموذج "الطابع الزمني المثالي" السابق لمساعدته في التنبؤ بالطابع التالي. قرر الباحثون "تعثر" الذكاء الاصطناعي أحياناً عبر إعطائه طابعاً زمنياً خاطئاً قليلاً أثناء الممارسة. هذا أجبر الذكاء الاصطناعي على تعلم كيفية التعافي من الأخطاء، مما جعله أكثر قوة و"ذكاءً واقعياً" عند مواجهة أصوات حقيقية وفوضوية.

النتيجة: سيد العالمين

باستخدام هذه الحيل الثلاث، حقق نموذج In-Sync سيناريو "أفضل ما في العالمين". لم يكتفِ فقط بالتحسن في توقيت الكلمات، بل أصبح في الواقع أفضل في التعرف على الكلمات نفسها.

الأمر يشبه الموسيقي الذي، من خلال ممارسة إيقاعه بشكل أكثر كثافة، يصبح مغنياً أفضل. لقد أصبح التوقيت والمحتوى مهارة واحدة موحدة ومتزامنة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →