← أحدث الأبحاث
💻 computer science

CMTD: Cascaded Multi-Token Disambiguation Model for Lip Reading

تقترح الورقة البحثية نموذج فك التباس الرموز المتعددة المتتالي (CMTD)، الذي يعزز أداء قراءة الشفاه من خلال دمج نمذجة سياق المستقبل مباشرة في عملية فك التشفير عبر بنية تنبؤ متعددة الرموز متتالية وهدف تدريب هرمي، مما يؤدي بفعالية إلى حل حالات الغموض البصري وتقليل معدلات الخطأ في مجموعات البيانات المرجعية.

المؤلفون الأصليون: Yuting Fang, Feng Xue, Zhe Chen, Shujie Li

نُشر 2026-09-02
📖 6 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Yuting Fang, Feng Xue, Zhe Chen, Shujie Li

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تعد تقنية التعرف على الكلام الصامت مجالاً من مجالات علوم الحاسوب المخصص لفهم ما يقوله الناس من خلال مراقبة شفاههم فقط، دون سماع أي صوت. وتعتبر هذه القدرة حيوية في الحالات التي يغيب فيها الصوت أو يكون غير موثوق، كما هو الحال في المصانع الصاخبة، أو البيئات تحت الماء، أو بالنسبة للأشخاص الصم الذين يعتمدون على الإشارات البصرية. ومع ذلك، فإن تعليم الكمبيوتر قراءة الشفاه أمر صعب للغاية لأن الفم البشري يعد وسيلة تواصل ضعيفة للصوت بمفرده. فالعديد من الأصوات المختلفة، مثل حرفي "ب" و"ب" (b و p)، تخلق أشكالاً متطابقة تقريباً للفم، بينما قد يبدو نفس الصوت مختلفاً قليلاً اعتماداً على الكلمات المحيطة به. هذا الارتباك البصري يعني أن الكمبيوتر الذي ينظر إلى مقطع فيديو قد يرى شكلاً للفم يمكن أن ينتمي إلى عدة كلمات مختلفة، مما يترك الآلة في حالة تخمين. ولحل هذه المشكلة، حاول الباحثون تقليدياً جعل "عيون" الكمبيوتر أكثر حدة لرؤية الاختلافات الدقيقة، أو أضافوا قاموساً للعبارات الشائعة للمساعدة في تخمين الكلمات المفقودة. ومع ذلك، غالباً ما تعاني هذه الأساليب عندما تكون الأدلة البصرية غامضة جداً بحيث لا يمكن المفاضلة بين خيارين متشابهين.

اقترح فريق من الباحثين من جامعة هيفي للتكنولوجيا نهجاً جديداً يغير طريقة تفكير الكمبيوتر في المستقبل أثناء قراءته للحاضر. وقد أطلقوا على نظامهم اسم CMTD، وهو نموذج مصمم لحل الارتباك البصري من خلال النظر إلى الأمام. فبدلاً من محاولة تخمين الكلمة التالية بمعزل عن غيرها، يقوم النظام بالتنبؤ في آن واحد بتسلسل قصير من الكلمات القادمة بينما لا يزال يفك تشفير الكلمة الحالية. تخيل قارئاً، بينما ينظر إلى كلمة واحدة على الصفحة، يلقي بنظرة أيضاً على الكلمات القليلة التالية لفهم الجملة الكاملة؛ هذا السياق يساعده في تحديد ما إذا كانت الكلمة الضبابية هي "مصرف" (بمعنى مال) أو "ضفة" (بمعنى نهر). لقد بنى الباحثون نموذجاً يفعل الشيء نفسه لقراءة الشفاه؛ فهو يولد تخميناً أولياً للحظة الحالية، وفي الوقت نفسه يستخدم هذا التخمين لتشكيل سلسلة من التنبؤات للمستقبل القريب. ومن خلال التحقق مما إذا كان التخمين الحالي يتناسب منطقياً مع الكلمات المستقبلية المتوقعة، يمكن للنظام استبعاد الخيارات التي قد تبدو صحيحة بصرياً ولكنها لا معنى لها في سياق الجملة.

جوهر هذا الأسلوب الجديد هو هيكل متتالي حيث يغذي تنبؤ لحظة واحدة مباشرة تنبؤ اللحظة التالية، مما يخلق سلسلة مستمرة من الاستنتاج. النظام لا ينظر فقط إلى إطارات الفيديو؛ بل يحتفظ أيضاً بذاكرة داخلية لما تنبأ به للتو ويستخدم تلك الذاكرة للتنبؤ بما سيأتي بعد ذلك. إذا أظهر الفيديو شكلاً للفم يمكن أن يكون "باو" (bao) أو "بياو" (biao) (وهما حرفان صينيان متشابهان جداً في المظهر)، فإن النظام ينظر إلى ما يتنبأ به في المستقبل. إذا كان التنبؤ المستقبلي يشير إلى كلمة لا تتوافق إلا مع "بياو"، فإن النظام يختار ذلك الخيار بثقة، حتى لو كانت الأدلة البصرية للكلمة الحالية ضعيفة. وتتم هذه العملية في طبقات: يقوم النموذج بعمل تنبؤ رئيسي، ثم تنبؤ ثانٍ للخطوة التالية، ثم ثالث للخطوة التي تليها. هذه التنبؤات ليست تخمينات مستقلة؛ بل هي مرتبطة ببعضها البعض بحيث لا يؤدي الخطأ في أحدها إلى إفساد الآخرين. وقد درب الباحثون النموذج على إعطاء الأولوية لصحة الكلمة التالية مباشرة مع الاستمرار في التعلم من السلسلة الطويلة من الكلمات المستقبلية، مما يضمن بقاء النظام مستقراً وعدم ارتباكه بسبب تخميناته البعيدة.

عندما يقرأ النظام مقطع فيديو بالفعل، فإنه يستخدم استراتيجية تسمى "الاستدلال المدرك للرموز المستقبلية" لتقرير متى يثق في عينيه ومتى يطلب المساعدة. فهو يولد عدة مسارات محتملة من الكلمات بناءً على ملاحظاته البصرية وتنبؤاته المستقبلية. ثم يتحقق من مدى ثقته في قراءته البصرية. إذا كانت الأدلة البصرية قوية وواضحة، يختار النظام ببساطة الخيار الأفضل ويمضي قدماً. ومع ذلك، إذا كانت الأدلة البصرية ضعيفة وكان النظام غير متأكد، فإنه يستعين بنموذج لغوي — وهو أداة منفصلة مدربة على كميات هائلة من النصوص — لإعادة ترتيب الخيارات بناءً على مدى احتمالية ظهورها في جملة حقيقية. وهذا يضمن أن الكمبيوتر يعتمد على التخمينات اللغوية فقط عندما تكون البيانات البصرية غامضة حقاً، مما يمنعه من تجاهل الإشارات البصرية الواضحة لصالح التخمينات الإحصائية. هذا التوازن يسمح للنظام بالبقاء وفياً لما يراه مع استخدام السياق لحل الألغاز التي لا يستطيع النظر وحده حلها.

اختبر الباحثون هذا النموذج الجديد على مجموعتي بيانات رئيستين: إحداهما تحتوي على آلاف الجمل الصينية من النشرات الإخبارية، والأخرى تحتوي على جمل إنجليزية نطق بها مجموعة ثابتة من الأشخاص. وفي مجموعة البيانات الصينية، تفوق النموذج الجديد بشكل كبير على الأساليب السابقة، حيث قلل معدل الخطأ بفارق كبير مقارنة بالأنظمة التي اعتمدت فقط على ميزات بصرية أفضل أو قواعد لغوية ثابتة. وقد تمكن من التمييز بين الرموز المتشابهة بصرياً بدقة أكبر بكثير من أسلافه. أما في مجموعة البيانات الإنجليزية، فقد حقق النموذج نتائج تنافسية مع أفضل الأنظمة الموجودة، وإن كان التحسن أقل دراماتيكية لأن الجمل الإنجليزية المستخدمة في الاختبار كانت بسيطة جداً ولها مفردات محدودة، مما ترك مجالاً أقل لمهارات السياق المتقدمة للنظام لتبرز. وقد أظهرت التجارب أن قدرة النموذج على التطلع إلى الأمام وربط التنبؤات معاً كانت العامل الرئيسي في نجاحه، مما يثبت أن فهم تدفق الجملة لا يقل أهمية عن رؤية حركات الفم بوضộ.

كما استكشفت الدراسة لماذا لم تنجح مجرد نسخ الأساليب المستخدمة في توليد النصوص في عملية قراءة الشفاه. فعندما حاول الباحثون استخدام فروع تنبؤ متوازية لا تتواصل مع بعضها البعض، أو أساليب تعتمد على معرفة الإجابات المستقبلية الصحيحة أثناء التدريب، فشل النظام في الحفاظ على الدقة كلما نظر بعيداً في المستقبل. تراكمت الأخطاء، وأصبحت التنبؤات غير موثوقة. وقد ثبت أن النهج المتتالي، حيث يبني النظام تنبؤاته المستقبلية خطوة بخبعد من تخميناته السابقة، هو السبيل الوحيد للحفاظ على الاستقرار. علاوة على التنبؤ، وجد الباحثون أن التنبؤ بعدد كبير جداً من الكلمات المستقبلية في وقت واحد يضر بالأداء، مما يشير إلى أن وجود قدر معتدل من السياق هو "النقطة المثالية" لهذا النوع من المهام البصرية. ومن خلال الحد من عدد التنبؤات المستقبلية ووزن أهمية كل خطوة بعناية، تعلم النظام الموازنة بين الدقة البصرية الفورية والسياق طويل المدى.

في الختام، يوضح هذا العمل أن حل غموض قراءة الشفاه يتطلب أكثر من مجرد كاميرات أكثر حدة أو قواميس أكبر؛ إنه يتطلب نموذجاً يفهم التدفق السردي للكلام. ومن خلال دمج السياق المستقبلي مباشرة في عملية فك التشفير، يمكن لنموذج CMTD التمييز بين الكلمات التي تبدو متطابقة على الشفاه ولكنها تنتمي إلى جمل مختلفة. وتشير النتائج إلى أن هذا النهج يقدم طريقة قوية للتعامل مع عدم اليقين المتأصل في الكلام المرئي، مما يمثل خطوة مهمة للأمام للتقنيات التي تعتمد على التواصل الصامت. وبينما أجريت الاختبارات الحالية على بيانات فيديو عالية الجودة ومنضبطة، فإن نجاح هذه الطريقة يضع أساساً لأنظمة قد تتمكن يوماً ما من التعامل مع الظروف الأكثر فوضوية وغير المتوقعة للمحادثات في العالم الحقيقي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →