← أحدث الأبحاث
🧠 neuroscience

Visual speech enhances phoneme separability in human superior temporal gyrus

تُظهر هذه الدراسة أن الإشارات البصرية للكلام، مثل قراءة الشفاه، تعزز الفصل العصبي لتمثيلات الفونيمات الفئوية في التلفيف الصدغي العلوي لدى البشر، مما يؤدي إلى تسريع معالجة الكلام وتحسين التعرف على الكلمات.

المؤلفون الأصليون: Li, Y., DeWitt, I., Brennan, J. R., Wasade, V. S., Stacey, W., Brang, D.

نُشر 2026-09-12
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Li, Y., DeWitt, I., Brennan, J. R., Wasade, V. S., Stacey, W., Brang, D.

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل

إن الكلام البشري هو إنجاز مذهل من الهندسة متعددة الحواس. وبينما نفكر غالبًا في الاستماع كفعل سمعي بحت، فإن أدمغتنا تنسج باستمرار الصوت والرؤية معًا لفهم ما يقال. وهذا ينطبق بشكل خاص في البيئات الصاخبة، حيث يمكن لرؤية حركة شفاه المتحدث أن تنقذ كلمة مكتومة من الضجيج في الخلفية. لعدة عقود، عرف العلماء أن هذه المعلومات البصرية تساعدنا على فهم الكلام بشكل أفضل، لكن الآلية الدقيقة داخل الدماغ ظلت لغزًا. هل مجرد رؤية حركة الفم تعمل على شحذ التفاصيل الصوتية الخام للصوت، مثل رفع مستوى الصوت في راديو؟ أم أنها تساعد الدماغ على تنظيم الأصوات في فئات ذات معنى، مثل الحروف أو الكلمات المتميزة، حتى قبل أن ندرك أننا نستمع؟ إن فهم هذا التمييز أمر بالغ الأهمية لأن ذلك يكشف كيف يبني الدماغ البشري المعنى من التدفق الفوضوي للمدخلات الحسية التي نتلقاها كل يوم.

للإجابة على هذا السؤال، توجه فريق من الباحثين إلى مجموعة فريدة من المتطوعين: اثنا عشر بالغًا مصابين بالصرع يخضعون بالفعل للمراقبة السريرية مع وضع أقطاب كهربائية مباشرة على أدمغتهم. هؤلاء المرضى، الذين هم من المتحدثين الأصليين للغة الإنجليزية، وافقوا على المشاركة في دراسة أثناء تسجيل نشاط أدمغتهم. ركز الباحثون على منطقة محددة تسمى التلفيف الصدغي العلوي، وهي منطقة معروفة بأهميتها في معالجة الكلام. طُلب من المشاركين مشاهدة والاستماع إلى قوائم قصيرة من الكلمات أحادية المقطع. وقد تم اختيار هذه الكلمات بعناية لتكون مبنية من أربعة أصوات بداية مختلفة وأربعة أصوات نهاية مختلفة، مما خلق مجموعة من ست عشرة كلمة فريدة. عُرضت الكلمات بثلاث طرق مختلفة: كصوت وحده، وكفيديو لوجه المتحدث بدون صوت، وكتركيبة متزامنة من كل من الصوت والفيديو. وفي الحالة المدمجة، بدأت الإشارة البصرية لحركة فم المتحدث قبل وصول الصوت بقليل، محاكية التأخير الطبيعي بين رؤية الإيماءة وسماع الصوت.

تضمن جوهر التجربة الاستماع إلى الإشارات الكهربائية من أدمغة المرضى أثناء معالجتهم لهذه الكلمات. لم يكتفِ الباحثون بمعرفة ما إذا كان المرضى يستطيعون سماع الكلمات؛ بل استخدموا خوارزمية حاسوبية لفك تشفير إشارات الدماغ نفسها. ومن خلال تحليل أنماط النشاط الكهربائي، حاولت الخوارزمية تخمين الكلمة التي يسمعها أو يراها المريض. سمح ذلك للعلماء برؤية المعلومات التي يحتفظ بها الدماغ في أي لحظة معينة بدقة. لقد فحصوا استجابة الدماغ عند ثلاثة مستويات مختلفة من التفصيل: السمات الفيزيائية المحددة للصوت، والوحدات الشبيهة بالحروف المتميزة المعروفة بالفونيمات (الوحدات الصوتية)، والكلمة الكاملة نفسها.

كشفت النتائج عن نمط واضح ومحدد. فعندما رأى المرضى وجه المتحدث مع الصوت، أصبح أدمغتهم أفضل بكثير في التمييز بين الكلمات المختلفة والفونيمات المختلفة. أصبحت إشارات الدماغ أكثر وضوحًا، مما سمح للحاسوب بتحديد الكلمة الصحيحة بثقة أكبر. ومع ذلك، لم يحدث هذا التعزيز عند المستوى الأساسي لسمات الصوت. لم تعمل المعلومات البصرية على جعل التفاصيل الصوتية الخام للكلام أكثر حدة أو تميزًا. بدلاً من ذلك، عمل المدخل البصري كمرشح يساعد الدماغ على فرز الأصوات في الفئات الصحيحة. يبدو أن رؤية حركة الفم تساعد الدماغ على تقرير: "هذا الصوت هو 'ب' وليس 'باء'"، بدلاً من مجرد جعل صوت الـ "ب" أعلى أو أوضح. يشير هذا إلى أن الدماغ يستخدم الإشارات البصرية لحل الغموض بين الفئات المتشابهة في النطق، مما يؤدي بفعالية إلى شحذ الحدود بينها.

كشفت الدراسة أيضًا عن توقيت هذه العملية. بدأ الدماغ في تحديد الكلمات بنجاح في وقت أبكر عندما تم دمج الإشارات البصرية والسمعية مقارنة بما كانت عليه عندما يتم تقديم الصوت وحده. كان هذا التسارع أكثر وضوحًا في أصوات البداية للكلمات، وهي الحروف الساكنة التي تظهر في بداية المقطع اللفظي. بدا أن الإشارة البصرية، التي تصل قبل الصوت، تهيئ الدماغ لتوقع نوع معين من الصوت، مما يسمح له بمعالجة الصوت القادم بسرعة أكبر. ومن المثير للاهتمام أن هذه الميزة لم تمتد بنفس القوة إلى الأجزاء النهائية من الكلمات، المعروفة بالقافية (rimes). بدت الفائدة البصرية أكثر قوة في التحديد الفئوي الأولي لصوت الكلام، والذي ينتقل بعد ذلك ليحسن التعرف على الكلمة بأكملها.

تتحدى هذه النتائج الفكرة القائلة بأن الكلام المرئي يعزز ببساطة المدخلات الحسية الخام. بدلاً من ذلك، تشير الأدلة إلى أن الدماغ يستخدم المعلومات البصرية لتنقية خريطته الداخلية لفئات اللغة. فمن خلال رؤية المتحدث، يمكن للدماغ أن يحدد بصورة أكثر ثقة صوتًا معينًا كفئة صوتية محددة، مما يجعل من السهل بدوره التعرف على الكلمة. تحدث هذه العملية بسرعة وتلقائية، وتحدث في التلفيف الصدغي العلوي، وهو منطقة تعمل كمركز لدمج ما نسمعه مع ما نراه. تؤكد هذه الدراسة أنه بينما يتفوق الدماغ في معالجة الخصائص الفيزيائية للصوت، فإنه يعتمد على الإشارات البصرية لتنظيم تلك الخصائص في الوحدات ذات المعنى التي تسمح لنا بفهم اللغة. يفسر هذا الآلية التي تجعلنا قادرين غالبًا على فهم المتحدث بشكل جيد تمامًا حتى عندما يكون الصوت مشوهًا، بشرط أن نتمكن من رؤية وجهه. فالمدخل البصري لا يضيف فقط إلى الصوت؛ بل يغير بشكل أساسي كيفية تصنيف الدماغ وتفسيره للكلام الذي نسمعه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →