Neural tracking of surprisal and semantic distance in naturalistic movie viewing
تُظهر هذه الدراسة، باستخدام بيانات التصوير بالرنين المغناطيسي الوظيفي من مشاركين يشاهدون فيلماً كاملاً، أن الدماغ البشري يتتبع كلاً من المفاجأة والمسافة الدلالية كمتنبئات فريدة للنشاط العصبي في المناطق الصدغية والجبهية ثنائية الجانب أثناء الفهم اللغوي السمعي البصري الطبيعي.
المؤلفون الأصليون:O'Leary, R. M., Smith, H. C., Myers, E. B., Reilly, J., Peelle, J. E.
عندما نستمع إلى قصة، لا تكون أدمغتنا مجرد مسجلات سلبية للصوت؛ بل هي متوقعة نشطة، تخمن باستمرار ما سيأتي بعد ذلك بناءً على ما سمعناه بالفعل. تعتمد هذه العملية على أداتين عقليتين متمايزتين ولكن مرتبطتين. الأولى هي الشعور بالاحتمالية: ما مدى احتمالية ظهور الكلمة التالية بناءً على الكلمات التي سبقتها؟ إذا انتهت جملة بـ "السماء هي"، فإن دماغنا يتوقع بقوة كلمة "زرقاء"، ويجعل وصول تلك الكلمة يبدو غير مفاجئ. أما إذا انتهت الجملة بـ "السماء هي"، وكانت الكلمة التالية هي "موزة"، فإن الدماغ يُؤخذ على حين غرة. يُعرف هذا الشعور بالمباغتة بـ "المفاجأة" (surprisal). الأداة الثانية هي مقياس المعنى، أو مدى ارتباط الكلمة الحالية بالأفكار التي عالجناها للتو. فحتى لو لم تكن الكلمة هي الأكثر احتمالاً من الناحية الإحصائية، فقد تظل متناغمة تماماً مع موضوع المحادثة. إن فهم كيفية استخدام الدماغ لهذا النوعين المختلفين من المعلومات —الاحتمالية الإحصائية والارتباط الدلالي— لفهم اللغة هو سؤال مركزي في علم الأعصاب، خاصة عندما نكون منغمسين في بيئة غنية وواقعية مثل مشاهدة فيلم.
قام فريق من الباحثين بمهمة استكشافية لمعرفة كيف يتتبع الدماغ البشري هاتين الإشارتين المحددتين أثناء مشاهدة الناس لفيلم كامل. استعانوا بعشرين شخصاً بالغاً لم يسبق لهم مشاهدة فيلم "500 يوم من الصيف" (500 Days of Summer) لعام 2009، وطلبوا منهم مشاهدة الفيلم بأكمِله، والذي تبلغ مدته ما يزيد قليلاً عن تسعين دقيقة، بينما كانوا مستلقين داخل جهاز التصوير بالرنين المغناطيسي الوظيفي (fMRI). سمح هذا الجهاز للعلماء بمراقبة نشاط الدماغ في الوقت الفعلي بينما تتكشف أحداث القصة. ولفهم ما كان يفعله الدماغ، قام الباحثون أولاً بتفكيك المسارات الصوتية والمرئية للفيلم إلى آلاف النقاط البيانية الصغيرة. لقد قاسوا كل شيء، بدءاً من سطوع الشاشة وحركة الكاميرا، وصولاً إلى شدة صوت الحوار وتكرار كلمات معينة. ثم قاموا بحساب رقمين معقدين لكل كلمة منطوقة في الفيلم: أحدهما يمثل مدى مفاجأة تلك الكلمة بناءً على السياق السابق، والآخر يمثل مدى البعد أو القرب الدلالي لتلك الكلمة عن الكلمات التي سبقتها.
باستخدام تقنية نمذجة حاسوبية متطورة، بنى الباحثون سلسلة من التنبؤات خطوة بخطوة لمعرفة أي من هذه النقاط البيانية يمكن أن يفسر بشكل أفضل أنماط النشاط التي رصدوها في الدماغ. بدأوا بالعوامل الأبسط، مثل التغيرات البصرية على الشاشة وحجم الصوت الخام. نجحت هذه الميزات الأساسية في التنبؤ بالنشاط في الجزء الخلفي من الدماغ، حيث تتم المعالجة البصرية، وفي جوانب الدماغ، حيث يتم استقبال الصوت لأول مرة. ومع إضافتهم لميزات لغوية أكثر تعقيداً، مثل عدد مرات استخدام الكلمة بشكل عام أو عدد الكلمات التي تشبهها في النطق، تحسنت التنبؤات، وامتدت لتشمل مناطق مرتبطة باللغة والذاكرة. وأخيراً، أضافوا المتغيرين الرئيسيين محل الاهتمام: المفاجأة الإحصائية للكلمات والمسافة الدلالية. وأظهرت النتائج أن تضمين هذين العاملين حسن بشكل كبير القدرة على التنبؤ بنشاط الدماغ، لا سيما في التلفيف الصدغي العلوي، وهي منطقة في جوانب الدماغ معروفة بمعالجة الكلام، وفي الفص الجبهي الأيسر.
كان الاكتشاف الأكثر أهمية هو أن هذين العاملين لم يقوما بنفس الدور فحسب. فبعد أن وضع الباحثون في الحسبان تأثير أحدهما، ظل الآخر يفسر تغيرات فريدة في نشاط الدماغ. يشير هذا إلى أن الدماغ يتتبع كلاً من الاحتمالية الإحصائية لما سيحدث لاحقاً والعلاقة المفاهيمية بين الأفكار في آن واحد، باستخدام نظامين متكاملين. وبينما فعلت كلتا الإشارتين مناطق مماثلة في الفصوص الصدغية، أظهرت المفاجأة الإحصائية للكلمات أيضاً صلة فريدة بمنطقة محددة في المخيخ، وهو جزء من الدماغ يقع عند قاعدة الجمجمة وغالباً ما يرتبط بالتنسيق والتوقيت. تشير هذه النتيجة إلى أن آليات التنبؤ في الدماغ دقيقة، حيث تتعامل مع "ما هو مرجح الحدوث" و"ما يتناسب مع المعنى" كمسارات منفصلة ولكن متوازية من المعلومات.
تكتسب هذه النتائج أهميتها لأنها تتجاوز البيئات الهادئة والمسيطر عليها في الدراسات المختبرية التقليدية. فقد اعتمدت الأبحاث السابقة حول التنبؤ اللغوي غالباً على استماع الأشخاص إلى جمل معزولة أو قراءة نصوص في صمت. ومن خلال استخدام فيلم كامل، أظهر الباحثون أن الدماغ يستمر في تتبع هذه الإشارات اللغوية الدقيقة حتى عندما يتعرض لمشاهد بصرية معقدة، وموسيقى، وسرد قصصي عاطفي. تؤكد الدراسة أن قدرة الدماغ على توقع اللغة هي قدرة قوية ومتكاملة بعمق في كيفية تجربتنا للعالم، حيث تعمل بفعالية حتى عندما تكون المدخلات غنية، ومتعددة الوسائط، وغير متوقعة. لا يدعي العمل أنه قد حل لغز معالجة اللغة بالكامل، ولكنه يقدم دليلاً قوياً على أن أدمغتنا تقوم باستمرار بإجراء نوعين مختلفين من الفحوصات على الكلمات التي نسمعها، مما يضمن لنا ليس فقط فهم ما يقال، بل وفهم سبب أهميته في سياق تدفق القصة.
ملخص تقني: التتبع العصبي للمفاجأة والمسافة الدلالية في مشاهدة الأفلام الطبيعية
بيان المشكلة يتطلب فهم اللغة الطبيعية من المستمعين دمج المدخلات الصوتية الواردة مع المعرفة اللغوية والموضوعية السابقة، وهي عملية تعتمد بشكل كبير على التنبؤ. وبينما تُعد "المفاجأة" (اللوغاريتم السالب لاحتمالية الكلمة بناءً على السياق السابق) مقياسًا راسخًا لصعوبة التنبؤ، إلا أنها مقياس مركب يمزج بين تكرار الكلمات، والبنية النحوية، والدلالات، مما يجعل من الصعب عزل عوامل نفسية لغوية محددة. وفي المقابل، توفر "المسافة الدلالية" مقياسًا أكثر تحديدًا للترابط المفاهيمي ضمن فضاء دلالي عالي الأبعاد.
وعلى الرغم من أن كلا المقياسين معروفان بارتباطهما بالنشاط العصبي في مناطق اللغة (خاصة التلفيف الصدغي العلوي، STG)، إلا أنه لا يزال من غير الواضح ما إذا كانا يعكسان تمثيلات عصبية مشتركة أم عمليات متباينة. علاوة على ذلك، اعتمدت الأبحاث الحالية إلى حد كبير على الكلام المسموع فقط، مما ترك فجوة في فهم كيفية عمل هذه المقاييس ضمن سياقات سمعية بصرية طبيعية غنية حيث توفر المشاهد البصرية قيودًا إضافية. تعالج هذه الدراسة ما إذا كانت المفاجأة والمسافة الدلالية تقدمان مساهمات فريدة وقابلة للفصل في الاستجابات العصبية أثناء مشاهدة الأفلام الطبيعية.
المنهجية قام المؤلفون بتحليل بيانات التصوير بالرنين المغناطيسي الوظيفي (fMRI) لـ 20 بالغًا من المتحدثين الأصليين للغة الإنجليزية (تتراوح أعمارهم بين 19 و53 عامًا) الذين شاهدوا الفيلم الطويل 500 Days of Summer (مدته 91.17 دقيقة) أثناء المسح المستمر. استخدمت الدراسة سلسلة من نماذج الترميز على مستوى الفوكسل الهرمي للتنبؤ باستجابات BOLD.
استخراج الميزات:
ضوابط المستوى المنخفض: تم استخراج الميزات البصرية (السطوع، التباين، اللون، الحركة، حدود اللقطات، كشف الوجوه) باستخدام OpenCV. كما تم حساب غلاف السعة السمعية باستخدام جذر متوسط المربعات قصير المدى.
ضوابط مستوى الكلمة: تم تضمين تكرار المفردات (SUBTLEX-US)، وكثافة الجوار الفونولوجي، ومعدل كلمات المحتوى.
ميزات اللغة الحساسة للسياق:
المفاجأة: حُسبت باستخدام نموذج GPT-2 مدرب مسبقًا (بـ 117 مليون معلمة) بناءً على الاحتمالية الشرطية لكلمة ما بالنظر إلى العشر كلمات السابقة من السياق.
المسافة الدلالية: حُسبت باستخدام حزمة SemanticDistance في لغة R ومتجهات GloVe المدربة على متن اللغة الإنجليزية المعاصرة (COCA). عُرِّفت المسافة بأنها (1 ناقص تشابه جيب التمام) بين الكلمة ونافذة متحركة مكونة من 5 كلمات سابقة من كلمات المحتوى.
إجراء النمذجة:
استخدمت الدراسة نهجًا هرميًا لتقييم القدرة التنبؤية التزايدية:
النموذج 4: جميع الميزات السابقة + المفاجأة والمسافة الدلالية.
المساهمات الفريدة: لعزل التباين الفريد، تم إنشاء نموذجين وسيطين بين النموذج 3 والنموذج 4: أحدهما يضيف المسافة الدلالية فقط، والآخر يضيف المفاجأة فقط.
التحقق من الصحة: استخدمت النماذج التحقق المتقاطع ذو 10 طيات (10-fold cross-validation) مع حلقات داخلية متداخلة مكونة من 5 طيات لاختيار معامل تنظيم ريدج (ridge regularization). تم توسيع المتنبئات باستخدام مرشح الاستجابة النبضية المحدودة (FIR) مع تأخيرات تتراوح من 0 إلى 8 TRs لالتقاط التأخيرات الهيموديناميكية دون افتراض دالة استجابة نموذجية.
الاستدلال: تم استخدام الاستدلال غير المعلمي على مستوى المجموعة (10,000 عملية تبديل إشارة) مع تعزيز العنقود الخالي من العتبة (TFCE) وتصحيح الخطأ العائلي (p<.05) لتحديد العناقيد ذات الدلالة الإحصائية.
النتائج الرئيسية
التطور الهرمي: تحسن أداء النموذج بشكل منهجي مع زيادة تعقيد المجموعات الميزية لغويًا. تنبأت الميزات البصرية بالنشاط القذالي الخلفي، وأدى إضافة الغلاف السمعي إلى توسيع القدرة التنبؤية لتشمل التلفيف الصدغي العلوي (STG) في كلا الجانبين؛ بينما وسعت ميزات مستوى الكلمة التنبؤ عبر المناطق الصدغية والجبهية والمخيخية.
المكاسب التزايدية: أدت إضافة الميزات الحساسة للسياق (المفاجأة والمسافة الدلالية) في النموذج 4 إلى تحسين أداء التنبؤ بشكل ملحوظ مقارنة بالنموذج 3، لا سيما في القشرة الصدغية الثنائية والتلفيف الجبهي السفلي الأيسر (IFG).
المساهمات الفريدة: من المهم ملاحظة أن كلا المقياسين قد شرحا التباين الفريد في النشاط العصبي بعد حساب الآخر:
المفاجأة: تنبأت بشكل فريد بالنشاط في التلفيف الصدغي العلوي (STG) الثنائي، والتلفيف الصدغي الأوسط الأيسر، والتلفيف الجبهي السفلي الأيسف (IFG)، وبشكل ملحوظ، المخيخ الأيمن (Crus I و II).
التداخل المكاني مقابل التباين: بينما كانت التوزيعات المكانية للتأثيرات الفريدة متداخلة إلى حد كبير (بشكل أساسي في STG)، فإن الاستقلال الإحصائي للمتنبئات أكد أنها تلتقط جوانب غير متكررة من المعالجة العصبية.
الأهمية والادعاءات يزعم البحث أن مساهمته الأساسية هي إثبات أن المفاجأة والمسافة الدلالية هما مقياسان عصبيان متكاملان ولكنهما متباينان جزئيًا حتى ضمن بيئة معقدة متعددة الوسائط (سمعية بصرية).
ما وراء السمع فقط: تعزز النتائج العمل السابق بإظهار أن هذه المتنبئات اللغوية تظل قوية وذات معنى عند وجود معلومات المشهد البصري، مما يشير إلى أن الدماغ يتتبع هذه العلاقات الاحتمالية والدلالية بغض النظر عن ثراء الوسائط.
آليات متميزة: إن حقيقة أن كلا المقياسين يشرحان تباينًا فريدًا في الـ STG الثنائي تشير إلى أن الدماغ يستخدم كلاً من التنبؤ الاحتمالي الواسع (المفاجأة) والدمج الدلالي المحدد (المسافة الدلالية) في وقت واحد. يفسر المؤلفون تأثيرات STG بأنها تعكس تغذية راجعة من الأعلى إلى الأسفل حيث يسهل السياق معالجة تفاصيل شكل الكلمة.
المشاركة المخيخية: يدعم تحديد المخيخ الأيمن (Crus I/II) كمنطقة حساسة بشكل فريد للمفاجأة الأدبيات الناشئة التي تربط المخيخ بالتنبؤ اللغوي ومعالجة الخطأ.
الدقة المنهجية: من خلال استخدام نماذج ترميز هرمية مع ضوابط صارمة للميزات منخفضة المستوى وإحصاءات مستوى الكلمة، توفر هذه الدراسة اختبارًا أكثر صرامة للمساهمات المستقلة من الأعمال السابقة التي استخدمت غالبًا محفزات أحادية النمط أو نماذج أقل حساسية للسياق.
يظل المؤلفون متواضعين فيما يتعلق بالقدرة على التعميم، مشيرين إلى أن الدراسة اقتصرت على نوع واحد من الأفلام، وأن الارتباط العالي بين المفاجأة والمسافة الدلالية في الكلام الطبيعي يمنع التلاعب التجريبي بهذين العاملين بشكل مستقل. ويخلصون إلى أنه بينما تتوزع المعرفة الدلالية عبر شبكة واسعة، فإن العواقب المباشرة لفهم الكلام تظهر بقوة أكبر كتشوهات داخل الـ STG.