MERIT: A No-Code Platform for Unifying High-Precision Cognitive Assessment Across Laboratory and Real-World Settings
تقدم هذه الورقة منصة MERIT، وهي منصة بدون كود توحد التقييم المعرفي عالي الدقة عبر المختبرات وبيئات العالم الحقيقي من خلال إثبات أن تذبذب التوقيت القائم على المتصفح يمكن أن يشوه المقاييس العصبية والسلوكية بشكل كبير، مع توفير حل أصيل للهواتف المحمولة بدقة تحفيز تقل عن الميلي ثانية تضمن اتساق المهام عبر البيئات المختلفة.
المؤلفون الأصليون:Colcombe, S. J., Milham, M., Brookover, J., Ay, C. T., Xiao, M., Palmatier, C., Salum, G., Klein, A.
على مدى عقود، اعتمدت دراسة كيفية عمل العقل البشري على مقايضة صارمة. فلقياس سرعة الفكرة أو اللحظة الدقيقة التي يتفاعل فيها الدماغ مع مشهد ما، احتاج الباحثون إلى معدات متخصصة وباهظة الثمن محبوسة داخل مختبر هادئ. كانت هذه الآلات قادرة على تسجيل الأحداث بدقة تصل إلى أجزاء من الألف من الثانية، لتلتقط الشرارات الكهربائية الخاطفة للدماغ أثناء حدوثها. لكن هذه الدقة جاءت بتكلفة؛ فقد كانت التجارب جامدة، وصعبة الإعداد، ومستحيلة النقل خارج المختبر. وفي المقابل، يوفر العالم الحديث وسيلة للوصول إلى الناس في أي مكان وزمان، باستخدام الهواتف الذكية والأجهزة اللوحية التي يحملونها في جيوبهم. ومع ذلك، كانت هذه الأجهزة اليومية تاريخياً غير دقيقة بما يكفي للبحث العلمي الجاد. فالبرمجيات التي تشغلها، وخاصة متصفحات الويب، غالباً ما تسبب تأخيرات طفيفة وغير متوقعة — تصل أحياناً إلى عشرات الميلي ثانية — مما يؤدي إلى تشويش التوقيت الذي يحتا ever الباحثون لقياسه. وقد أجبرت هذه الفجوة العلماء على الاختيار بين بيانات عالية الجودة من عدد قليل من الأشخاص في المختبر، أو بيانات منخفضة الجودة من عدد كبير من الناس في العالم الحقيقي، ولكن ليس كليهما في آن واحد.
قام فريق من الباحثين الآن ببناء نظام جديد صُمم لسد هذه الفجوة، مما يسمح بإجراء التجربة نفسها بدقة عالية على هاتف المشارك الخاص تماماً كما لو كانت على جهاز كمبيوتر في المختبر. ويطلقون على هذا النظام اسم MERIT. وهو أداة تتيح للباحثين تصميم مهام ذهنية معقدة دون كتابة أي كود برمجي، باستخدام باني مرئي يشبه ترتيب المكعبات. وبمجرد إنشاء المهمة، تعمل عبر محرك قوي مدمج مباشرة في تطبيقات الهاتف، متجاوزةً متصفحات الويب البطيئة والمتغيرة التي عرقلت المحاولات السابقة. ويتميز النظام بدقة عالية لدرجة أنه يمكنه قياس الوقت بين الإشارات البصرية بهامش خطأ يقل عن ميلي ثانية واحدة على الأجهزة الحديثة، وإن كان أعلى قليلاً على الطرازات القديمة. وتعد هذه الدقة أمراً بالغ الأهمية لأن الإشارات الكهربائية للدماغ، التي يسجلها الباحثون غالباً جنباً إلى جنب مع هذه المهام، تحدث في طرفة عين. فإذا انحرف توقيت المهمة ولو بجزء ضئيل من الثانية، يصبح من المستحيل تفسير العلاقة بين السلوك ونشاط الدماغ.
لإثبات نجاح نظامهم، كان على الباحثين أولاً الإجابة على سؤال جوهري: ما مقدار خطأ التوقيت الذي يمكن أن تتحمله قياسات الدماغ فعلياً قبل أن تصبح البيانات عديمة الفائدة؟ لقد أخذوا مجموعة بيانات كبيرة وعامة لتسجيلات الدماغ وحقنوا فيها تأخيرات عشوائية في توقيت الإشارات البصرية، لمحاكاة نوع الأخطاء التي تحدث في الحواسيب العادية. ثم قاسوا كيف أثرت هذه التأخيرات على ثلاث إشارات دماغية محددة تظهر عند رؤية أو سماع شيء ما. ووجدوا أنه بالنسبة لإشارة دماغية سريعة تُعرف باسم N170، والتي تحدث بعد حوالي 170 ميلي ثانية من رؤية وجه ما، لا يمكن أن يتجاوز خطأ التوقيت حوالي 15.8 ميلي ثانية إذا أراد الباحثون الحفاظ على موثوقية قياساتهم. أما الإشارات الدماغية الأبطأ، فكانت تتحمل خطأ أكبر قليلاً، يصل إلى 20 ميلي ثانية أو أكثر قليلاً. ومن الأهمية بمكان، اكتشفوا أن نوع الخطأ يهم بقدر أهمية مقداره؛ فنظام يرتكب أخطاءً كبيرة ونادرة هو في الواقع أفضل للعلم من نظام يرتكب أخطاءً مستمرة وصغيرة، لأن الأخطاء النادرة تكلف التحليل أقل من الأخطاء المستمرة.
بعد تحديد هذه الحدود، اختبر الفريق منصتهم الجديدة، MERIT، على مجموعة متنوعة من الأجهزة في العالم الحقيقي. وقاسوا دقة التوقيت للنظام على العديد من الهواتف الذكية والأجهزة اللوحية الحالية، بالإضافة إلى هاتف قديم منخفض التكلفة. وعلى الأجهزة الأحدث، كان النظام مستقراً للغاية، حيث تراوحت أخطاء التوقيت بين 0.71 و0.96 ميلي ثانية. وحتى على الهاتف الأقدم والأبطأ، كان الخطأ 3.73 ميلي ثانية فقط. وكانت كل عملية قياس أقل بكثير من حد الـ 15.8 ميلي ثانية المطلوب لأكثر الإشارات الدماغية حساسية. وهذا يعني أنه لأول مرة، يمكن للباحث أن يطلب من المشارك أداء مهمة معرفية على هاتفه الخاص في المنزل، ويكون واثقاً من أن التوقيت دقيق بما يكفي لربط ذلك السلوك بنشاط الدماغ المسجل في المختبر. ويحقق النظام ذلك من خلال تشغيل المهمة مباشرة على نظام تشغيل الهاتف بدلاً من متصفح الويب، وباستخدام اتصال متخصص يرسل إشارات التوقيت إلى المعدات المختبرية في الوقت الفعلي.
لا تقتصر المنصة على التوقيت فحسب، بل تتعلق بالمرونة والقدرة على الوصول. يمكن للباحثين الآن بناء مهام تتضمن الرسم، أو الحركة المستمرة، أو تسلسلات معقدة من الخيارات، وكل ذلك دون الحاجة إلى توظيف مبرمج. ويمكن ضبط هذه المهام لتعمل لمرة واحدة، أو لتظهر في أوقات محددة طوال اليوم والأسبوع، مما يسمح للعلماء بدراسة كيفية تغير الانتباه والمزاج بمرور الوقت في البيئة الطبيعية للشخص. يدعم النظام أربعة أنواع رئيسية من المهام: اختبارات رد الفعل السريع، وألعاب التحكم المستمر حيث يجب على الشخص تثبيت جسم متحرك، وتمارين الرسم التي تلتقط سرعة وضغط ضربة القلم، والألغاز المتسلسلة. ولأن تعريف المهمة نفسه يُستخدم سواء كان المشارك في المختبر أو في المنزل، فيمكن مقارنة البيانات التي يتم جمعها في الميدان مباشرة مع بيانات الدماغ والجسم التي يتم جمعها في المختبر. وهذا يسمح للعلماء بفهم ما يعنيه بطء وقت رد الفعل فيما يتعلق بنشاط الدماغ، حتى عندما يتم قياس وقت رد الفعل هذا في غرفة المعيشة بدلاً من المختبر.
إن تداعيات هذا العمل تمتد إلى ما هو أبعد من مجرد بيانات أفضل؛ فهي تغير من يمكنه القيام بالعلم. فمن خلال إزالة الحاجة إلى مهارات البرمجة والأجهزة باهظة الثمن، تفتح المنصة الباب لمجموعة أوسع من الباحثين لتصميم وإدارة درسات عالية الجودة. كما أنها تسمح بأنواع جديدة من الأبحاث التي كانت مستحيلة سابقاً، مثل تتبع التغيرات المعرفية لدى المرضى على مدار أشهر أو سنوات، أو دراسة كيفية عمل الدماغ في منتصف يوم حافل. وقد صُمم النظام ليكون مستداماً، حيث يخطط المطورون لإبقائه متاحاً للمجتمع العلمي من خلال نموذج يدعم الصيانة والتحديثات طويلة الأمد. ورغم أنه لا يوجد نظام مثالي، ويعترف الباحثون بأن الأجهزة القديمة أو إعدادات نظام التشغيل المحددة يمكن أن تسبب تباينات صغيرة، إلا أن النتائج تظهر أن الفجوة بين دقة المختبر وراحة العالم الحقيقي قد تم جسرها. إن نفس الأداة التي تقيس الدماغ في بيئة خاضعة للرقابة، يمكنها الآن قياس العقل في "البرية"، بوضوح كان يُعتقد في السابق أنه بعيد المنال.
ملخص تقني: MERIT – منصة بدون كود لتوحيد التقييم المعرفي عالي الدقة
بيان المشكلة
تواجه العلوم العصبية الإدراكية وعلم النفس عقبة هيكلية في نقل التقييمات المختبرية عالية الدقة إلى البيئات الواقعية (الإيكولوجية). تقليديًا، تطلبت الدقة المتناهية في التوقيت (بالميلي ثانية) برامج متخصصة (مثل E-Prime أو PsychoPy) وبرمجة مخصصة، مما حصر تطوير المهام في الخبراء وحصر القياس الصارم داخل المختبر. وفي المقابل، تعاني المنصات المتاحة التي لا تتطلب كودًا برمجيًا (مثل الأدوات القائمة على المتصفح مثل Gorilla أو jsPsych) من تباين كبير في توقيت المحفزات عبر الأجهزة المختلفة، حيث ينحرف التوقيت غالبًا بعشرات الميلي ثواني. هذا التباين يقوض الاستدلال القائم على زمن الاستج राजकीय (Reaction Time) ويكسر الرابط بين المقاييس السلوكية والتسجيلات الفسيولوجية العصبية المتزامنة (مثل EEG أو fNIRS وغيرها).
حالياً، يتعين على الباحثين الاختيار بين:
الدقة العالية: أدوات مختبرية مع تسجيلات متزامنة للجسم/الدماغ لا يمكن توسيع نطاقها للبيئات الميدانية.
القابلية العالية للتوسع: أدوات قائمة على المتصفح أو بطاريات ثابتة تعمل على أجهزة استهلاكية، لكنها تفتقر إلى دقة التوقيت المطلوبة للاستدلال السلوكي أو العصبي الصارم.
علاً، غالبًا ما تتطلب منصات الهاتف المحمول الأصلية (مثل Inquisit أو Presentation) لغات برمجة خاصة، وتفتقد لبُناة مرئية بدون كود، أو تفشل في توفير جدولة موحدة للتقييم اللحظي الإيكولوجي (EMA) جنباً إلى جنب مع التوقيت بالملي ثانية الأصلي.
المنهجية
بنية المنصة (MERIT)
تم تصميم مجموعة أدوات البحث الاستقصائي للموبايل (MERIT) لتوحيد أربع وظائف متميزة: تأليف المهام، التنفيذ الحرج للتوقيت، إدارة المشاركين من جانب المشارك، وتصدير البيانات.
الباني (Builder): واجهة سحابية مرئية بدون كود (Unity WebGL) تسمح للباحثين بتصميم المهام دون برمجة. وهي تتضمن وحدات لإدارة الموارد، تعريف المدخلات (اللمس، وحدة قياس القصور الذاتي IMU، القلم)، بناء التجارب، وتسلسل الكتل (العشوائية، التكرار التكيفي).
المحرك (Engine): بيئة تشغيل Unity أصلية مدمجة داخل تطبيقات Curious لنظامي iOS وAndroid. يضمن ذلك تنفيذ المهام محلياً على الجهاز دون الاعتماد على الشبكة أثناء التجربة، مما يحافظ على سلامة التوقيت.
تكامل Curious: يتولى إدارة موافقة الدراسة، الجدولة (لمرة واحدة، فترات زمنية، EMA)، وإعادة البيانات.
مخرجات البيانات: تدعم تصدير ملفات CSV، سجلات الأحداث الخام، مسارات المتجهات للرسم، وبث طبقة تجميع البيانات (LSL) الأصلية للتسجيل متعدد الوسائط المتزامن.
اختبار الأداء المرجعي
قام المؤلفون بقياس حدود الخطأ المسموح بها للتوقيت للقياسات المعرفية والعصبية والتحقق من أداء MERIT مقابل هذه الحدود.
تحليل تحمل توقيت ERP:
مجموعة البيانات: مجموعة بيانات ERP CORE العامة (N=40).
الطريقة: تم حقن تذبذب (jitter) في توقيت المحفز لكل تجربة في البيانات. تمت إعادة قياس ثلاثة مكونات (N170، MMN، P3).
المعيار: تم تحديد "عتبة المادية" كنقطة يصل فيها الانحياز الناتج عن التذبذب إلى نصف الانحراف المعياري (SD) بين المشاركين.
توزيعات الخطأ: تم اختبار التوزيعات الطبيعية (Gaussian)، واللوغاريتمية الطبيعية (log-normal)، والتوزيعات ذات الذيول الثقيلة (خليط Gaussian-exponential بنسبة 90/10) لتحديد ما إذا كان الجذر التربيعي لمتوسط المربعات (RMS) وحده كافياً للتنبؤ بالخسارة.
محاكاة زمن الاستجابة (RT):
الطريقة: محاكاة توزيعات ex-Gaussian (μ=400,σ=50,τ=100) مع إضافة خطأ توقيت المنصة.
الهدف: تحديد كيفية تأثير شكل خطأ المنصة (Gaussian مقابل heavy-tailed) على تقدير معلمة ex-Gaussian τ (وهي علامة حيوية انتباهية مرشحة) والتباين داخل الشخص الواحد.
التحقق من الأجهزة:
الإعداد: تم قياس دقة الفاصل الزمني بين المحفزات (ISI) باستخدام مستشعر بصري Black Box ToolKit بدقة 0.25 مللي ثانية على أربعة أجهزة: iPhone 16 (2024)، iPad (2025)، Galaxy S24 (2024)، وPixel 3a (2019).
المقياس: الانحراف المعياري (SD) لخطأ التوقيت بالنسبة لساعة الوقت الحقيقي.
النتائج الرئيسية
متطلبات دقة التوقيت
سقف N170: يتحمل مكون N170 تذبذباً يصل إلى 15.8 مللي ثانية قبل أن يتجاوز الانحياز نصف الانحراف المعياري بين المشاركين. هذا الحد مدفوع بانحياز ذروة التأخير، وليس السعة.
المكونات الأبطأ: يتحمل MMN وP3 تذبذباً أكثر من 20 مللي ثانية.
التوزيع مهم: رقم RMS واحد غير كافٍ للتنبؤ بفقدان البيانات. التذبذب ذو الذيول الثقيلة (النموذجي في تأخير نظام التشغيل) يسبب تدهوراً أقل عند مطابقة RMS مقارنة بالتذبذب الطبيعي (Gaussian). علاوة على ذلك، فإن شكل توزيع الخطأ يحدد ما إذا كان خطأ المنصة سيؤدي إلى تضخيم أو تقليص معلمة ex-Gaussian τ.
أداء MERIT
الدقة الأصلية: حققت MERIT انحرافات معيارية للفواصل الزمنية بين المحفزات بلغت 0.71 مللي ثانية (iPhone 16)، و0.84 مللي ثانية (iPad)، و0.96 مللي ثانية (Galaxy S24). حتى الجهاز الاقتصادي لعام 2019 (Pixel 3a) حقق 3.73 مللي ثانية.
المقارنة بالحدود: أدت جميع الأجهزة المختبرة أداءً أقل بأكثر من مرتبة عشرية واحدة من سقف N170 البالغ 15.8 مللي ثانية.
المقارنة بالمتصفح: تقترب الانحرافات في المتصفحات (التي تم الإبلاغ عنها لتصل إلى 66 مللي ثانية) من الحدود المسموحة أو تتجاوزها للمكونات السريعة، بينما يقع محرك MERIT الأصلي بأمان تحت هذه الحدود.
تكامل LSL: تقوم MERIT ببث علامات الأحداث أصلياً إلى LSL، مما يسمح بالمزامنة مع أكثر من 150 فئة من الأجهزة (EEG، تتبع العين، إلخ) دون كود مخصص.
عائلات المهام
تدعم المنصة حالياً أربع عائلات، تعمل جميعها على نفس المحرك عبر الهواتف المحمولة، سطح المكتب، والمختبر:
زمن الاستجابة (Reaction-Time): مهام استجابة محفزة منفصلة (مثل Flanker، Stroop، PVT).
التحكم المستمر (Continuous Control): نماذج تتطلب تحكماً حركياً مستمراً لعناصر غير مستقرة (مثل cpCST باستخدام IMU الجهاز).
الرسم (Drawing): مهام الورقة والقلم الرقمية (مثل رسم الساعة، واختبار تتبع المسار) التي تلتقط ناقلات حركية مختومة زمنياً.
التسلسلي (Sequential): نماذج العمل المرتبة (مثل Corsi block-tapping).
الأهمية والادعاءات
يزعم البحث أن MERIT يعالج فجوة هيكلية في الأبحاث المعرفية من خلال توحيد سهولة الوصول بدون كود، الدقة الأصلية بالملي ثانية، والمزامنة متعددة الوسائط في نظام واحد.
توحيد المختبر والميدان: تتيح MERIT للباحثين استخدام نفس تعريف المهمة الذي يتم توصيفه مقابل تسجيلات الدماغ/الجسم المتزامنة في المختبر، ونشره دون تغيير على أجهزة المشاركين في الميدان. وهذا يسمح للباحثين بربط التوقيعات السلوكية الإيكولوجية (مثل تباطؤ زمن الاستجابة في الحياة اليومية) بالأنماط الفسيولوجية العصبية الميكانيكية التي تم إرساؤها في المختبر.
الابتكار المنهجي: من خلال إزالة الحاجة إلى البرمجة، تخفض المنصة حاجز النماذج الأولية ونشرها، مما قد يسرع الابتكار المنهجي.
جودة البيانات: تثبت المنصة أن أجهزة الهاتف المحمول الشائعة، عند اقترانها ببيئة تشغيل أصلية، يمكن أن تحقق دقة توقيت كافية للقياسات عالية المتطلبات مثل مكونات ERP، والتي كان يُعتقد سابقاً أنها تتطلب أجهزة مختبرية متخصصة.
الاستدامة: يتم توزيع المنصة عبر معهد Child Mind Institute بنموذج "النواة المفتوحة" (مشابه لنموذج Red Hat)، وتهدف لضمان التوافر طويل الأمد بغض النظر عن دورات المنح التمويلية.
يشير المؤلفون إلى وجود قيود، منها أن التوقيت المطلق لا يزال يتأثر بقيود نظام التشغيل (العمليات الخلفية) وأن أوقات صعود وهبوط الشاشة تظل معتمدة على الأجهزة. كما يقرون أنه بينما يعد تكامل LSL أصلياً، فإن التحقق الكامل من إزاحة (marker-to-photon) عبر جميع الأجهزة الحالية هو خطوة قياس مستمرة. ومع ذلك، تشير البيانات الحالية إلى أن توقيت التدفق المنفرد لم يعد العامل المحدد الأساسي للقياس المعرفي على الجهاز؛ بل انتقل التركيز إلى المحاذاة بين التدفقات.