← أحدث الأبحاث
🧠 neuroscience

Imputation-Based Harmonization Mitigates Site Effects Without Data Leakage in Machine Learning Studies

تقدم الورقة البحثية MIRTH، وهي طريقة تجانس مبتكرة قائمة على التضمين، تعمل بفعالية على تخفيف آثار المواقع في دراسات تعلم الآلة الخاصة بالتصوير العصبي دون التسبب في تسرب البيانات أو إضعاف الإشارات البيولوجية الحقيقية.

المؤلفون الأصليون: Hillman, N., Chen, A., Hu, F., Vandekar, S., Melhem, R., Beason-Held, L., Satterthwaite, T., Davatzikos, C., Shou, H., Shinohara, R.

نُشر 2026-10-05
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Hillman, N., Chen, A., Hu, F., Vandekar, S., Melhem, R., Beason-Held, L., Satterthwaite, T., Davatzikos, C., Shou, H., Shinohara, R.

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول فهم الدماغ البشري من خلال النظر إلى آلاف صور الرنين المغناطيسي المأخوذة من مستشفيات مختلفة في جميع أنحاء البلاد. تستخدم كل مستشفى أجهزتها الخاصة، والتي غالبًا ما تكون من شركات مصنعة مختلفة، وتتبع إجراءات مسح تختلف قليلاً عن غيرها. وحتى عندما يحاول العلماء توحيد هذه الإجراءات، فإن الصور لا تزال تحمل بصمات خفية لمكان التقاطها. فقد تبدو صورة مأخوذة من مستشفى معين أكثر سطوعًا أو ذات أنسجة مختلفة عن صورة أخرى، ليس لأن دماغ المريض مختلف، بل بسبب الجهاز المستخدم. وعندما يجمع الباحثون هذه الصور لدراسة أمراض مثل الزهايمر، يمكن لهذه الاختلافات التقنية أن تخدع البرامج الحاسوبية وتجعلها تعتقد أنها وجدت نمطًا هو في الواقع مجرد انعكاس لموقع المستشفى. هذه المشكلة، المعروفة باسم "تأثير الموقع" (site effect)، تهدد موثوقية الأبحاث الطبية، مما قد يؤدي إلى استنتاجات خاطئة حول كيفية عمل الدماغ أو كيفية تطور المرض.

ولحل هذه المشكلة، طور العلماء أدوات رياضية لتنعيم هذه الاختلافات، مما يجعل جميع الصور تبدو كما لو أنها التقطت باستخدام نفس الجهاز. ومع ذلك، تكشف دراسة جديدة أجراها نوح هيلمان وزملاؤه عن فخ خفي في كيفية استخدام هذه الأدوات حاليًا. فعندما يحاول الباحثون بناء نماذج حاسوبية للتنبؤ بحالة المريض، غالبًا ما يواجهون خيارًا صعبًا: فإذا قاموا بتضمين تشخيص المريض في عملية التنعيم، فإنهم يخاطرون بإدخال التحيز من خلال السماح للإجابة بالتأثير على عملية تحضير البيانات؛ أما إذا تركوا التشخيص خارج العملية، فقد يمحون دون قصد الإشارات البيولوجية التي يحاولون العثور عليها. يقترح الباحثون طريقة جديدة تسمى MIRTH تتجاوز هذا المأزق. فمن خلال استخدام تقنية تملأ المعلومات المفقودة بعدة تخمينات محتملة، يمكنهم تنظيف البيانات دون "إلقاء نظرة" على الإجابات، مما يضمن أن التنبؤات النهائية تستند إلى بيولوجيا حقيقية وليس إلى عيوب تقنية.

اختبر الباحثون فكرتهم باستخدام بيانات من دراستين رئيسيتين: مبادرة تصوير مرض الزهايمر (ADNI) ودراسة بالتيمور الطولية للشيخوخة (BLSA). حيث جمعوا صور مسح دماغي لأكثر من 2000 مشارك، بما في ذلك الأفراد الأصحاء والمصابين بمرض الزهايمر. وقد التُقطت هذه الصور باستخدام أجهزة من ثلاثة مصنعين مختلفين — GE وPhilips وSiemens — وبمستويين مختلفين من الطاقة. ركز الفريق على قياس حجم 145 منطقة محددة في الدماغ، مما خلق خريطة مفصلة لبنية الدماغ. ثم وضعوا سلسلة من التحديات لمعرفة ما إذا كان بإمكان طريقتهم الجديدة التنبؤ بدقة بعمر الشخص أو جنسه أو تشخيصه دون أن تضللها معلومات المستشفى الذي أُخذ فيه المسح.

وفي تجاربهم، قارن الفريق نهجهم الجديد بعدة طرق موجودة. تضمن أحد النهجين الشائعة تنعيم البيانات دون إخبار الكمبيوتر بتشخيص المريض. وأظهرت النتائج أن هذه الطريقة غالبًا ما تضعف الارتباط بين صور الدماغ والمرض، مما يجعل الكمبيوتر أقل دقة في التنبؤ بمن يعاني من الزهايمر. وحاول نهج آخر استخدام التشخيص أثناء عملية التنعيم، لكن هذا خلق نوعًا من "تسرب البيانات" (data leakage) حيث يقوم الكمبيوتر فعليًا بحفظ الإجابة قبل اختبارها، مما يؤدي إلى نتائج متفائلة للغاية وغير موثوقة. أما الطريقة الثالثة، فقد حاولت تخمين التشخيص من خلال إنشاء سيناريوهات وهمية، لكنها واجهت صعوبة عندما كانت البيانات معقدة أو عندما كانت هناك معلومات مفقودة.

عملت طريقة MIRTH الجديدة بشكل مختلف. بدأت بتدريب الكمبيوتر على مجموعة من البيانات التي يكون فيها التشخيص معروفًا، لتعليمه كيفية إزالة الاختلافات التقنية بين المستشفيات. ثم، عندما واجهت الطريقة مرضى جددًا غير معروفة تشخيصاتهم، استخدمت عملية إحصائية لتوليد عدة نسخ محتملة من المعلومات المفقودة. ولكل نسخة من هذه النسخ، طبقت قواعد التنعيم التي تم تعلمها من بيانات التدريب، مما ضمن إزالة الضجيج التقني دون الكشف عن الإجابة الحقيقية للكمبيوتر. وفي النهاية، قامت بدمج النتائج من جميع هذه النسخ لتقديم تنبؤ واحد قوي.

كانت النتائج مذهلة. ففي المحاكاة التي كان من المفترض أن يجد فيها الكمبيوتر أي رابط بين بنية الدماغ والمرض، وجدت الطرق القديمة أحيانًا رابطًا وهميًا لمجرد أن المرض كان أكثر شيوعًا في مستشفيات معينة. أما الطريقة الجديدة، فقد نجحت في عدم إيجاد أي رابط، مما أظهر قدرتها على التمييز بين البيولوجيا الحقيقية والضجيج التقني. وعندما اختبر الباحثون الطريقة على بيانات حقيقية للتنبؤ بالزهايمر والعمر والجنس، كان أداؤها مشابهًا لأفضل سيناريو ممكن حيث يُسمح للكمبيوتر باستخدام الإجابة مسبقًا، مع وجود فروق طفيفة فقط في مقاييس معينة مثل معدلات الخطأ. والأهم من ذلك، أنها فعلت ذلك دون استخدام الإجابة. وظلت التنبؤات دقيقة حتى عندما كانت البيانات غير منظمة أو عند فقدان بعض المعلومات، وهي حالة تتعثر فيها الطرق الأخرى غالبًا.

كما درست الدراسة أيضًا ما إذا كانت الطريقة قد أزالت حقًا تأثير المستشفى. فعندما طلبوا من الكمبيوتر تخمين المستشفى الذي جاءت منه صورة المسح بعد عملية التنعيم، كان أداؤه أسوأ بكثير مما كان عليه قبل العملية، رغم أن النتائج كانت لا تزال أعلى قليًا من التخمين العشوائي. أكد هذا أن الاختلافات التقنية قد مُحيت إلى حد كبير، وإن لم تكن كذلك تمامًا. وفي المقابل، عندما استخدموا الطرق القديمة التي لم تتضمن التشخيص، كان بإمكان الكمبيوتر بسهولة معرفة المستشفى الذي جاءت منه الصورة، مما يعني أن الضجيج التقني كان لا يزال موجودًا، مما قد يشوه النتائج الطبية. ووجد الباحثون أن هذا الأمر كان مهمًا بشكل خاص عندما لم يكن توزيع المرض متساويًا عبر المستشفيات؛ ففي تلك الحالات، أدى تجاهل التشخيص أثناء عملية التنظيف إلى تنبؤات أسوأ بكثير.

وعلى الرغم من أن الطريقة الجديدة أثبتت فعاليتها العالية، إلا أن الباحثين أشاروا إلى أنها ليست حلاً مثاليًا لكل المشكلات الممكنة. فعلى سبيل المثال، إذا ظهر مستشفى جديد لم يسبق رؤيته من قبل، فقد تحتاج الطريقة إلى خطوات إضافية للتكيف. بالإضافة إلى ذلك، اعتمدت الدراسة على المحاكاة والبيانات الموجودة، لذا لا تزال هناك حاجة لمزيد من العمل لمعرفة كيفية أدائها في البيئات السريرية الحية. ومع ذلك، تقدم النتائج مسارًا واضحًا للباحثين الذين يرغبون في دمج البيانات من مصادر متعددة. فمن خلال استخدام عملية تملأ الفراغات باحتمالات متعددة، يمكن للعلماء الآن تنظيف بياناتهم لإزالة الأخطاء التقنية دون إخفاء الحقائق البيولوجية التي يحاولون اكتشافها عن طريق الخطأ. وهذا يضمن أنه عندما يتنبأ نموذج حاسوبي بمرض ما، فإنه يفعل ذلك لأنه تعلم من الدماغ نفسه، وليس لأنه تعلم من الآلة التي التقطت الصورة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →