Identical runs disagree more than different models: reproducibility limits in deep learning for brain-tumour MRI classification
تُظهر هذه الدراسة أن التباينات العشوائية غير المنضبطة في عمليات التعلم العميق المتطابقة اسمياً لتصنيف صور الرنين المغناطيسي لأورام الدماغ يمكن أن تتجاوز فروق الأداء بين بنيات النماذج المختلفة، مما يقوض موثوقية دراسات الاستئصال المعيارية ويستلزم بروتوكولات أكثر صرامة لإعادة الإنتاج.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم التصوير الطبي عالي المخاطر، يُطلب من الحواسيب بشكل متزايد النظر في صور دماغ الإنسان ورصد الأورام. هذه الصور، التي تُسمى فحوصات الرنين المغناطيسي (MRI)، معقدة وتفصيلية، والبرمجيات المستخدمة لتحليلها تعتمد على نوع من الذكاء الاصطناوي يُعرف بالتعلم العميق. ولتدريب هذه الأنظمة، يغذي الباحثون هذه الحواسيب بآلاف الصور ويتركون الكمبيوتر يتعلم الأنماط بمفرده، مع تعديل إعداداته الداخلية ملايين المرات حتى يصبح أفضل في تحديد المرض. والهدف هو إنشاء أداة يمكن للأطباء الوثوق بها للمساعدة في تشخيص حالات مثل أورام الدماغ. ومع ذلك، لكي تكون هذه التكنولوجيا آمنة ومفيدة، يجب أن تكون النتائج متسقة؛ فإذا عُرضت على الكمبيوتر نفس البيانات مرتين، فمن المفترض أن يعطي نفس الإجابة. وعندما يقارن العلماء بين نموذجين مختلفين من الحواسيب لمعرفة أيهما أفضل، فإنهم غالبًا ما يبحثون عن فروق ضئيلة جدًا في الدقة، تصل أحيانًا إلى مجرد جزء من المئة في المائة، لتحديد أي نموذج يجب أن يمضي قدمًا نحو الاختبار في العالم الحقيقي.
وضع باحث في جامعة سان فرانسيسكو باي هدفًا لاختبار فكرة محددة: ما إذا كان إضافة نوع خاص من الاستدلال إلى نموذج حاسوبي قياسي لتصوير الدماغ سيجعله أفضل في رصد الأورام. ينظر النموذج القياسي إلى الصورة مباشرة، بينما يحاول الإصدار الجديد فهم العلاقات بين أجزاء مختلفة من الصورة، بشكل يشبه كيفية ربط الإنسان بين النقاط أو الميزات. وقد بنى الباحث تجربة صارمة لاختبار هذا، حيث قام بتشغيل نماذج الكمبيوتر مرارًا وتكرارًا لمعرفة ما إذا كان النهج الجديد يقدم ميزة حقيقية. ومع ذلك، فإن ما وجده لم يكن طفرة في اكتشاف الأورام، بل اكتشافًا مذهلاً حول موثوقية عملية الاختبار نفسها. فقد اكتشف أن عملية تدريب الكمبيوتر نفسه كانت غير مستقرة لدرجة أن تشغيلين متطابقين لنفس النموذج تمامًا يمكن أن ينتجا نتائج تختلف عن بعضها البعض بأكبر من الفروق الضئيلة التي كان يحاول قياسها بين النموذجين المختلفين.
بدأت الدراسة بمجموعة كبيرة من شرائح الرنين المغناطيسي لمئات المرضى، تم تقسيمها بعناية بحيث لا تظهر بيانات مريض واحد في كل من مجموعتي التدريب والاختبار. كان هذا أمرًا بالغ الأهمية، لأنه إذا رأى الكمبيوتر ورم نفس المريض في كلا المجموعتين، فسيقوم ببساما حفظ ذلك الشخص المحدد بدلاً من تعلم التعرف على المرض بشكل عام. قام الباحث بتدريب نموذج قياسي ونسخة أكثر تعقيدًا تتضمن طبقة استدلال إضافية. وقام بتشغيل كل نسخة عدة مرات، مع تغيير رقم عشوائي للبداية، يُعرف باسم "البذرة" (seed)، ليرى كيف تتباين النتائج. وفي عالم علوم الحاسوب، من المفترض أن تضمن هذه "البذرة" أنه إذا بدأت بنفس الرقم، فسيقوم الكمبيوتر بالشيء نفسه تمامًا في كل مرة. وكان التوقع هو أن يكون النموذج المعقد أفضل قليلاً أو أسوأ قليلاً من النموذج البسيط، وأن تشغيل الاختبار ثلاث مرات سيعطي متوسطًا واضحًا.
بدلاً من ذلك، أظهرت النتائج نمطًا فوضويًا. فعندما قام الباحث بتشغيل نفس تكوين النموذج مرتين مع نفس رقم البداية، اختلفت درجات الدقة بأكثر من نقطتين مئويتين في المتوسط. كان هذا التباين كبيرًا لدرجة أنه غطى تمامًا على الفروق الصغيرة بين النموذجين المختلفين اللذين كان يقارن بينهما. في الواقع، كان الفرق بين التشغيلين المتطابقين أكبر من ضعف الفرق بين النموذج البسيط والمعقد. وهذا يعني أن التجربة كانت تقيس "الضجيج" بدلاً من "الإشارة". وأدرك الباحث أن الكمبيوتر لم يكن يتصرف كأداة موثوقة؛ فقد كان الأمر كما لو أن ميزانًا يُستخدم لوزن عملات ذهبية يعطي قراءة مختلفة في كل مرة تقف فيها عليه، حتى لو وقفت في نفس المكان تمامًا.
بالتعمق أكثر، وجد الباحث سببين رئيسيين لعدم الموثوقية هذه. أولاً، تم إعداد الكمبيوتر بشكل غير صحيح؛ حيث كان يتم تطبيق الرقم العشووي للبداية بعد بناء النموذج بالفعل، مما يعني أن الإعدادات الأولية للنموذج كانت لا تزال عشوائية وغير منضبطة. وحتى بعد إصلاح هذا الخطأ وتطبيق رقم البداية قبل بناء النموذج، لم تكن النتائج متطابقة تمامًا. أما المشكلة الثانية، فكانت مخبأة في أعماق المحرك الرياضي للكمبيوتر. فرغم أن البرنامج يدعي العمل في وضع "حتمي" (deterministic) تمامًا، إلا أن جزءًا معينًا من الحسابات المستخدمة لتعليم النموذج كان ينتج نتائج مختلفة قليلاً في كل مرة. كان هذا الخلل الخفي غير مرئي لعمليات التحقق القياسية التي يستخدمها الباحثون لضمان إمكانية إعادة إنتاج تجاربهم.
كما كشفت الدراسة أن الطريقة التي يتم بها تقسيم البيانات يمكن أن تغير النتيجة بشكل كبير. فعندما قسم الباحث البيانات حسب شرائح الرنين المغناطيسي الفردية بدلاً من المريض، قفزت دقة الكمبيوتر بنسبة تقارب خمسة في المئة. حدث هذا لأن الكمبيوتر كان يتعرف أساسًا على أنماط من نفس المريض في كل من مجموعتي التدريب والاختبار، مما سمح له بالتعرف على المريض بدلاً من الورم. كانت هذه الدرجة المرتفعة مجرد وهم، حيث حجبت قدرة النموذج الحقيقية. علاوة على ذلك، عندما اختبر الباحث مدى قدرة النماذج على التعامل مع الصور المشوهة أو المشوشة، أشار تشغيل اختبار واحد إلى أن أحد النماذج أكثر قوة، ولكن عند تكرار الاختبار، انقلت النتيجة لتظهر أن النموذج الآخر هو الأفضل. أثبت هذا الانقلاب أن تجربة واحدة ليست كافية للتوصل إلى استنتاج.
كان الاستنتاج النهائي للعمل هو أن طبقة الاستدلال الإضافية لم تحسن القدرة على اكتشاف أورام الدماغ. فالنموذج المعقد لم يكن أفضل، بل كان في بعض الجوانب أبطأ وأقل موثوقية. والأهم من ذلك، أن الدراسة سلطت الضوء على خلل حرج في كيفية إجراء العديد من درسات الذكاء الاصطناعي الطبي. فالفروق التي يدعي الباحثون وجودها غالبًا ما تكون أصغر من التباين الطبيعي في عملية الاختبار نفسها. وجادل الباحث بأنه قبل أن يتمكن العلماء من الثقة في نموذج جديد، يجب عليهم أولاً التحقق من أن إعداد الاختبار الخاص بهم مستقر بما يكفي للكشف عن التغييرات الصغيرة. ويتضمن ذلك التحقق من تطبيق أرقام البداية العشوائية بشكل صحيح وتشغيل نفس الاختبار مرتين لقياس التباين الطبيعي. هذه الفحوصات لا تكلف سوى القليل من الوقت والجهد، ومع ذلك يتم تخطيها غالبًا. وبدون هذه الفحوصات، يخاطر المجال ببناء أدوات طبية على أسس هشة للغاية بحيث لا يمكنها تحمل ثقل القرارات السريرية. وتعد هذه الورقة تذكيرًا بأنه في السعي وراء تكنولوجيا طبية أفضل، فإن ضمان دقة أداة القي بالقدر نفسه من الأهمية التي تكتسبها الأداة نفسها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.