← أحدث الأبحاث
📊 statistics

Extending Deep Cox Survival Models with Case-Cohort risk set Sampling

تقدم هذه الورقة البحثية وتقيم أول دمج لأسلوب أخذ عينات مجموعة الحالات والمخاطر (case-cohort risk-set sampling) في الشبكات العصبية لنموذج كوكس للمخاطر النسبية المتناسبة العميق، مظهرةً أنه في حين أن أخذ عينات الحالات والضوابط المتداخلة (nested case-control sampling) يقترب باستمرار من أداء مجموعة المخاطر الكاملة، فإن التدريب بنظام الدفعات الصغيرة (mini-batch training) يُمكّن أسلوب أخذ عينات مجموعة الحالات والمخاطر من تحقيق دقة مماثلة مع توفير كبير في العمليات الحسابية.

المؤلفون الأصليون: Justine Nasejje, Michael P. Falk, Marvin N. Wright, Wende Clarence Safari, Pierre-Philippe Dechant, Raeesa Manjoo Docrat, Rukia Nuermaimaiti

نُشر 2026-09-17
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Justine Nasejje, Michael P. Falk, Marvin N. Wright, Wende Clarence Safari, Pierre-Philippe Dechant, Raeesa Manjoo Docrat, Rukia Nuermaimaiti

البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الأبحاث الطبية والهندسة، غالباً ما يكون التنبؤ بمتى سيحدث شيء ما أكثر قيمة من معرفة متى سيحدث بالضبط. وسواء كان ذلك فشلاً في جزء من آلة أو نجاة مريض من مرض ما، يستخدم العلماء طريقة تسمى "تحليل البقاء" لدراسة الوقت حتى وقوع الحدث. ويتمثل أحد التحديات الرئيسية في هذا المجال في أن الدراسات غالباً ما تنتهي قبل أن يمر جميع الأشخاص بالحدث؛ فبعض الناس لا يزالون على قيد الحياة عند إغلاق الدراسة، أو أن الآلة لا تزال تعمل. يُعرف هذا بـ "البيانات المبتورة من جهة اليمين"، وهو أمر يتطلب أدوات إحصائية خاصة للتعامل مع المعلومات غير المكتملة دون التخلص من البيانات القيمة الموجودة بالفعل. ولعقود من الزمن، كانت الأداة القياسية لهذا الغرض هي نموذج يحسب المخاطر بناءً على مجموعة من الأشخاص الذين لا يزالون معرضين للخطر في أي لحظة معينة، وهو ما يُعرف باسم "مجموعة الخطر".

ومع انفجار حجم البيانات، حيث تتبع الدراسات الحديثة آلاف المرضى وملايين النقاط البيانية، أصبحت هذه الحسابات التقليدية تشكل عنق زجاجة. فلكي تتم معالجة البيانات، يجب على الكمبيوتر النظر في كل شخص لا يزال في الدراسة في كل مرة يقع فيها حدث ما، وهي عملية تتطلب قدرة حوسبة وذاكرة هائلة. وهذا يخلق حاجزاً أمام استخدام تقنيات الذكاء الاصطناعي القوية والحديثة، والتي تزدهر مع مجموعات البيانات الكبيرة ولكنها تعاني عندما تُجبر على أداء هذه الحسابات الثقيلة والمتكررة. ويتساءل الباحثون الآن كيف يمكن الحفاظ على دقة هذه النماذج المتقدمة مع جعلها سريعة بما يكفي للعمل على مجموعات البيانات الضخمة في القرن الحادي والعشرين.

قام فريق من الباحثين من جامعات في جنوب أفريقيا وألمانيا والمملكة المتحدة بمعالجة هذه المشكلة من خلال اختبار طريقة جديدة لتدريب الشبكات العصبية العميقة، وهي نوع من الذكاء الاصطناعي المصمم لإيجاد أنماط معقدة في البيانات. كان هدفهم هو معرفة ما إذا كان بإمكانهم تسريع عملية التدريب من خلال عدم النظر في كل شخص في الدراسة في وقت واحد، بل بدلاً من ذلك، النظر في عينة مختارة بعناية. وقارنوا بين استراتيجيتين لأخذ العينات: إحداهما تختار عدداً قليلاً من الأشخاص الجدد للمقارنة مع كل حدث في كل مرة، والأخرى تختار مجموعة ثابتة من الأشخاص في بداية الدراسة وتستمر معهم. واختبروا هذه الطرق على كل من البيانات المولدة حاسوبياً، حيث تكون الإجابة الحقيقية معروفة، وعلى مجموعة بيانات واقعية لمرضى سرطان الثدي، مع قياس مدى جودة تنبؤ النماذج للبقاء وكمية ذاكرة الكمبيوتر والوقت الذي تطلبتها.

وجد الباحثون أن الطريقة التي تختار مجموعة جديدة من الأشخاص لكل حدث، والمعروفة باسم "أخذ عينات الحالة والضابطة المتداخلة"، تعمل بشكل مثالي تقريباً. وسواء استخدموا مجموعة البيانات بأكملها أو مجرد عينة صغيرة، فقد أنتج هذا النهج تنبؤات مطابقة تقريباً للطريقة البطيئة والثقيلة التي تنظر إلى الجميع. لقد تعلم النموذج الأنماط الصحيحة، وكانت التنبؤات دقيقة تماماً مثل النهج القياسي، لكنه فعل ذلك دون التكلفة الحوسبية الهائلة. وهذا يشير إلى أنه بالنسبة للعديد من المشكلات واسعة النط scale، يمكن للباحثين استخدام هذه الحيلة في أخذ العينات بأمان لتسريع نماذجهم دون فقدان أي قوة تنبؤية.

أما الطريقة الثانية، المسماة "أخذ عينات الحالة والمجموعة"، فقد تصرفت بشكل مختلف وكشفت عن قصة أكثر تعقيداً. فعندما استخدم الباحثون مجموعة ثابتة صغيرة جداً من الأشخاص لتمثيل الدراسة بأكملها، واجه النموذج صعوبة كبيرة. وفي الاختبارات مع مجموعة صغيرة، انخفضت قدرة النموذج على التمييز بين المرضى ذوي المخاطر العالية والمرضى ذوي المخاطر المنخفضة بشكل حاد، وأصبحت التنبؤات غير موثوقة. ومع ذلك، اكتشف الباحثون أن الطريقة التي يعالج بها الكمبيوتر البيانات تغير كل شيء. فعندما انتقلوا من معالجة مجموعة البيانات بأكملها دفعة واحدة إلى معالجتها في دفعات صغيرة وسريعة، تحسن أداء المجموعة الثابتة الصغيرة بشكل كبير. ومع أسلوب المعالجة الأسرع هذا، تمكنت حتى مجموعة صغيرة من الأشخاص من مساعدة النموذج على التعلم بفعالية، مستردة معظم دقتها مع توفير قدر كبير من موارد الحوسبة.

كما بحثت الدراسة في كيفية تأثير هذه الطرق على الكمبيوتر نفسه. فالطريقة التقليدية لمعالجة جميع البيانات دفعة واحدة تتطلب كمية هائلة من الذاكرة، تصل غالباً إلى ستة جيجابايت أو أكثر، مما قد يؤدي إلى تعطل أجهزة الكمبيوتر القياسية. ومن خلال الانتقال إلى نهج الدفعات، انخفض استخدام الذاكرة إلى أقل من نصف جيجابايت، مما جعل هذه النماذج المتقدمة متاحة على أجهزة أصغر بكثير. لاحظ الباحثون أنه بينما كانت طريقة المجموعة الثابتة الصغيرة غير مستقرة عندما ينظر الكمبيوتر إلى كل شيء دفعة واحدة، فإن نهج الدفعات عمل على تنعيم الأخطاء، مما سمح للنموذج بالتعلم بثبات. هذا التوازن بين حجم العينة وطريقة معالجة البيانات يقدم مجموعة أدوات جديدة للعلماء: يمكنهم اختيار استخدام طريقة تكون دائماً قوية، أو استخدام طريقة أصغر وأسرع إذا كانوا مستعدين لتعديل كيفية تعامل الكمبيوتر مع البيانات.

في نهاية المطاف، يجسّر هذا العمل الفجوة بين الإحصاء الكلاسيكي والذكاء الاصطناعي الحديث. فهو يوضح أن العمل الشاق المطلوب لتحليل بيانات البقاء لا يجب أن يتم من خلال النظر في كل شخص في الدراسة في كل لحظة من اللحظات. ومن خلال استخدام تقنيات أخذ عينات ذكية، لا سيما عند الجمع بينها وبين طرق التدريب الحديثة، يمكن للباحثين بناء نماذج قوية تكون دقيقة وفعالة في آن واحد. وتشير النتائج إلى أنه بالنسبة لمستقبل تحليل البقاء، فإن المفتاح ليس فقط امتلاك المزيد من البيانات، بل معرفة كيفية النظر إليها بطريقة تحترم حدود أجهزة الكمبيوتر الخاصة بنا مع الحفاظ على الحقيقة الكامنة داخل الأرقام.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →