CrcBiomeScreen: a reproducible workflow for class imbalance and cross-cohort generalisability in colorectal cancer microbiome prediction
تُعد CrcBiomeScreen سير عمل (workflow) قابلًا للتكرار بلغة R/Bioconductor، حيث تُقيّم بشكل منهجي استراتيجيات المعالجة المسبقة، والتعامل مع عدم توازن الفئات، والنمذجة، لتحسين التنبؤ بالميكروبيوم لسرطان القولون والمستقيم وضمان قابلية التعميم عبر الأتراب (cohorts).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل
يعد سرطان القولون والمستقيم سبباً رئيسياً للوفاة في جميع أنحاء العالم، وغالباً ما يكون ذلك بسبب اكتشافه في وقت متأخر جداً بحيث لا يكون العلاج فعالاً تماماً. إن طرق الفحص الحالية، مثل الاختبارات التي تبحث عن الدم الخفي في البراز، مفيدة ولكنها غير مثالية؛ إذ يمكنها أن تغفل عن العلامات المبكرة للمرض أو تطلق إنذارات كاذبة لدى أشخاص أصحاء تستدعي إجراءات متابعة جراحية غير ضرورية. وفي السنوات الأخيرة، وجه العلماء اهتمامهم نحو الكائنات الدقيقة الصغيرة التي تعيش في أمعائنا، والتي تُعرف باسم "الميكروبيوم". تترك هذه المجتمعات الميكروبية بصمات كيميائية مميزة تتغير عند تطور السرطان أو الأورام قبل السرطانية. والأمل يكمن في أنه من خلال تحليل هذه الأنماط الميكروبية، يمكن للأطباء تحديد الأفراد المعرضين لخطر الإصابة بدقة أكبر من اختبارات الدم وحدها. ومع ذلك، فإن تحويل هذه الإشارات البيولوجية إلى أداة طبية موثوقة محفوف بالصعوبات؛ فالبيانات مشوشة، وعدد الأصحاء يفوق بكثير عدد المصابين بالسرطان، كما أن الطريقة التي يعالج بها الباحثون البيانات يمكن أن تغير النتائج بشكل جذري، مما يجعل من الصعب معرفة أي الطرق هي الأكثر فعالية حقاً.
وللتنقل عبر هذا التعقيد، طور فريق من الباحثين في جامعة ليدز أداة جديدة مفتوحة المص المصدر تسمى CrcBiomeScreen. وبدلاً من مجرد اقتراح طريقة واحدة "مثلى" للتنبؤ بالسرطان، قاموا ببناء إطار عمل مرن يسمح للعلماء باختبار استراتيجيات مختلفة جنباً إلى جنب لمعرفة أي منها يصمد تحت الضغط. وقد استخدموا هذا النظام لتحليل عينات براز لأكثر من 2200 شخص مشاركين في برنامج فحص حقيقي في المملكة المتحدة، بالإضافة إلى تسع مجموعات بيانات مستقلة أخرى من جميع أنحاء العالم. كان هدفهم هو معرفة أي الخطوات المحددة في التحليل — كيفية تنظيف البيانات، وكيفية عد أنواع البكتيريا المختلفة، وكيفية تعامل النماذج الحاسوبية مع حقيقة أن حالات السرطان نادرة — تؤدي إلى تنبؤات أكثر دقة وموثوقية.
اكتشف الباحثون أن الخيارات المتخذة قبل أن يبدأ الحاسوب في التعلم هي خيارات حاسمة. فقد اختبروا عدة طرق لـ "تطبيع" البيانات (normalization)، وهي عملية تعدل الاختلافات في كمية المادة الوراثية التي تم جمعها من كل عينة. ووجدوا أن طريقة محددة تسمى GMPR، والتي تأخذ في الاعتبار الطريقة الفريدة التي تتشكل بها المجتمعات الميكروبية، تنتج باستمرار نتائج أفضل من الطرق الأقدم والأبسط. كما بحثوا فيما إذا كان من المهم تضمين البكتيريا التي لم يتم استزراعها بنجاح في المختبر، والتي غالباً ما توصف بأنها "غير مستزرعة". وأظهرت الدراسة أن الاحتفاظ بهذه البكتيريا الغامضة وغير المستزرعة في التحليل لم يضر بأداء النموذج، بل قد يحافظ في الواقع على أدلة قيمة عن المرض كان من الممكن فقدانها لولا ذلك. علاوة على ذلك، حددوا أن النظر إلى البكتيريا على مستوى "الجنس" (genus) — وهو تصنيف واسع يجمع الأنواع ذات الصلة معاً — وفر أفضل توازن؛ فهذا المستوى من التفصيل كان محدداً بما يكفي ليكون ذا معنى بيولوجي، وواسعاً بما يكفي ليتم التعرف عليه باستمرار عبر مختلف المختبرات وتقنيات التسلسل الجيني.
إن أحد العقبات الرئيسية في فحص السرطان هو عدم التوازن الشديد بين الأصحاء والمصابين بالمرض. ففي برامج الفحص الواقعية، يوجد مقابل كل شخص مصاب بالسرطان مئات أو آلاف الأشخاص الأصحاء. وإذا تم تدريب نموذج حاسوبي على مجموعة بيانات تحتوي على الكثير من حالات السرطان، فقد يؤدي أداءً جيداً في المختبر ولكنه سيفشل فشلاً ذريعاً عند تطبيقه على عامة الناس. قام الفريق بمحاكاة هذا الاختلال الشديد من خلال إنشاء سيناريوهات اختبار حيث يفوق عدد الأصحاء عدد حالات السرطان بفارق هائل. ووجدوا أن تقنية تسمى "وزن الفئات" (class weighting) كانت ضرورية؛ فهذا النهج يخبر الحاسوب بضرية إعطاء اهتمام إضافي لحالات السرطان النادرة أثناء التدريب، مما يجعل النموذج أكثر حساسية للمرض دون أن يفقد قدرته على تحديد الأصحاء بشكل صحيح. وعند تطبيق هذا الوزن، حافظ النموذج على قدرته على رصد حالات السرطان مع تقليل عدد الأصحاء الذين تم تصنيفهم خطأً على أنهم مرضى بشكل كبير. وتعد هذه الزيادة في الدقة أمراً حيوياً للفحص، لأنها تساعد في تجنب عمليات تنظير القولون غير الضرورية وما يرافقها من قلق.
بعد ذلك، اختبر الباحثون مدى فعالية هذه النماذج عند نقلها من مجموعة بيانات المملكة المتحدة إلى مجموعات سكانية مختلفة تماماً من تسع دول أخرى. وهنا أحدث اختيار الخوارزمية الحاسوبية فرقاً مفاجئاً. فقد أثبت نوع من النماذج يُعرف باسم "الغابة العشوائية" (Random Forest) أنه ثابت وموثوق للغاية، حيث قدم أداءً جيداً باستمرار حتى عندما كانت بيانات التدريب محدودة أو كانت المجموعات السكانية مختلفة جداً. أما النوع الآخر، المسمى "XGBoost"، فقد كان أكثر قوة عند تدريبه على مجموعات بيانات كبيرة ومتنوعة، محققاً دقة أعلى في تلك الظروف المحددة، ولكنه أظهر تبايناً أكبر عندما تكون البيانات أصغر. وتشير الدراسة إلى أنه لا توجد "وصفة سحرية" واحدة من الخوارزميات تعمل بشكل أفضل في كل حالة؛ بل إن النهج الأفضل يعتمد على حجم وطبيعة البيانات المتاحة.
في نهاية المطاف، تكمن قيمة CrcBiomeScreen في شفافيته ومرونته. فهو لا يجبر الباحثين على استخدام طريقة واحدة جامدة، بل يوفر طريقة منظمة لمقارنة الخيارات المختلفة، مما يضمن أن الأداة النهائية المختارة هي التي تعمل بشكل أفضل للمجموعة البيانية المتاحة. ومن خلال إثبات أن الاهتمام الدقيق بمعالجة البيانات، وتضمين البكتيريا غير المستزرعة، واستخدام وزن الفئات يمكن أن يحسن الأداء بشكل كبير، تقدم الدراسة خارطة طريق لتطوير أدوات فحص تعتمد على الميكروبيوم وتكون أكثر موثوقية. ورغم أن هذه النماذج ليست جاهزة بعد لتحل محل الاختبارات الحالية، إلا أنها تمثل خطوة مهمة نحو مستقبل يمكن فيه لاختبار بسيط للبراز أن يحدد بدقة أكبر من يحتاج إلى عناية طبية عاجلة، مما يساعد في اكتشاف سرطان القولون والمستقيم في وقت مبكر وإنقاذ المزيد من الأرواح.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.