Clinical trial success prediction from open registry text using classical machine learning
تُظهر هذه الدراسة أن نماذج تعلم الآلة الكلاسيكية، ولا سيما الغابات العشوائية، يمكنها التنبؤ بفعالية بنجاح التجارب السريرية باستخدام النصوص المتاحة في السجلات العامة من موقع ClinicalTrials.gov فقط، محققةً أداءً متوسطاً إلى قوي عبر مختلف مراحل التجارب ودواعي الاستعمال مع الحد من تسرب البيانات من خلال المعالجة المسبقة الصارمة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تضخ شركات الأدوية كل عام مليارات الدولارات وعقوداً من الجهد لتطوير أدوية جديدة. إن المسار من فكرة واعدة في المختبر إلى قرص دواء على رف الصيدلية طويل ومحفوف بالفشل. معظم المرشحين من الأدوية لا يصلون أبداً إلى مرحلة الاعتماد، وعندما يفشلون بعد سنوات من العمل، تكون الخسارة المالية هائلة. والأهم من ذلك، أن الأشخاص الذين يتطوعون لهذه الدراسات يواجهون مخاطر دون الحصول على الفوائد المرجوة. ولأن الموارد محدودة، فإن كل دولار وكل ساعة تُنفق على دواء سيفشل في النهاية هي مورد يُؤخذ من دواء قد ينجح. لطالما بحثت الصناعة عن وسيلة لتحديد هذه المرشحات المحكوم عليها بالفشل مبكراً، قبل استثمار الكثير من الوقت والمال، مما يسمح للباحثين بإيقاف البرامج الضعيفة والتركيز على القوية منها.
وللقيام بذلك، حاول العلماء التنبؤ بنتائج التجارب السريرية، وهي الاختبارات الصارمة التي تُجرى فيها علاجات جديدة على المرضى. هذه التنبؤات صعبة لأنها تعتمد على فهم البيولوجيا البشرية المعقدة، والتصميم المحدد للدراسة، وسلوك الدواء الجديد. تقليدياً، استخدم الخبراء خبرتهم لتخمين أي التجارب ستنجح، لكن هذه العملية بطيئة وذاتية وتكلف الكثير. وفي السنوات الأخيرة، اتجه الباحثون إلى التعلم الآلي، باستخدام الحواسيب لإيجاد أنماط في البيانات قد تغفل عنها البشرية. ومع ذلك، فإن العديد من هذه النماذج الحاسوبية تعتمد على بيانات خاصة لا يمكن الوصول إليها إلا من قبل الشركات الكبرى، أو تتطلب معلومات جزيئية معقدة لا تتوفر دائماً. وهذا يترك المجموعات الأصغر والباحثين الأكاديميين دون وسيلة واضحة لتقدير فرص نجاح التجربة.
تستكشف دراسة جديدة أجراها الباحث المستقل مايكل دواين ما إذا كانت السجلات العامة لهذه التجارب، والتي يمكن لأي شخص قراءتها عبر الإنترنت، تحتوي على معلومات كافية لإجراء هذه التنبؤات. تركز الدراسة على مجموعة ضخمة من سجلات التجارب من موقع إلكتروني عام يسمى ClinicalTrials.gov. يعمل هذا الموقع كسجل عالمي حيث يجب على الباحثين تسجيل دراساتهم قبل بدئها، ونشر تفاصيل حول المرض الذي يتم علاجه، والدواء الذي يتم اختباره، وعدد المرضى المشاركين، وأهداف البحث. يتساءل عمل "دواين" سؤالاً بسيطاً: إذا قمت بتغذية الأوصاف النصية من هذه السجلات العامة في حاسوب، فهل يمكن للحاسوب أن يتعلم التمييز بين التجارب التي ستنجح وتلك التي ستفشل؟
للإجابة على ذلك، استخدم الباحث مجموعة بيانات تسمى "مجموعة بيانات نتائج التجارب السريرية"، والتي توفر تصنيفاً لحوالي 125,000 تجربة سابقة، وتحدد ما إذا كانت ناجحة أم غير ناجحة بناءً على نتائجها النهائية. كان التحدي هو بناء نموذج يمكنه التنبؤ بهذه النتائج باستخدام النص المتاح فقط في السجل العام وقت تسجيل التجربة، دون الاطلاع على النتائج النهائية أو استخدام أي بيانات خاصة بالشركات. كان على الباحث أن يكون حذراً للغاية لتجنب خطأ شائع يسمى "تسرب البيانات"، حيث يتعلم نموذج الحاسوب بالخطأ الإجابة من خلال قراءة جزء من النص تم تحديثه بعد انتهاء التجربة. على سبيل المثال، قد يُعاد كتابة ملخص لتجربة ما بعد سنوات ليشمل النتائج النهائية، وإذا قرأ الحاسوب هذا النص المحدث، فهو لا يتنبأ بالمستقبل حقاً، بل يقرأ الماضي فحسب.
ولمنع حدوث ذلك، قام الباحث بتنظيف البيانات بدقة، حيث أزال أي سجلات قد يكون النص فيها قد عُدل بعد معرفة النتيجة. كما استبعد حقولاً محددة تصف النتائج بشكل مباشر. وبمجرد تأمين البيانات، قام بتدريب ثلاثة أنواع مختلفة من نماذج الحاسوب للبحث عن أنماط في النص المتبقي. تم اختبار هذه النماذج على تجارب من مراحل تطوير مختلفة، تُعرف بالمراحل (phases). المرحلة الأولى هي المرة الأولى التي يُختبر فيها الدواء على البشر للتحقق من السلامة، والمرحلة الثانية تبحث عن علامات تدل على أن الدواء يعمل بالفعل، أما المرحلة الثالثة فهي دراسات كبيرة تؤكد فعالية الدواء وسلامته قبل اعتماده.
أظهرت النتائج أن النماذج الحاسوبية يمكنها بالفعل إيجاد إشارات مفيدة في النص العام. وكان النموذج الأفضل أداءً، والذي استخدم طريقة تسمى "الغابة العشوائية" (random forest)، قادراً على التمييز بين التجارب الناجحة والفاشلة بشكل أفضل من الصدفة. وفي مرحلة الاختبار الأولى، المرحلة الأولى، كان أداء النموذج جيداً للغاية، حيث صنف النتائج بشكل صحيح في حوالي 74 بالمئة من الحالات. وهذا يعني أنه إذا أخذت مجموعة من تجارب المرحلة الأولى، يمكن للنموذج تحديد تلك الأكثر عرضة للنجاح بدرجة عالية من الدقة. وكان الأداء أقل في تجارب المرحلة الثانية، وهي مرحلة صعبة التنبؤ بها بشكل كبير لأنها تعتمد بشدة على ما إذا كان الدواء يصيب الهدف البيولوجي الصحيح، وهو تفصيل غالباً ما يغيب عن الملخصات العامة. ومع ذلك، ظل أداء النموذج أفضل من الصدفة في هذه المرحلة أيضاً.
كانت واحدة من أكثر النتائج إثارة للاهتمام هي أن تدريب النموذج على مجموعة متنوعة من الأمراض ساعده بالفعل في التنبؤ بنتائج مجموعة محددة من الأمراض تُعرف باسم "علوم الأعصاب". تجارب علوم الأعصاب، التي تتعامل مع حالات مثل مرض الزهايمر والاكتئاب، تاريخياً ما كانت تسجل معدلات فشل عالية جداً. وجد الباحث أنه عندما تم تدريب الحاسوب على تجارب من جميع المجالات الطبية، وليس فقط علوم الأعصاب، أصبح أكثر قدرة على التنبؤ بنجاح تجارب علوم الأعصاب. يشير هذا إلى أن القواعد العامة لكيفية تصميم وإدارة التجربة السريرية متشابهة عبر مختلف أنواع الأمراض، وأن التعلم من نطاق واسع من الأمثلة يساعد الحاسوب على فهم التحديات الخاصة بالجهاز العصبي.
كما اختبرت الدراسة النموذج مقابل مجموعة من 7,260 حالة صعبة تمت مراجعتها يدوياً من قبل خبراء بشريين لضمان أنها لم تكن سهلة التخمين. وحتى أمام هذه الأمثلة الصعبة، حافظ النموذج على قدرته على التمييز بين النجاح والفشل، مما يثبت أنه لم يكن يحفظ قواعد بسيطة فحسب، بل كان يتعلم شيئاً ما حول طبيعة التجارب السريرية. كما تحقق الباحث مما إذا كان النموذج يعتمد على أسماء الشركات الراعية للتجارب أو المواقع التي أقيمت فيها. وعندما تمت إزالة هذه التفاصيل، انخفض أداء النموذج بشكل طفيف فقط، مما يشير إلى أن النص الذي يصف العلم وتصميم الدراسة هو الذي يحمل معظم الوزن التنبئي.
يُظهر هذا العمل أن المعلومات العامة، التي كانت متاحة لسنوات ولكن لم يتم تحليلها بهذه الطريقة، تحمل قيمة كبيرة لصناعة الأدوية. فالنماذج المستخدمة في هذه الدراسة بسيطة نسبياً ولا تتطلب حواسيب فائقة القدرة أو بيانات سرية؛ إذ يمكن تشغيلها على حاسوب محمول عادي. وهذا يجعل النهج متاحاً للباحثين الأكاديميين، والمنظمات غير الربحية، والشركات الأصغر التي لا تملك قواعد بيانات مملوكة لها. ومن خلال توفير وسيلة لتقدير احتمالية النجاح باستخدام البيانات المفتوحة فقط، يقدم هذا الأسلوب أداة جديدة لفحص المرشحين من الأدوية. إنه لا يحل محل الحاجة إلى الحكم الخبير والعمل المعقد لتطوير الأدوية، ولكنه يوفر نقطة انطلاق موضوعية وموثوقة. ويمكنه مساعدة الفرق في تحديد البرامج التي تستحق المزيد من الاهتمام وتلك التي قد تحتاج إلى التوقف المبكر، مما قد يوفر الوقت والمال وسلامة المرضى الذين يتطوعون لهذه الدراسات الحاسمة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.