A Comparative Evaluation of Sample Selection Algorithms for Multivariate Calibration in Near-Infrared Spectroscopic Analysis of Pharmaceutical Formulations
تُظهر هذه الدراسة أن خوارزمية كينارد-ستون، التي تم تقييمها عبر انحدار العملية الغاوسية على أطياف الأشعة تحت الحمراء القريبة لأقراص الباراسيتامول، تتفوق على طرق اختيار العينات الأخرى في إنشاء نماذج معايرة متعددة المتغيرات قوية، كما أكدت ذلك الإحصاءات التنبؤية المتفوقة والاختبارات غير المعلمية الصارمة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم التصنيع الدوائي، يعد ضمان احتواء كل حبة على الكمية الصحيحة تماماً من الدواء مسأة تتعلق بالسلامة والثقة. لعقود من الزمن، اعتمد الكيميائيون تقنية تسمى مطيافية الأشعة تحت الحمراء القريبة للتحقق من هذه الجودة. تخيل تسليط نوع خاص من الضوء على كومة من مسحوق الدواء المسحوق؛ الطريقة التي يرتد بها هذا الضوء عن المسحوق تخلق بصمة فريدة تكشف عن تركيبته الكيميائية. هذه الطريقة سريعة، ولا تدمر العينة، وتتطلب تحضيراً ضئيلاً جداً. ومع ذلك، فإن تحويل أنماط الضوء هذه إلى أداة موثوقة لقياس قوة الدواء ليس ببساطة توجيه كاميرا والتقاط صورة. يحتاج الكمبيوتر إلى تعلم كيفية قراءة هذه البصمات، وهي عملية تسمى بناء النموذج. لتعليم الكمبيوتر، يجب على العلماء إطلاعه على مجموعة من العينات ذات كميات دوائية معروفة. ويكمن التحدي الحاسم في تحديد أي عينات محددة يتم عرضها على الكمبيوتر للتعلم وأيها يتم حفظها للاختبار النهائي. فإذا تم اختيار مجموعة التعلم بشكل سيئ، فقد يحفظ الكمبيوتر أمثلة التدريب بشكل مثالي ولكنه قد يفشل تماماً عندما يواجه حبة جديدة لم يسبق له رؤيتها.
وضع فريق من الباحثين في باماكو، مالي، هدفهم لحل هذا اللغز المحدد المتعلق باختيار العينات. لقد عملوا مع ثمانية وخمسين قرصاً تجارياً من الباراسيتامول، تمثل دفعات مختلفة من الصيدليات في جميع أنحاء المدينة. كان هدفهم هو اختبار أربع استراتيجيات حاسوبية مختلفة لتقسيم هذه الأقراص الثمانية والخمسين إلى مجموعة تعلم ومجموعة اختبار. تعمل إحدى الاستراتيجيات، المعروفة باسم خوارزمية "كينارد-ستون" (Kennard–Stone)، من خلال اختيار عينات تكون مختلفة عن بعضها البعض قدر الإمكان، مما يضمن أن يرى الكمبيوتر النطاق الكامل للاختلافات. وهناك طريقة أخرى، تسمى طريقة "هونيجز" (Honigs)، تختار العينات التي تضيف أكبر قدر من المعلومات الجديدة في كل خطوة. أما النهج الثالث، "دوبلكس" (Duplex)، فيحاول بناء مجموعتي التعلم والاختبار في وقت واحد للحفاظ على توازنهما، بينما تقوم الطريقة الرابعة، "نايس" (Naes)، بتجميع الأقراص المتشابهة معاً واختيار عينة ممثلة من كل مجموعة. ولرؤية أي استراتيجية كانت الأفضل، استخدم الباحثون نهجاً رياضياً متطوراً يسمى "انحدار العملية الغاوسية" (Gaussian process regression) لبناء نماذجهم، وهو أسلوب وجدوه فعالاً للغاية لهذا النوع من البيانات.
كانت النتائج واضحة وحاسمة. فعندما قارن الباحثون أداء هذه الاستراتيجيات الأربع، برزت خوارزمية "كينارد-ستون" كالأكثر موثوقية، تلتها عن قرب طريقة "هونيجز". حققت النماذج المبنية باستخدام هاتين الاستراتيجيتين دقة في التنبؤ بمحتوى الدواء تقترب من المثالية، حيث حققت درجة 0.99999 على مقياس يكون فيه الواحد صحيحاً تماماً، وجعلت الأخطاء صغيرة جداً لدرجة أنها قيست بأجزاء من المليون. في المقابل، أظهرت استراتيجيتي "دوبلكس" و"نايس"، رغم إظهارهما لنتائج ممتازة خلال مرحلة التدريب، أداءً أسوأ بكثير عند اختبارهما على بيانات جديدة. وهذا يشير إلى أن تلك الطرق أدت على الأرجح إلى جعل الكمبيوتر يحفظ مجموعة التدريب بدلاً من تعلم الأنماط الأساسية، وهي مشكلة تُعرف باسم "الفرط في التخصيص" (overfitting). كما اختبر الباحثون طريقة الاختيار العشوائي البسيطة، حيث يتم تقسيم الأقراص إلى مجموعات عن طريق المصادفة، ووجدوا أنها أنتجت أسوأ النتائج على الإطلاق، مما أكد أن اتباع نهج مدروس ومنظم أمر ضروري.
ولضمان أن هذه النتائج لم تكن مجرد ضربة حظ، أخضع الفريق البيانات لاختبارات إحصائية صارمة. وأكد التحليل أن الأداء المتفوق لطريقتي "كينارد-ستون" و"هونيجز" كان ذا دلالة إحصائية ولم يكن ناتجاً عن الصدفة. ومن المثير للاهتمام أن الاختبارات الإحصائية أظهرت أن طريقتي "كينارد-ستون" و"هونيجز" متكافئتان فعلياً في قدرتهما على إنتاج نماذج دقيقة، مما يمنح العلماء المرونة في الاختيار بينهما. كما بحث الباحثون في كيفية تأثير حجم مجموعة التعلم على النتيجة. ووجدوا علاقة ثابتة وقابلة للتنبؤ: كلما كبرت مجموعة التعلم، مستحوذة على نسبة أكبر من العينات الإجمالية، تحسنت دقة النموذج. وقد ظهرت أفضل النتائج عندما تتكون مجموعة التعلم من ما بين 80 إلى 90 بالمائة من إجمالي العينات، مما يشير إلى أنه بالنسبة لهذا النوع المحدد من الدواء، فإن مجموعة التدريب الكبيرة تعطي تنبؤات أكثر قوة.
كما درست الدراسة الأدوات الرياضية المستخدمة لقياس مدى اختلاف العينات عن بعضها البعض. وبالنسبة لخوارزمية "كينارد-ستون" الأفضل أداءً، ثبت أن استخدام نوع معين من قياس المسافة الذي يأخذ في الاعتبار كيفية ارتباط الأجزاء المختلفة من الطيف الضوئي ببعضها البعض كان متفوقاً على القياس الأبسط. وقد كان لهذا التفصيل أهمية، لأنه سمح للخوارزمية بفهم الهيكل المعقد للبيانات بشكل أفضل. وخلص الباحثون إلى أنه لأي شخص يطور طرق الاختبار السريع هذه للمواد الصيدلانية، فإن استخدام استراتيجية اختيار منهجية مثل "كينارد-ستون" أو "هونيجز" أفضل بكثير من التخمين أو اختيار العينات عشوائياً. إن عملهم يوفر دليلاً واضحاً ومبنياً على الأدلة لضمان بناء النماذج الحاسوبية المستخدمة لفحص أدويتنا على أقوى أساس ممكن، مما يضمن أن الحبوب التي نتناولها هي بالضبط ما يُفترض أن تكون عليه.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.