يُعد ProtPipe2 إطار عمل متعدد المنصات ومتنوع لتحليل البروتينات في مرحلة ما بعد المعالجة، وهو متاح كحزمة لغة R وتطبيق ويب يوحد سير عمل مراقبة الجودة والتحليل الإحصائي والتصور لبيانات مطيافية الكتلة، وOlink، وSomaScan لتعزيز قابلية التكرار والمرونة.
المؤلفون الأصليون:Epstein, J., Weller, C., Kowal, I., Hao, Y., Tindall, C., Jin, B., Cookson, M. R., Nalls, M. A., Li, Z., Qi, Y. A.
لطالما اعتمد العلم على القدرة على قياس اللبنات الصغيرة للحياة، وتحديداً البروتينات التي تؤدي الغالبية العظمى من المهام داخل خلايانا. ولعقود من الزمن، استخدم الباحثون طريقة واحدة قوية تسمى "مطيافية الكتلة" لتحديد وعدد هذه البروتينات، لكن التكنولوجيا توسعت منذ ذلك الحين. فالمنصات الأحدث تستخدم الآن الأجسام المضادة أو سلاسل الحمض النووي الاصطناعي لقياس البروتينات في الدم والسوائل الأخرى، مما يوفر طرقاً مختلفة لرؤية الصورة البيولوجية ذاتها. وبينما توفر هذه الأدوات المختلفة بيانات قيمة، إلا أنها تتحدث لغات مختلفة؛ فالعالم الذي يحلل النتائج من منصة واحدة غالباً لا يستطيع بسهولة استخدام نفس الخطوات لتحليل البيانات من منصة أخرى، مما يضطره للتبديل بين برامج منفصلة وغير متوافقة. هذا التجزؤ يجعل من الصعب مقارنة الدراسات، أو تكرار التجارب، أو دمج النتائج من مصادر مختلفة للحصول على رؤية أوضح للصحة والمرض.
ولحل هذه المشكلة، طور فريق من الباحثين في المعاهد الوطنية للصحة أداة جديدة تسمى ProtPipe2. يعمل هذا البرنامج كمترجم عالمي ومساحة عمل موحدة لثلاثة أنواع رئيسية من قياس البروتين: مطيافية الكتلة، والاختبار القائم على الأجسام المضادة، والاختبار القائم على الأبتمرات (aptamers). وقد بنى الباحثون النظام ليعمل بطريقتين: كمجموعة من التعليمات التي يمكن لمبرمجي الكمبيوتر كتابتها وتشغيلها، وكوقع إلكتروني مرئي وتفاعلي حيث يمكن لأي شخص رفع بياناته والنقر عبر عملية التحليل. ويتمثل الإنجاز الجوهري في أن كلا النسختين تستخدمان المنطق الأساسي نفسه؛ فسواء كان المستخدم يكتب كوداً برمجياً أو ينقر على الأزرار، فإن البرنامج يتعامل مع الخطوات التقنية المعقدة لتنظيف البيانات، والتحقق من الأخطاء، وملء الأرقام المفقودة بطريقة متسقة، بغض النظر عن الجهاز الذي أنتج القياسات في الأصل.
اختبر الفريق برنامج ProtPipe2 على مجموعات بيانات واقعية من كل منصة من المنصات الثلاث لضمان عمله بشكل صحيح. في اختبار واحد تضمن بيانات مطيافية الكتلة من الخلايا الجذعية، تتبع البرنامج بنجاح كيفية تغير مستويات البروتين على مدار شهر، محدداً أنماطاً تطابق السلوكيات البيولوجية المعروفة. وفي اختبار آخر استخدم بيانات قائمة على الأجسام المضادة من مرضى السكري، قام البرنامج بتصفية القياسات غير الموثوقة وقارن مستويات البروتين بين الأفراد الأصحاء والمصابين بالمرض، مسلطاً الضوء على بروتينات محددة اختلفت بين المجموعتين. واستخدم اختبار ثالث بيانات قائمة على الأبتمرات من حديثي الولادة، حيث قام البرنامج بتصحيح الاختلافات الناتجة عن الدفعات المختبرية المستخدمة لمعالجة العينات، مما كشف عن إشارات بيولوجية كانت مخفية سابقاً بسبب الضوضاء التقنية. وفي كل حالة، حافظ البرنامج على التفاصيل الفريدة لكل نوع من أنواع البيانات مع تطبيق سير عمل واحد متماسك.
كما قاس الباحثون مدى سرعة عمل الأداة عند مواجهة كميات كبيرة من المعلومات. فقد قاموا بمحاكاة مجموعات بيانات تحتوي على ما يصل إلى 8,000 بروتين مختلف و1,000 عينة لمعرفة كيفية أداء البرنامج تحت الضغط. تعامل النظام مع هذه المهام الكبيرة بكفاءة، حيث أكمل الحسابات المعقدة في غضون دقائق على جهاز كمبيوتر قياسي. تشير هذه السرعة إلى أن الأداة يمكنها إدارة الحجم المتزايد من البيانات التي تولدها مختبرات البيولوجيا الحديثة دون الحاجة إلى أجهزة كمبيوتر فائقة باهظة الثمن. وأكد الفريق أن البرنامج لا يحل محل الخطوات الأولية لتوليد البيانات الخام، كما أنه لا يتخذ القرارات العلمية النهائية نيابة عن المستخدم، بل يوفر إطاراً موثوقاً وشفافاً يسمح للعلماء بالتركيز على ما تخبرهم به البروتينات عن الجسم، بدلاً من الصراع مع آليات التحليل نفسها.
ومن خلال جمع هذه التقنيات الثلاث تحت سقف واحد، يزيل ProtPipe2 حاجزاً كبيراً أمام التعاون. إذ يمكن للباحث الآن أخذ بيانات من مطياف الكتلة، واختبار أجسام مضادة، واختبار أبتمرات، وتمريرها عبر نفس العملية، ومقارنة النتائج مباشرة. هذه القدرة تجعل من السهل التحقق من النتائج عبر دراسات مختلفة وبناء فهم أكثر اكتمالاً لكيفية سلوك البروتينات في حالات الصحة والمرض. والأداة متاحة للجمهور مجاناً، مما يسمح للعلماء بفحص الكود، وتكرار التحليلات، والبناء على العمل، مما يضمن أن يظل المسار من البيانات الخام إلى الاكتشاف العلمي مفتوحاً، واضحاً، وقابلاً للتكرار للجميع.
ملخص تقني لـ ProtPipe2: أداة تحليل البروتوميات متعددة المنصات للمراحل اللاحقة
بيان المشكلة تعتمد أبحاث البروتوميات بشكل متزايد على تقنيات قياس متنوعة، بما في ذلك مطيافية الكتلة (MS)، ومنصات Olink القائمة على الأجسام المضادة، ومنصات SomaScan القائمة على الأبتامرات. وبينما تختلف هذه التقنيات في طرق القياس، وتنسيقات المخرجات، وهياكل البيانات الوصفية (metadata)، إلا أنها تشترك في احتياجات تحليلية لاحقة مشتركة مثل ضبط الجودة (QC)، والتعامل مع القيم المفقودة، والتطبيع (normalization)، وتصحيح الدفعات (batch correction)، والتحليل الإحصائي. وفي الوقت الحالي، يعتمد الباحثون غالبًا على سير عمل مجزأ يجمع بين سكربتات استيراد خاصة بكل منصة وأدوات منفصلة للمعالجة المسبقة والتصور البياني. هذا التجزؤ يعيق تتبع الخيارات التحليلية، ويقلل من قابلية إعادة الإنتاج، ويجعل من الصعب إعادة استخدام التحليلات عبر المنصات المختلفة. عادةً ما تركز الحلول البرمجية الموجودة على مطيافية الكتلة أو تتطلب مصفوفات وفرة عامة تمت معالجتها مسبقًا، مما يترك الباحثين لإجراء عمليات معالجة إضافية خاصة بالمنصة لبيانات Olink NPX أو ملفات SomaScan ADAT قبل الانخراط في التحليل العام للمراحل اللاحقة.
المنهجية ProtPipe2 هو إطار عمل مفتوح المصدر تم تنفيذه كحزمة R مع تطبيق ويب تفاعلي مرافق تم تطويره باستخدام Shiny. تعتمد بنيته الأساسية على كائن SummarizedExperiment الذي يوحد تمثيل البيانات عبر جميع المنصات المدعومة.
استيراد البيانات وتوحيد المعايير: توفر الأداة وظائف استيراد مخصصة لمصفوفات MS العامة، وتصديرات Olink NPX، وملفات SomaScan ADAT. يتم تحويل جميع المدخلات إلى كائن SummarizedExperiment يحتوي على "intensities" (كثافات) كقياس، وتعليقات الميزات (rowData)، وتعليقات العينات (colData)، وسجل المعالجة (metadata). يضمن ذلك انتقال البيانات بسلاسة بين سير عمل R المكتوب وواجهة الويب الرسومية دون الحاجة لتحويل التنسيق.
المعالجة المسبقة الخاصة بكل منصة:
Olink: تستورد ملفات NPX ذات التنسيق الطولي، وتستبعد العينات التي تحتوي على تحذيرات الجودة (QC)، وتقوم بتحويل البيانات إلى مصفوفة (ميزة مقابل عينة). ومن الأهمية بمكان أن قيم NPX المبلغ عنها، بما في ذلك القيم التي تقل عن حد الكشف (LOD)، يتم الحفاظ عليها كقيم مبلغ عنها ولا يتم تحويلها إلى قيم مفقودة أو تعويضها (imputation) بشكل افتراضي. كما يتم الاحتفاظ بمقياس log2 لقيم NPX.
SomaScan: تقرأ ملفات ADAT المعالجة من قِبل المورد، وتفصل عينات الدراسة عن صفوف المحلول المنظم (buffer) والمعاير (calibrator). وتطبق تصفية الكشف القائمة على المحلول المنظم لتحديد القياسات التي تقل عن متوسط المحلول المنظم الخاص بالأبتامر لأغراض التقييم، ولكن يتم الحفاظ على قيم RFU المبلغ عنها دون حجب أو تعويض. ولا يتم تكرار خطوات المعايرة والتطبيع الخاصة بالمورد.
مطيافية الكتلة (MS): تدعم استيراد المصفوفات العامة مع خيار التصفية بناءً على الحد الأدنى من الكثافة لتصنيف القياسات منخفضة الوفرة كقيم مفقودة.
مسار التحليل اللاحق: ينظم إطار العمل التحليل في خطوات اختيارية ونمطية:
المعالجة المسبقة: تشمل تصفية البروتين/العينة بناءً على معدلات الكشف، والتحويل (log2(x+1))، والتطبيع (الوسيط/المتوسط)، والتعويض (imputation). تشمل طرق التعويض التوزيع الطبيعي المزاح لليسار (المقترح لـ MS)، وK-nearest-neighbor، والغابة العشوائية (random forest)، واستبدال المتوسط/الوسيط. لا يتم تطبيق أي تعويض بشكل افتراضي لـ Olink أو SomaScan إلا إذا بقيت قيم مفقودة حقيقية؛ حيث تظل القياسات التي تقل عن حدود المنصة المحددة (LOD أو المحلول المنظم) متاحة كقيم مبلغ عنها.
تصحيح الدفعات (Batch Correction): يستخدم limma::removeBatchEffect ولكنه يتطلب اختيارًا صريحًا من المستخدم؛ ولا يتم تطبيقه تلقائيًا أبدًا لمنع إزالة التباين البيولوجي.
التحليل الإحصائي: يقوم بتحليل الوفرة التفاضلية لمجموعتين باستخدام limma مع تعديل Bayes التجريبي. وهو يدعم مقارنات المجموعات الفئوية والارتباطات ذات المتغيرات المستمرة (ارتباط Spearman).
تحليل المسارات: يقوم برسم خرائط رموز الجينات إلى معرفات Entrez ويجري تحليل إثراء مجموعة الجينات (GSEA) وتحليل الإفراط في تمثيل الـ Gene Ontology باستخدام clusterProfiler.
قابلية إعادة الإنتاج: تقوم كل عملية بإضافة اسمها ومعلماتها وتفاصيلها إلى سجل مرتب داخل بيانات الكائن الوصفية (metadata)، والذي يمكن تصديره كتقرير Markdown.
المساهمات الرئيسية
سير عمل موحد: من بين الأدوات التي تم تقييمها، يتميز ProtPipe2 بتوفير استيراد مباشر وسير عمل مشترك للمراحل اللاحقة لبيانات MS وOlink وSomaScan ضمن إطار عمل واحد.
واجهة مزدوجة: توفر الأداة كلاً من حزمة R للتحليل المكتوب القابل لإعادة الإنتاج، وتطبيق ويب تفاعلي باستخدام Shiny، وكلاهما يستخدم نفس الوظائف الأساسية.
الوعي بالمنصة: على عكس الأدوات العامة، يدمج ProtPipe2 المنطق الخاص بكل منصة فيما يتعلق بحدود الكشف (LOD لـ Olink، وقيم المحلول المنظم لـ SomaScan) وتدرج البيانات (الحفاظ على log2 لـ Olink)، مع الحفاظ صراحةً على القيم المبلغ عنها تحت هذه العتبات بدلاً من تحويلها إلى بيانات مفقودة.
الشفافية: يسجل النظام صراحةً جميع خطوات المعالجة والمعلمات، مما يسهل عملية التدقيق وإعادة الاستخدام.
النتائج
دراسات الحالة: استعرض المؤلفون سير العمل على ثلاث مجموعات بيانات متميزة:
MS: تحليل مصفوفة وفرة عامة (9,119 بروتين، 42 عينة) لإنشاء مخططات QC، والتجميع (clustering)، والخرائط الحرارية.
Olink: معالجة بيانات لوحة الالتهاب (142 عينة، 92 اختبارًا) للتصفية بناءً على علامات الجودة (QC) وحد الكشف (LOD)، متبوعًا بتحليل التعبير التفاضلي لمقارنة حالات السكري. تم الحفاظ على قيم NPX المبلغ عنها، بما في ذلك القيم التي تقل عن LOD، دون تعويض.
SomaScan: معالجة بيانات بلازما الحبل السري (7,596 أبتامر، 130 عينة) باستخدام تصفية الكشف القائمة على المحلول المنظم وتصحيح المجموعة مع حماية المتغيرات البيولوجية. تم الحفاظ على قيم RFU المبلغ عنها دون حجب أو تعويض.
اختبارات الأداء: أظهرت الاختبارات القياسية الاصطناعية على نظام Apple M1 Pro أن وقت التشغيل يتوسع بشكل طفيف مع عدد البروتينات، ولكنه يزداد بشكل كبير مع عدد العينات في عمليات التجميع وQC. نتج عن أكبر مصفوفة تم اختبارها (8,000 بروتين × 1,000 عينة) متوسط وقت تشغيل للتجميع بلغ حوالي 80 ثانية، وذروة استخدام للذاكرة بلغت حوالي 2.84 جيجابايت. وبلغ أقصى زمن انتقال لتطبيق الويب 17.7 ثانية لأكبر مجموعة بيانات.
المقارنة: يوضح الجدول 1 أن ProtPipe2 فريد من نوعه بين الأدوات التي تم تقييمها (بما في ذلك Perseus وamica وProTIGY وMSstatsShiny) في دعمه لجميع تنسيقات المدخلات الثلاثة (MS، Olink، SomaScan) مع توفير قدرات قائمة على الويب وبدون كود (no-code).
الأهمية والادعاءات يدعي البحث أن ProtPipe2 يجعل تحليل البروتوميات في المراحل اللاحقة أسهل في التنفيذ والتكرار والمراجعة من خلال توحيد الاحتياجات المختلفة لكل منصة في إطار عمل واحد قابل لإعادة الإنتاج. مساهمته الأساسية ليست تقديم اختبارات إحصائية جديدة، بل دمج الطرق الراسخة (مثل limma وclusterProfiler) في سير عمل متماسك يدعم التفاعلات الرسومية والمكتوبة على حد سواء. يؤكد المؤلفون أن الأداة مصممة لتسهيل الانتقال من الاستكشاف التفاعلي إلى الكود القابل لإعادة الإنتاج، مع بقاء جميع القرارات التحليلية تحت سيطرة المستخدم. كما صرحوا صراحةً بأن دراسات الحالة توضح سلوك البرنامج ولا تدعي إعادة إنتاج بيولوجية مستقلة للمنشورات المصدرية. الأداة متاحة مجانًا كحزمة R وتطبيق ويب، بهدف تقليل حواجز الدخول إلى تحليل البروتوميات المعقد مع الحفاظ على معايير صارمة لتوثيق البيانات.