FedEdgeR: federated and privacy-preserving edgeR for differential gene expression analysis
تقدم الورقة البحثية FedEdgeR، وهو إطار عمل للتعلم الاتحادي قائم على الحوسبة متعددة الأطراف الآمنة يتيح تحليل التعبير الجيني التفاضلي مع الحفاظ على الخصوصية باستخدام edgeR، مما يثبت أداءً مكافئاً للتحليل المركزي ومتفوقاً على طرق التحليل التلوي التقليدية عبر مجموعات بيانات RNA-seq متنوعة.
في عالم الطب الحديث، يشبه فهم كيفية سلوك الجينات قراءة دليل التعليمات لخلية حية. عندما يريد العلماء معرفة أي الجينات يتم تفعيلها أو إيقافها أثناء مرض ما، فإنهم يستخدمون تقنية تسمى تسلسل الحمض النووي الريبوزي (RNA sequencing) لعد الرسائل الجزيئية داخل الخلايا. وللحصول على صورة واضحة، يحتاج الباحثون غالبًا إلى دمج البيانات من العديد من المستشفيات أو المختبرات، مما يخلق تجمعًا هائلًا من المعلومات يكشف عن أنماط قد تكون خفية جدًا بحيث لا يمكن رؤيتها في دراسة واحدة. ومع ذلك، يقف حاجز صارم في الطريق: خصوصية المريض. فالقوانين والقواعد الأخلاقية تمنع المستشفيات من مشاركة البيانات الجينية الخام لمرضاها، حيث يمكن استخدام هذه المعلومات لتحديد هوية الأفراد. وهذا يخلق معضلة صعبة: كيف يمكن للعلماء اكتساب قوة دراسة ضخمة مجمعة دون رؤية البيانات الخاصة لأي مريض؟
لسنوات، كان الحل القياسي هو طريقة تسمى "التحليل التلوي" (meta-analysis). في هذا النهج، يقوم كل مستشفى بإجراء تحليله الخاص بشكل منفصل ويرسل فقط النتائج النهائية، مثل قائمة بالجينات المهمة، إلى فريق مركزي. ثم يحاول الفريق المركزي دمج هذه القوائم المنفصلة معًا. وبينما يحمي هذا النهج الخصوصية، فإنه غالبًا ما يضعف العلم. فإذا كان لدى أحد المستشفيات عدد قليل جدًا من المرضى أو مزيج غير متوازن من الأصحاء والمرضى، فقد يفشل التحليل المحلي في إيجاد الحقيقة، ولا يستطيع الفريق المركزي إصلاح تلك الأجزاء المفقودة. الأمر يشبه محاولة حل لغز عملاق من خلال النظر فقط إلى قطع الزوايا من صناديق مختلفة؛ قد تحصل على الحواف، لكن المنتصف يظل ضبابيًا.
يقدم نهج جديد يسمى "التعلم الاتحادي" (federated learning) مسارًا مختلفًا. فبدلاً من إرسال النتائج ذهابًا وإيابًا، يسمح هذا النهج للحواسيب في مواقع مختلفة بالعمل معًا على نفس المسألة الرياضية دون نقل البيانات الخام أبدًا. إنهم يتشاركون فقط الخطوات المتوسطة لحساباتهم، والتي يتم تشفيرها لإخفاء الأرقام الأصلية، ثم يجمعون هذه القطع المشفرة للوصو إلى الإجابة النهائية. وهذا يكافئ رياضيًا وجود جميع البيانات في مكان واحد، ولكن البيانات لا تغادر موطنها أبدًا. وبينما تم تطبيق هذه التقنية على بعض أدوات تحليل الجينات، فإن طريقة رئيسية وواسعة الاستخدام تسمى "edgeR"، والتي تتميز ببراعتها في الدراسات التي تشمل أعدادًا قليلة من المرضى أو عينات بيولوجية عالية التباين، لم يكن لها نسخة اتحادية مماثلة. وقد ترك هذا فجوة كبيرة في القدرة على دراسة الحالات الصعبة أو النادرة عبر مراكز متعددة.
لسد هذه الفجوة، طور باحثون في معهد نيوجيرسي للتكنولوجيا نظامًا جديدًا يسمى "FedEdgeR". تعمل هذه الأداة على جلب قوة طريقة "edgeR" إلى بيئة اتحادية آمنة. واجه الفريق تحديًا فريدًا لأن طريقة "edgeR" لا تحسب نتيجة في تمريرة واحدة فحسب، بل تستخدم عملية معقدة وخطوة بخطوة تعتمد على تحسين تقديراتها بشكل متكرر للوصول إلى أدق إجابة. هذه الطبيعة التكرارية جعلت من الصعب جدًا تقسيم العمل عبر أجهزة كمبيوتر مختلفة دون تسريب معلومات خاصة. وقد حل الباحثون ذلك من خلال تصميم نظام يقوم فيه كمبيوتر كل مستشفى بإجراء حساباته المحلية، وتشفير النتائج بضوضاء عشوائية، ثم إرسالها إلى منسق مركزي. ويتولى خادم منفصل معالجة هذه الضوضاء، مما يسمح للمنسق بإزالة الضوضاء والكشف عن النتيجة الحقيقية المجمعة دون رؤية الأرقام الفردية من أي مستشفى بمفرده.
اختبر الفريق هذا النظام الجديد على أربع مجموعات بيانات من العالم الحقيقي تتضمن آلاف الجينات والمرضى من دراسات متنوعة، بما في ذلك أبحاث حول سرطان الثدي، والميلانوما، وأمراض الكبد. وقارنوا نتائج "FedEdgeR" بالمعيار الذهبي المتمثل في تجميع كل البيانات الخام معًا في مكان واحد، وهو ما كان سيفعله العلماء لو لم تكن قوانين الخصوصية موجودة. كانت النتائج دقيقة بشكل مذهل. ففي كل اختبار، أنتج النظام الاتحادي نتائج مطابقة تقريبًا للتحليل المجمع. تطابقت قوائم الجينات المهمة تمامًا، وكان اليقين الإحصائي في تلك النتائج هو نفسه. وحتى في حالة اختبار صعبة للغاية مع ستة مرضى فقط موزعين على ثلاثة مواقع، حيث كانت الطرق التقليدية ستفشل تمامًا بسبب عدم كفاية البيانات في أي موقع منفرد، نجح النظام الجديد. لقد أعاد بناء الصورة الكاملة من خلال دمج قطع صغيرة من المعلومات من كل موقع قبل بدء التحليل، بدلاً من محاولة دمج الإجابات النهائية لاحقًا.
عندما قارن الباحثون بين "FedEdgeR" وطرق التحليل التلوي الأقدم، كان الفرق في الأداء واضحًا. فالطرق التقليدية، التي تجمع القوائم النهائية للجينات، غالبًا ما تفقد إشارات مهمة أو تنتج تصنيفات مربكة، خاصة عندما تكون البيانات من المواقع المختلفة غير متساوية. في المقابل، تفوق النظام الاتحادي الجديد باستمرار على هذه التقنيات القديمة، مستعيدًا نفس النتائج عالية الجودة كما لو تم دمج جميع البيانات منذ البداية. لقد أثبت النظام أنه من الممكن إجراء دراسات جينية قوية واسعة النطاق عبر العديد من المؤسسات دون المساس بخصوصية المريض. ومن خلال تمكين العلماء من استخدام أقوى الأدوات الإحصائية المتاحة دون الحاجة إلى نقل البيانات الحساسة، يزيل هذا العمل حاجزًا رئيسيًا أمام البحث الطبي التعاوني، مما يسمح برؤى أعمق لآليات المرض التي كانت بعيدة المنال سابقًا.
المشكلة يعد تحليل التعبير التفاضلي (DE) لبيانات تسلسل الحمض النووي الريبوزي (RNA-seq) أمراً أساسياً لتوصيف الاستجابات النسخية، حيث يُعتبر edgeR إطار عمل مفضلاً لمجموعات البيانات ذات أحجام العينات الصغيرة أو التباين البيولوجي العالي، وذلك بفضل نموذج الخطوط العامة المعممة (GLM) ذي التوزيع الثنائي السالب (negative binomial) والتقليص البايزي التجريبي (empirical Bayes shrinkage). ومع ذلك، غالباً ما تعاني الدراسات متعددة المراكز من عوائق بسبب لوائح الخصوصية (مثل GDPR) التي تمنع مشاركة البيانات الخام على مستوى المريض. وبينما تتجنب طرق التحليل التلوي (meta-analysis) (مثل طرق Fisher وStouffer والنماذج ذات التأثيرات العشوائية) مشاركة البيانات الخام، إلا أنها تعامل المواقع كدراسات مستقلة، مما يؤدي إلى فقدان القوة الإحصائية، لا سيما عندما تكون أحجام العينات غير متوازنة أو عندما تكون نسب الحالات إلى الضوابط (case-to-control) منحازة في المواقع. إن الحلول الحالية للتعلم الاتحادي (federated learning) لبيانات RNA-seq، مثل Flimma (الخاص بـ limma-voom) وFedPyDESeq2 (الخاص بـ DESeq2)، لا تغطي edgeR. ويعد توحيد (federating) edgeR تحدياً فريداً لأن العملية تعتمد على طريقة المربعات الصغرى الموزونة المتكررة (IRLS) لملائمة نموذج GLM، وعلى تقدير الاحتمال المرجح المعدل بواسطة Cox-Reid (APL) لتقدير التشتت (dispersion)، مما يتطلب جولات متعددة من التواصل وعمليات تحسين غير خطية معقدة، على عكس طريقة المربعات الصغرى الموزونة ذات المرة الواحدة المستخدمة في limma-voom.
المنهجية يقدم المؤلفون FedEdgeR، وهو أول تنفيذ اتحادي لمسار عمل edgeR، محمي بواسطة الحوسبة متعددة الأطراف الآمنة (SMPC). يستخدم النظام بنية اتحادية هجينة تتضمن ثلاثة أطراف: K من المواقع العميلة، ومجمع (aggregator)، ومعوض (compensator).
نموذج الخصوصية: تمتلك المواقع العميلة مصفوفات العد (count) والتصميم (design) المحلية. ولمشاركة الإحصائيات دون الكشف عن البيانات الخام، تقوم المواقع بإخفاء الإحصائيات المحلية (Mi) باستخدام ضوضاء عشوائية (Ni) قبل إرسال Mi+Ni إلى المجمع و Ni إلى المعوض. يستعيد المجمع المجموع العالمي ∑Mi عن طريق طرح مجموع الضوضاء العالمي المقدم من المعوض. يفترض نموذج التهديد أن جميع الأطراف "نزيهة ولكن فضولية" (honest-but-curious) ولا يتواطؤون فيما بينهم.
الخوارزمية الاتحادية: يماثل المسار عملية edgeR المركزية:
التطبيع (Normalization): يستخدم الإزاحات (offsets) (مثل تلك الناتجة عن تطبيع TMM) كمدخلات.
ملائمة GLM (عبر IRLS): يتم ملائمة نموذج GLM ذي التوزيع الثنائي السالب عبر IRLS. يوضح المؤلفون أن الإحصائيات الكافية المطلوبة لتحديث IRLS (وهي XTWX و XTWz) هي إحصائيات تراكمية عبر المواقع. تقوم المواقع بحساب المصطلحات المحلية بناءً على المعاملات الحالية التي يبثها المجمع؛ ويتم تجميع هذه المصطلحات بأمان لتحديث المعاملات العالمية بشكل تكراري.
تقدير التشتت (Dispersion Estimation): يدعم التشتت الشائع (common)، والاتجاهي (trended)، وتشتت الجين المحدد (tagwise). يتم حساب Cox-Reid APL عن طريق تجميع الاحتمالات اللوغاريتمية المحلية ومصفوفات معلومات فيشر. يتم اشتقاق التشتت الاتجاهي عبر التنعيم الانحداري المحلي على البيانات الاتحادية، ويتم الحصول على التشتت الخاص بالجين (tagwise) عبر التقليص البايزي التجريبي.
اختبار نسبة الاحتمال (Likelihood Ratio Test): يتم ملائمة النماذج الكاملة والعدمية، ويتم حساب إحصائية نسبة الاحتمال من الانحرافات المتبقية المجمعة.
التنفيذ: تم تنفيذ العمليات الحسابية الاتحادية الأساسية وإخفاء SMPC باستخدام لغة بايثون (NumPy/SciPy)، مع الربط مع حزمة R الأصلية (edgeR) للقيام بمهام محددة مثل تنعيم التشتت الاتجاهي والتقليص البايزي التجريبي.
المساهمات الرئيسية
أول نظام اتحادي لـ edgeR: هو أول مسار عمل للتحليل التفاضلي (DE) يجمع بين حماية الخصوصية SMPC والملائمة النموذجية التكرارية غير الخطية المطلوبة من edgeR (IRLS و Cox-Reid APL).
الاشتقاق الرياضي: يقدم المؤلفون اشتقاقاً كاملاً يوضح أن الإحصائيات الكافية لـ IRLS و APL هي إحصائيات تراكمية عبر المواقع، مما يسمح بالتجميع الآمن دون فقدان للمعلومات.
التحقق من الأداء: تم تقييم الطريقة على أربع مجموعات بيانات ممثلة لـ RNA-seq (BRCA، و Mel-ICI، و GSE144269، ومجموعة بيانات فموية صغيرة مزدوجة) مقابل edgeR المجمع (المعيار الذهبي) وأربعة نماذج أساسية للتحليل التلوي.
النتائج
التكافؤ مع التحليل المجمع: يحقق FedEdgeR تكافؤاً يقترب من دقة الآلة مع edgeR المجمع المركزي عبر جميع مجموعات البيانات.
معامل ارتباط بيرسون لـ −log10(p-values) هو ≥0.99999 (وغالباً ما يكون 1.00000000).
تداخل أفضل 100 جين تفاضلي هو 100%.
درجة F1 عند معدل خطأ اكتشاف كاذب (FDR) الاسمي < 0.05 هي 1.000.
تتطابق تقديرات التشتت (الشائع، والاتجاهي، والخاص بالجين) مع المسار المركزي بخطأ ضئيل جداً (على سبيل المثال، RMSE <10−7).
التفوق على التحليل التلوي: يتفوق FedEdgeR باستمرار على طرق Fisher وStouffer والنموذج ذي التأثيرات العشوائية وRankProd.
تعاني طرق التحليل التلوي من انخفاض كبير في الأداء، لا سيما في السيناريوهات ذات العينات الصغيرة أو غير المتوازنة (مثل مجموعة البيانات الفموية المكونة من 6 عينات حيث تكون النماذج لكل موقع مشبعة).
في المجموعة الفموية، تراوحت درجات F1 للتحليل التلوي بين 0.067 و 0.878، بينما حافظ FedEdgeR على F1 قدره 1.000.
المتانة: تظل الدقة مستقرة عبر أعداد متفاوتة من المواقع العميلة (K=2 إلى $10$) وتحت تقسيمات غير متوازنة في الحجم أو النسب.
الكفاءة: يهيمن البحث في شبكة التشتت المشترك على وقت التشغيل النهائي، ويتراوح من ~21 ثانية (6 عينات) إلى ~8.6 دقيقة (227 عينة). وتعتبر تكلفة الاتصال ضئيلة (أقل من 2.5 ميجابايت لكل جولة لكل عميل).
الأهمية يزعم البحث أن FedEdgeR يسد الفجوة الاتحادية لـ edgeR، وهو آخر إطار عمل رئيسي للتحليل التفاضلي يفتقر إلى نظير لامركزي. ومن خلال تمكين نتائج مكافئة رياضياً للتحليل المجمع دون مشاركة البيانات الخام، يسمح FedEdgeR للدراسات متعددة المراكز بالحفاظ على كامل قوتها الإحصائية، حتى في السيناريوهات الصعبة ذات أحجام العينات الصغيرة، أو التباين العالي، أو عدم التوازن الشديد في البيانات حيث تفشل طرق التحليل التلوي. يثبت هذا العمل أن الإجراءات الإحصائية المعقدة والتكرارية مثل IRLS و Cox-Reid APL يمكن توحيدها بشكل آمن، مما يوفر بديلاً يحافظ على الخصوصية ويتجنب فقدان المعلومات المتأصل في مناهج التحليل التلوي التقليدية.