Predicting single mutation effects on binding affinity at protein-protein interfaces based on MMPBSA calculations
تقدم هذه الورقة سير عمل يعتمد على الفيزياء وسهل الاستخدام باستخدام حسابات MMPBSA للتنبؤ بدقة بآثار استبدالات الأحماض الأمينية الفردية على تقارب الارتباط بين البروتين والبروتين وبين البروتين والببتيد، مما يظهر أداءً يطابق أو يتجاوز الطرق الراسخة عبر أهداف متنوعة بما في ذلك معقدات بروتين سبايك لفيروس SARS-CoV-2.
المؤلفون الأصليون:Noske, J., Janzen, M., Lepoivre, T., Höcker, B.
تُعد البروتينات هي محركات الحياة، وهي آلات جزيئية صغيرة تنطوي لتتخذ أشكالاً محددة لأداء مهام معينة، بدءاً من نقل الأكسجين في الدم وصولاً إلى محاربة العدوى. وغالباً ما يتعين على هذه البروتينات العثور على بروتينات أخرى والارتباط بها لتؤدي وظيفتها، وهي عملية مدفوعة بالتوافق الدقيق لأسطحها. وعندما يتغير لبنة بناء واحدة، أو حمض أميني واحد في أحد هذه البروتينات، يكون الأمر أشبه باستبدال طوبة واحدة في جدار؛ فأحياناً يظل الهيكل صامداً، ولكن في أحيان أخرى تضعف هذه الوصلة بالكامل أو تفشل. إن التنبؤ بدقة بكيفية تغيير تغيير واحد لقوة هذا الرابط يمثل تحدياً كبيراً للعلماء. ولو استطاعوا فعل ذلك بشكل موثوق، لاستطاعوا تصميم أدوية أفضل، أو هندسة إنزيمات لتنظيف التلوث، أو فهم سبب تسبب بعض الطفرات الجينية في الأمراض. ولسنوات، حاول الباحثون بناء برامج حاسوبية يمكنها حساب هذه التغييرات، لكن النتائج كانت غالباً متذبذبة، حيث كانت تكافح للموازنة بين السرعة والدقة.
لقد طور فريق من الباحثين في جامعة بايرويت بألمانيا طريقة جديدة لإجراء هذه التنبؤات، مقدمين أداة تتسم بالسرعة والدقة المذهلة في آن واحد. تعتمد مقاربتهم على طريقة تسمى MMPBSA، والتي ترمز إلى "ميكانيكا الجزيئات وبواسون-بولتزمان لسطح المساحة". وبعبارة بسيطة، هذا حساب قائم على الفيزياء يقدر مقدار الطاقة المطلوبة لربط بروتينين معاً. أدرك الفريق أنه بينما تستطيع البرامج الحاسوبية الموجودة تخمين طاقة البروتين، إلا أنها غالباً ما تغفل عن التحولات الطفيفة الناتجة عن طفرة واحدة. ولإصلاح ذلك، أخذ الباحثون مجموعة ضخمة من البيانات التجريبية — أكثر من 1600 حالة مسجلة حيث قام العلماء بقياس كيفية تأثير تغيير حمض أميني واحد على ارتباط البروتين — واستخدموها لتدريب نظام التقييم الجديد الخاص بهم. لم يعتمدوا على الذكاء الاصطناعي المعقد الذي يتعلم الأنماط من البيانات وحدها؛ بل بنوا نموذجاً رياضياً مباشراً يزن القوى الفيزيائية المختلفة، مثل كيفية تجاذب الذرات أو تنافرها، وكيفية تفاعل جزيئات الماء مع سطح البروتين.
اختبر الباحثون طريقتهم الجديدة مقابل منافسين راسخين: برنامج واسع الاستخدام يسمى FoldX، والذي يعتمد على قواعد تجريبية، وأداة تعلم عميق متطورة تسمى DDMut-PPI، والتي تستخدم الذكاء الاصطنا_عي. قاموا أولاً بتشغيل حساباتهم على نفس مجموعة البيانات المستخدمة لتدريب نموذج الذكاء الاصطناعي. وهنا، قدمت أداة التعلم العميق أداءً استثنائياً، حيث تنبأت بشكل صحيح بنتيجة معظم الطفرات. ومع ذلك، كان هذا السجل المرتفع متوقعاً، لأن الذكاء الاصطناعي قد تم تدريبه خصيصاً على تلك الأرقام. وجاء الاختبار الحقيقي عندما طبق الفريق الثلاث طرق على سيناريوهات جديدة تماماً لم يرَ فيها الكمبيوتر البيانات من قبل. في أحد الاختبارات، نظروا في الطفرات في بروتين "سبايك" (البروتين الشوكي) للفيروس الذي يسبب كوفيد-19، وتحديداً كيفية ارتباطه بالخلايا البشرية. وفي اختبار آخر، فحصوا بروتينات مهندسة مصممة للإمساك بسلاسل ببتيدية محددة.
في هذه المواقف الجديدة وغير المرئية سابقاً، تغيرت النتائج بشكل دراماتيكي. فقد عانت أداة التعلم العميق، التي برعت في بيانات التدريب الخاصة بها، في ترتيب الطفرات بشكل صحيح، مما أظهر قدرة ضعيفة على التمييز بين التغييرات المفيدة والضارة. أما البرنامج التقليدي، FoldX، فقد أنتج العديد من الأخطاء الكبيرة، حيث توقع غالباً أن الطفرة سيكون لها تأثير هائل بينما ليس لها أي تأثير، أو العكس. وفي المقابل، حافظت طريقة MMPBSA الجديدة على أداء ثابت. لقد نجحت في التنبؤ بقوة الروابط في كل من بروتين "سبايك" الفيروسي والبروتينات المهندسة، محققة دقة تضاهي أو تتجاوز دقة الأدوات الأخرى. وجد الباحثون أن طريقتهم كانت جيدة بشكل خاص في التعامل مع الفيزياء المعقدة للجزيئات المشحونة وتفاعلات الماء، والتي غالباً ما تكون مصدراً للأخطاء في البرامج الأخرى. كما اكتشفوا أن تضمين حد يتعلق باستقرار قطع البروتين الفردية، وليس فقط الرابط بينهما، كان أمراً حاسماً للحصول على الإجابة الصحيحة.
تشير الدراسة إلى أنه بينما يعد الذكاء الاصطناعي قوياً، فإنه يمكنه أحياناً أن يصبح متخصصاً للغاية في البيانات التي يتعلم منها، مما يؤدي إلى فشله في التكيف عند مواجهة ألغاز بيولوجية جديدة. وقد أثبت النهج القائم على الفيزياء، من خلال اعتماده على القوانين الأساسية للطبيعة بدلاً من الأنماط المحفوظة، أنه أكثر قوة عند تطبيقه على أنواع مختلفة من البروتينات والهياكل. جعل الفريق سير عملهم متاحاً للجمهور، مما يسم يسمح للعلماء الآخرين باستخدام هذه الأداة لتحديد أولويات الطفرات التي يجب اختبارها في المختبر. ومن خلال تصفية المرشحين الأكثر واعدية قبل إجراء تجارب مكلفة، يمكن لهذه الطريقة تسريع تطوير علاجات جديدة وهندسة أدوات بيولوجية أفضل. يوضح هذا العمل أنه في بعض الأحيان، العودة إلى المبادئ الأولى والوزن الدقيق للقوى الفيزيائية المؤثرة يمكن أن يؤدي إلى نتائج أكثر موثوقية من الخوارزميات الأكثر تعقيداً، خاصة عندما يكون الهدف هو فهم كيف يمكن لتغيير ضئيل في جزيء ما أن يمتد ليغير سلوك نظام حي.
بيان المشكلة لا يزال التنبؤ الدقيق بتأثيرات طفرات الأحماض الأمينية المفردة على ألفة الارتباط بين البروتين والبروتين، أو بين البروتين والببتيد، يمثل تحديًا مركزيًا في الفيزياء الحيوية الحسابية وهندسة البروتينات. وبينما حققت دالات التقييم القائمة على التعلم العميق أداءً مثيرًا للإعجاب على مجموعات بيانات التدريب الخاصة بها، إلا أنها غالبًا ما تعاني من ضعف القدرة على التعميم على الأنظمة غير المرئية. وفي المقابل، تفتقر أدوات تصميم البروتين القائمة على الفيزياء الراسخة (مثل Rosetta وFoldX) غالبًا إلى الدقة المطلوبة لحل الفروق الطاقية الصغيرة على مستوى الحمض الأميني الواحد، ويرجع ذلك تكرارًا إلى مصطلحات طاقية مبسطة تفشل في استيعاب التغيرات المعتمدة على الطفرات في الكهروسكونية والذوبان بشكل كامل. هناك حاجة مستمرة لطرق قائمة على الفيزياء وتتسم بالقابلية للتفسير، يمكنها التنبؤ بمتانة التأثيرات الطفرية عبر أنظمة بروتينية متنوعة دون الاعتماد على بيانات تدريب مكثفة.
المنهجية يقدم المؤلفون دالة تقييم قائمة على الفيزياء مشتقة من حسابات ميكانيكا الجزيئات - مساحة سطح بويسون-بولتزمان (MMPBSA) للتنبؤ بالتغيرات المستحثة بالطفرة في ألفة الارتباط (ΔΔGbinding).
بيانات التدريب: تم ضبط النموذج باستخدام مجموعة فرعية منقحة من قاعدة بيانات SKEMPI v2.0، تضم 1,662 نقطة بيانات من 175 بنية بلورية للأنواع البرية. تم تطبيق معايير تصفية صارمة، حيث احتفظت بالطفرات الواجهية (مناطق اللب، الحافة، والدعم) في الهياكل البلورية ذات الدقة الأفضل من 2.5 أنجستروم، مع استبعاد طفرات الجليسين والبرولين.
هندسة الميزات: تستخدم دالة التقييم نموذج انحدار خطي يجمع بين عدة مصطلحات طاقية:
طاقة فان دير فالس (VdW).
الطاقة الكهروسكونية (مجموع كولوم والذوبان القطبي).
طاقة الذوبان غير القطبية (تُقدر عبر مساحة سطح الوصول للمذيب المدفونة).
تغير استقرار الطي (ΔΔGfolding)، المحسوب باستخدام FoldX.
صياغة النموذج: استُخدم انحدار خطي ذو مربعات صغرى لتحديد أوزان هذه المصطلحات. المعادلة النهائية هي: ΔΔGbinding=w0+w1ΔΔGVdW+w2(ΔΔGCoulomb+ΔΔGPolarSolv)+w3ΔΔGNonpolarSolv+w4ΔΔGFolding ومن الجدير بالذكر أن مصطلح استقرار الطي قد أُدرج صراحةً، حيث أشارت التحليلات إلى أنه يساهم بشكل كبير في تغيرات ألفة الارتباط، وهو عامل غالبًا ما يُهمل في حسابات MMPBSA القياسية حيث يُفترض أن الطاقات داخل الجزيء تلغي بعضها البعض.
النمذجة الهيكلية: لجميع الحسابات، جُهزت الهياكل عن طريق إزالة المياه والجزيئات غير البروتينية. تم إنشاء نماذج الطفرات باستخدام أمر BuildModel من FoldX، متبوعًا بتقليل الطاقة باستخدام OpenMM مع حقل القوة AMBER ff19SB والمذيب الضمني OBC2. تم تعيين حالات البروتونات بناءً على إمكانية تكوين الروابط الهيدروجينية (الهيستيدين) أو الحالات القياسية (الكربوكسيلات غير المبرتنة، والأمينات المبرتنة).
التقييم: تمت مقارنة الطريقة مع FoldX (الإصدار 5.1) والنموذج القائم على التعلم العميق DDMut-PPI. تم تقييم الأداء باستخدام معاملات ارتباط بيرسون ومعامل جذر متوسط مربع الخطأ (RMSE) على ثلاث مجموعات بيانات متميزة:
المجموعة الفرعية المرتبطة بالتدريب من SKEMPI v2.0.
مجموعة بيانات مستقلة لمسح الطفرات العميق لبروتين Spike RBD-ACE2 الخاص بفيروس SARS-CoV-2 (272 نقطة).
مجموعة بيانات متوقعة حسابيًا لبروتينات تكرار Armadillo (dArmRPs) المصممة التي ترتبط بالببتيدات (63 نقطة)، حيث تم إنشاء الهياكل باستخدام Chai-1.
النتائج الرئيسية
اختبار SKEMPI v2.0: حققت الطريقة القائمة على MMPBSA معامل ارتباط قدره 0.59 وجذر متوسط مربع خطأ (RMSE) قدره 1.69 كيلو كالوري/مول، متفوقة على FoldX (ارتباط 0.47، RMSE 1.98). وبينما أظهرت طريقة التعلم العميق DDMut-PPI أداءً فائقًا على هذه المجموعة (ارتباط 0.92، RMSE 0.82)، يشير المؤلفون إلى أن هذا ناتج على الأرجح عن تدريب DDMut-PPI على نفس البيانات.
اختبار SARS-CoV-2 (القدرة على التعميم): على مجموعة بيانات SARS-CoV-2 المستقلة، حافظت طريقة MMPBSA على أداء قوي بمعامل ارتباط 0.51 وRMSE قدره 0.97 كيلو كالوري/مول. في المقابل، أعطى FoldX ارتباطًا أقل (0.40) وRMSE أعلى (1.61). بينما أظهرت DDMut-PPI انخفاضًا كبيرًا في الأداء، بارتباط قدره 0.22 فقط، مما يشير إلى قدرة محدودة على ترتيب المتغيرات خارج نطاق تدريبها.
اختبار dArmRP: في مجموعة بيانات dArmRP المتوقعة حسابيًا، حققت جميع الطرق الثلاث ارتباطات حول 0.6. حققت طريقة MMPBSA وFoldX ارتباطًا بنحو 0.65. ومع ذلك، أنتجت طريقة MMPBSA عددًا أقل بكثير من القيم المتطرفة الكبيرة مقارنة بـ FoldX، مما أدى إلى RMSE أقل بكثير (0.73 مقابل 1.56 كيلو كالوري/مول). أدت DDMut-PPI أداءً أفضل هنا مما كانت عليه في مجموعة SARS-CoV-2 (ارتباط 0.6) لكنها لا تزال تتخلف عن الطرق القائمة على الفيزياء من حيث مقدار الخطأ.
تحليل الخطأ: أظهر النموذج أخطاء تنبؤ أعلى بالنسبة للبقايا المشحونة (اللايسين، حمض الأسبارتيك، حمض الجلوتاميك) والسلاسل الجانبية المكونة للروابط الهيدروجينية، مما يشير إلى قيود في نمذجة تشكيلات السلسلة الجانبية وحالات البروتونات.
الأهمية والادعاءات يزعم البحث أن دالة التقييم المقترحة المشتقة من MMPBSA توفر إطارًا فعالًا حاسوبيًا وقابلًا للتفسير لتحديد أولويات طفرات الواجهة. تكمن أهميتها الأساسية في قابليتها للنقل: على عكس طريقة التعلم العميق التي عانت من الإفراط في التخصيص (overfitting) لبيانات التدريب، أظهر النهج القائم على الفيزياء أداءً ثابتًا عبر أهداف متنوعة (البروتينات الفيروسية، الإنزيمات المصممة) وأنواع هيكلية مختلفة (الهياكل البلورية التجريبية والنماذج المتوقعة حسابيًا).
يؤكد المؤلفون أن إدراج مصطلح استقرار الطي يعد مساهمة حاسمة، مشيرين إلى أن تأثيرات الارتباط تتأثر بشدة بتغيرات استقرار المونومر. علاوة على ذلك، تحقق هذه الطريقة هذه المتانة دون الاعتماد على مجموعات ديناميكا جزيئية مكلفة حاسوبيًا؛ بل تستخدم الهياكل المُقللة للطاقة، مما يوفر تسوية عملية بين الدقة والكفاءة لهندسة البروتينات وتحسين ألفة الارتباط. يشير العمل إلى أنه بينما يوفر التعلم العميق دقة عالية على البيانات المعروفة، تظل الأساليب القائمة على الفيزياء متفوقة في التنبؤات القابلة للتعميم لمهام تصميم البروتين التي تتضمن أنظمة غير مرئية.