Quantum Approximate Optimisation Algorithm for Protein Sidechain Packing
تقدم هذه الورقة مساراً هجيناً بين الحوسبة الكمية والكلاسيكية يستخدم خوارزمية التحسين التقريبي الكمي (QAOA) مع نموذج استدلال يحافظ على القيود لحل مشكلة تعبئة السلاسل الجانبية للبروتين ذات التعقيد الحسابي (NP-hard) على هياكل ألفافولد 2 (AlphaFold2)، مما يظهر تحسناً في طاقة التشكيل وأداءً قابلاً للتوسع مقارنة بالبحث الكلاسيكي الشامل.
المؤلفون الأصليون:Sebastian O. M. Stewart, Nick Chancellor, Jonte R Hance, Ittoop Vergheese Puthoor
تُعد البروتينات هي محركات الحياة، وهي آلات جزيئية دقيقة تقود العمليات الكيميائية التي تبقينا على قيد الحياة. ولكي تؤدي وظيفتها، يجب أن ينطوي البروتين في شكل ثلاثي الأبعاد محدد ومستقر، تماماً مثل سلسلة طويلة ومرنة تلتف لتشكل عقدة دقيقة. لقد أصبح العلماء بارعين جداً في التنبؤ بالعمود الفقري الرئيسي لهذه السلسلة، وهو العمود المركزي الذي يحافظ على البنية. ومع ذلك، فإن الخطوة النهائية الحاسمة تتضمن ترتيب الفروع الكيميائية الأصغر، المعروفة باسم السلاسل الجانبية، التي تنبت من هذا العمود الفقري. تحدد هذه الفروع كيفية تفاعل البروتين مع الجزيئات الأخرى، مثل الأدوية التي تحاول الارتباط به. فإذا وُضعت هذه السلاسل الجانبية بشكل غير صحيح ولو بنسبة ضئيلة، يمكن لوظيفة البروتين أن تفشل، أو قد يخطئ الدواء هدفه تماماً. وبينما تستطيع برامج الكمبيوتر الحديثة التنبؤ بالشكل الرئيسي بموثوقية عالية، إلا أنها غالباً ما تواجه صعوبة في تحديد مواضع هذه الفروع الجانبية بنفس الدقة، مما يترك فجوة في قدرتنا على تصميم أدوية فعالة.
لقد طور باحثون في جامعة نيوكاسل طريقة جديدة لسد هذه الفجوة، باستخدام نهج هجين يجمع بين الحواسيب التقليدية وتقنيات الحوسبة الكمومية. كان هدفهم هو أخذ بنية بروتينية تم التنبؤ بها بواسطة أداة قوية تسمى "ألفافولد" (AlphaFold) وتدقيق مواضع سلاسلها الجانبية لإيجاد الترتيب الأكثر استقراراً والأقل طاقة. وفي عالم طي البروتين، يعد إيجاد هذا الترتيب المثالي لغزاً صعباً للغاية. إذ يتزايد عدد الطرق الممكنة لترتيب الفروع الجانبية بسرعة كبيرة بحيث يصبح فحص كل إمكانية بمفرده مستحيلاً حتى بالنسبة لأسرع الحواسيب الفائقة بمجرد أن يصبح البروتين كبيراً بما يكفي. ويُعرف هذا بمسألة "NP-hard"، وهو تصنيف للمهام التي تنفجر درجة صعوبتها مع زيادة حجم المشكلة.
ولمعالجة ذلك، بنى الفريق مساراً يستخدم أولاً برمجيات قياسية لإعداد بيانات البروتين، واختيار مجموعة يمكن التحكم فيها من الأشكال المحتملة لكل سلسلة جانبية. ثم سلموا هذه المشكلة المنقحة إلى خوارزمية كمومية تُعرف باسم "خوارزمية التحسين التقريبي الكمومي" (QAOA). صُممت هذه الخوارزمية للبحث عبر احتمالات شاسعة لإيجاد الحل الأفضل. وتتمثل إحدى العقبات الرئيسية في استخدام الحواسيب الكمومية لهذه المهمة في أنها تستكشف طبيعياً جميع التوليفات، بما في ذلك العديد من الاحتمالات غير الممكنة فيزيائياً، مثل وجود سلسلة جانبية واحدة في مكانين في آن واحد. وقد حل الباحثون هذه المشكلة من خلال تصميم نقطة بداية خاصة ومجموعة محددة من القواعد لكيفية تطور النظام الكمومي. فقد بدأوا بحالة تكون فيها جميع المواضع المحتملة متساوية الاحتمالية، ثم استخدموا عملية خلط دائرية قامت بخلط هذه الاحتمالات دون السماي أبداً للنظام بالخروج من نطاق الترتيبات الفردية الصالحة. هذا الإعداد الذكي أزال الحاجة إلى مصطلحات الجزاء المعقدة التي تبطئ الحساب عادةً، مما سمح للنظام بالتركيز تماماً على إيجاد حالة الطاقة الأدنى.
اختبر الفريق طريقتهم على بروتين محدد يسمى "مثبط مثالي البنكرياس البقري"، باستخدام مناطق ذات ثقة عالية ومناطق ذات ثقة متوسطة من تنبؤ "ألفافولد". وفي المناطق التي كان فيها التنبؤ الأصلي قوياً جداً، طابقت الطريقة الكمومية النتيجة الموجودة في الغالب، ووجدت أحياناً ترتيبات أفضل قليلاً. ومع ذلك، في المناطق التي كانت فيها التنبؤات الأصلية أقل يقيناً، أظهرت الطريقة الجديدة وعداً كبيراً. ففي مناطق الثقة المتوسطة هذه، وجدت النهج الكمومي ترتيبات أكثر استقراراً بشكل ملحوظ، حيث بلغ متوسط تحسينات الطاقة أكثر من ثمانية كيلو كالوري لكل مول، ووصلت ذروتها إلى أكثر من ستة عشر كيلو كالوري لكل مول. تشير هذه النتائج إلى أن الطريقة فعالة بشكل خاص في تصحيح الأخطاء في المناطق التي يكون فيها التنبؤ الأولي أضعف.
والأهم من ذلك، لم يكتفِ الباحثون بادعاء هذه التحسينات فحسب؛ بل طوروا طريقة لقياس عدد المحاولات، أو "الطلقات" (shots)، التي سيحتاجها الحاسوب الكمومي للعثور بشكل موثوق على الإجابة المثلى مع نمو حجم المشكلة. ووجدوا أنه بينما يزداد عدد المحاولات المطلوبة، فإنه ينمو بمعدل يظل قابلاً للإدارة في الحوسبة عالية الأداء، حيث يظل أقل بكثير من الانفجار الأسي الذي تشهده الطرق الكلاسيكية لأنواع معينة من البروتينات. وتؤكد الدراسة أن هذا المسار الهجين يمكنه بنجاح إعادة تعبئة السلاسل الجانبية لخفض طاقة بنية البروتين، مما يوفر أداة محتملة لتحسين دقة اكتشاف الأدوية. لا يزال العمل عبارة عن محاكاة، تجري على معالجات رسومية قوية بدلاً من الأجهزة الكمومية الفعلية، لكنه يثبت أن الإطار الرياضي سليم وجاهز للاختبار المستقبلي على الأجهزة الكمومية الحقيقية. ومن خلال فصل عملية التحسين عن جودة التنبؤ الأولي، توفر الطريقة وسيلة موثوقة للبحث عن أفضل بنية ممكنة ضمن مجموعة معطاة من الخيارات، بغض النظر عن مدى جودة نقطة البداية.
بيان المشكلة يعد تعليب السلاسل الجانبية للبروتين مشكلة فرعية حاسمة في طي البروتين، حيث يحدد الترتيب ثلاثي الأبعاد لسلاسل الأحماض الأمينية الجانبية (الروتامرات - rotamers) بالنسبة لهيكل عظمي ثابت. وتعتبر هذه العملية أساسية لاكتشاف الأدوية القائم على البنية، حيث تُحدد مواقع الارتباط من خلال تكوينات هذه السلاسل الجانبية. وبينما يمكن لأدوات مثل AlphaFold2 التنبؤ بهياكل البروتين بدقة، إلا أن تموضع سلاسلها الجانبية قد ينحرف عن البيانات التجريبية بنسبة تصل إلى 20%. إن استعادة التعيين ذي الطاقة الأدنى للروتامرات لهيكل عظمي ثابت هو مشكلة تحسين توافيقية من فئة NP-hard. ولا تضمن الخوارزميات الاستدلالية الكلاسيكية، مثل بحث مونت كارلو العشوائي في Rosetta، الوصول إلى الأمثلية العالمية. تقترح هذه الورقة مسار عمل هجين (كمي-كلاسيكي) لمعالجة ذلك عبر إعادة صياغة تقليل طاقة السلسلة الجانية كمسألة تحسين ثنائي غير مقيد تربيعي (QUBO) يمكن حلها عبر خوارزمية التقريب الكمي للتحسين (QAOA).
المنهجية يعمل مسار العمل المقترح عبر ثلاث مراحل: المعالجة المسبقة، تحسين QAOA، والمعالجة اللاحقة.
المعالجة المسبقة وتقليص الهيكل الثابت: باستخدام PyRosetta، يقوم المسار بتحليل جزء من البروتين (مثل مثبط التريپسين البنكرياسي البقري، 5PTI) لتثبيت إحداثيات الهيكل العظمي المستمدة من AlphaFold2. ويقوم بتوليد مكتبة منفصلة من الروتامرات الصالحة بناءً على مكتبات Dunbrack. ولإدارة التعقيد الحسابي، يتم تقليم مجموعة الروتامرات عبر اختيار "الدور الدوري" (round-robin) بناءً على طاقات الجسم الواحد، مما يضع حداً أقصى لعدد المرشحين (R) لكل ثمالة (residue). يقلل هذا من المهمة إلى اختيار روتامر واحد بالضبط لكل ثمالة من المجموعة المقلّمة لتقليل إجمالي طاقة التكوين.
صياغة QUBO: يتم ترميز دالة الطاقة الزوجية (التي تضم حدود تفاعل الجسم الواحد والجسمين) في هاميلتوني التكلفة (HC) باستخدام مؤثرات Pauli-Z. ويُستخدم مخطط ترميز "الواحد-ساخن" (one-hot encoding)، حيث يتم تخصيص كيو بت (qubit) واحد لكل روتامر صالح. ينتج عن ذلك نمو خطي في عدد الكيو بتات (MN لـ M من الثمالات و N متوسط الروتامرات لكل ثمالة) ولكن مع نمو تربيعي في حدود هاميلتوني التكلفة في أسوأ الحالات، وإن كان التناثر العملي يقلل هذا إلى O(MN⋅d).
المنهج (Ansatz) الحافظ للقيود: لفرض قيد "الواحد-ساخن" (اختيار روتامر واحد بالضبط لكل ثمالة) دون الاعتماد على حدود الجزاء في دالة التكلفة، قدم المؤلفون منهجاً (ansatz) محدداً:
الحالة الابتدائية: يتم تهيئة النظام في حالة W-state، وهي تراكب متساوٍ لجميع حالات الاستثارة الفردية لكل سجل فرعي للثمالة. وهذا يضمن بدء النظام ضمن الفضاء الفرعي لوزن هامينج-1 الصحيح.
هاميلتوني الخلط (Mixer Hamiltonian): بدلاً من استخدام خلاط ذو رسم بياني كامل الاتصال (والذي يتوسع بمقدار O(MN2) في بوابات الكيو بت الثنائي)، يُستخدم خلاط حلقة XY حلقي. هذا يقيد التفاعلات لتكون بين الروتامرات المتجاورة في حلقة مغلقة. هذا الطوبولوجيا تحافظ على وزن هامينج (مما يضمن الحفاظ على الصلاحية طوال التطور) وتقلل من توسع بوابات الكيو بت الثنائي إلى O(MN).
استراتيجية التحسين: تُستخدم استراتيجية "البدء الدافئ" (warm-starting)، حيث يتم تهيئة المعلمات للدوائر الأعمق (p) باستخدام المعلمات المحسنة من الدوائر الأقل عمقاً، مع إضافة تصفير (zero-padding) واضطراب باستخدام ضوضاء غاوسية للهروب من نقاط السرج (saddle points).
مقاييس التقييم:
ΔE: فرق الطاقة بين نتيجة QAOA وخط الأساس AlphaFold (EQAOA−EAF). تُصنف النتائج إلى: انتصارات (Wins) إذا كان ΔE<−1.5 كيلو كالوري/مول، وتعادلات (Ties) إذا كان ∣ΔE∣≤1.5 كيلو كالوري/مول، وخسائر (Losses) إذا كان ΔE>1.5 كيلو كالوري/mol.
S(N) (مقياس توسع الطلقات التقاربي): مقياس مُعرف لتقدير عدد الطلقات (shots) المطلوبة لاستعادة تكوين الحد الأدنى للطاقة العالمي (GMEC) باحتمالية 99.99%. يتم حسابه مقابل حقيقة أرضية محلولة تجريبياً (تم البحث عنها استقصائياً للأنظمة الفرعية الصغيرة) لفصل جودة المحسن عن جودة خط أساس AlphaFold.
النتائج الرئيسية تم تقييم مسار العمل على بروتين 5PTI باستخدام محاكاة الحالة المتجهة الكلاسيكية على وحدات معالجة الرسومات (GPUs).
مناطق الثقة العالية (pLDDT > 90): في المناطق التي تكون فيها تنبؤات الهيكل العظمي والسلاسل الجانبية لـ AlphaFold موثوقة للغاية، أظهر مسار عمل QAOA تحسناً محدوداً مقارنة بخط الأساس. حدثت الانتصارات في 15.6% من الدورات لـ 5–14 كيو بت، وتركزت في نوافذ ثمالة محددة (مثل 60–63). ومع زيادة عدد الكيو بتات إلى 18 و22، انخفض معدل الفوز إلى الصفر، حيث أصبحت النتائج في الغالب تعادلات. ويعزو المؤلفون ذلك إلى "جزاء التقطيع" (discretisation penalty): أي إجبار تكوينات AlphaFold المستمرة القريبة من المثالية بالفعل في مكتبة منفصلة محدودة، مما يؤدي غالباً إلى حالات طاقة أعلى، ليس بسبب فشل الحل الكمي، بل لأن فضاء البحث المنفصل أكثر تقييداً من خط الأساس المستمر.
مناطق الثقة المتوسطة (pLDDT ≈ 80): في المناطق التي يكون فيها وضع السلاسل الجانبية لـ AlphaFold أقل موثوقية، حقق مسار العمل تحسينات ملحوظة. عبر 1,500 دورة (5–14 كيو بت)، كانت 54% منها انتصارات، بمتوسط تحسن قدره -8.114 كيلو كالوري/مول وذروة بلغت -16.265 كيلو كالوري/مول. ويوضح المؤلفون أن هذه المكاسب تعكس ضعف خط أساس AlphaFold في هذه المناطق وليس تفوقاً متأصلاً للمحلل الكمي، حيث يؤكد مقياس S(N) قدرة المحسن على إيجاد الخيار الأفضل ضمن مجموعة المرشحين بغض النظر عن خط الأساس.
توسع الطلقات (S(N)): ظل النمو الملائم لعدد الطلقات (e0.31N) أقل من معدل البحث الاستقصائي الكلاسيكي لمرونة الروتامرات المتوسطة. وأظهر المقياس أن عبء أخذ العينات حساس لطاقة المشهد المحلي واختيار الثمالة، وليس فقط لإجمالي عدد الكيو بتات.
الأهمية والادعاءات يدعي البحث تقديم مسار عمل هجين (كمي-كلاسيكي) ناجح يعالج مسألة تعليب السلاسل الجانبية من فئة NP-hard. وتتمثل مساهماته الرئيسية في:
المنهج (Ansatz) الحافظ للقيود: مزيج مبتكر من تهيئة حالة W ومحرك حلقة XY حلقي يفرض صحة "الواحد-ساخن" هيكلياً، مما يلغي الحاجة إلى حدود الجزاء ويقلل من توسع بوابات الكيو بت الثنائي من O(MN2) إلى O(MN).
التقييم المستقل عن خط الأساس: يسمح إدخال مقياس S(N) بتقييم أداء QAOA مقابل المثالية النظرية (GMEC) بشكل مستقل عن جودة هيكل AlphaFold الابتدائي. وهذا يميز بين فشل المحلل وبين القيود المتأصلة في تحويل مسألة مستمرة إلى مسألة منفصلة.
إثبات المفهوم: يوضح العمل أن التحسين الكمي يمكن أن يخفض طاقة التكوين مقارنة بخطوط أساس AlphaFold، خاصة في المناطق التي يكون فيها خط الأساس الكلاسيكي أضعف.
يبقى المؤلفون متواضعين فيما يتعلق بالآثار الأوسع، مشيرين إلى أن التحسينات الملحوظة في الطاقة في مناطق الثقة المتوسطة قد تكون ناتجة عن ضعف خط الأساس بدلاً من كونها دليلاً على التفوق الكمي في حل المسألة نفسها. ويؤكدون أن التحقق اللاحق من تقارب الارتباط والاستقرار الهيكلي مطلوب لتحديد فائدة الطريقة في اكتشاف الأدوية. علاوة على ذلك، تظل قابلية تعميم ميزانية S(N) للبروتينات الأخرى غير 5PTI وتأثير ضوضاء الأجهزة على الأجهزة الكمية الحقيقية أسئلة مفتوحة.