تقدم هذه الورقة نموذجين للتعلم الآلي خاليين من الاعتماد على البنية، يتنبآن بدقة بالتفضيلات الزوجية بين المركبات والأهداف من خلال مقارنة الهياكل الكيميائية وتسلسلات البروتين، محققين دقة عالية في التصنيف دون الحاجة إلى تحليل التشكيل أو بيانات بنية البروتين.
داخل خلية حية، لا يلتقي جزيء الدواء بهدف واحد فقط؛ بل ينجرف عبر بيئة مزدحمة حيث يصادف طيفاً واسعاً من البروتينات، ينتمي الكثير منها إلى عائلات مختلفة. إن التأثير النهائي للجزيء هو مجموع كل هذه التفاعلات، وليس مجرد ارتباطه بالهدف المنشود. لعقود من الزمن، كانت الطريقة القياسية لدراسة هذه التفاعلات هي طرح سؤال واحد في كل مرة: هل يرتبط هذا الدواء المحدد بهذا البروتين المحدد؟ لقد بنى الباحثون نماذج للتنبؤ بهذا التفاعل الفردي، لكن واقع تطوير الأدوية نادراً ما يكون معزولاً بهذا الشكل. غالباً ما يواجه العلماء سؤالين مقارنين وعمليين يحركان قراراتهم: بالنظر إلى مرشح دواء جديد، أيهما من بين هدفين محتملين من المرجح أن يرتبط به؟ وبالعكس، بالنظر إلى هدف محدد، أي من اثنين من المرشحين الدوائيين هو الأنسب؟ الإجابة على هذه الأسئلة تساعد الباحثين في تحديد أي المركبات يجب تصنيعها تالياً، وأي الآثار الجانبية غير المرغوب فيها يجب فحصها مبكراً، قبل وقت طويل من وصول الدواء إلى المرحلة السريرية.
قام فريق من الباحثين الآن ببناء نموذجين حاسوبيين صُمما خصيصاً للإجابة على هذه الأسئلة المقارنة. فبدلاً من محاولة حساب قوة ارتباط دقيقة لزوج واحد من (دواء-بروتين)، ينظر النموذجان إلى عنصرين في آن واحد ويختاران ببساطة "الفائز". يأخذ أحد النموذجين دواءً وبروتينين مختلفين ويتنبأ بأي البروتينين يفضله الدواء. بينما يأخذ الآخر بروتيناً ودواءين مختلفين ويتنبأ أي الدواءين يفضله البروتين. تم تدريب هذه النماذج على قاعدة بيانات عامة ضخمة تضم أكثر من 1.2 مليون قياس تشمل ما يقرب من 800,000 جزيء دواء فريد وأكثر من 2,700 بروتين بشري. ومن الأهمية بمكان أن هذه النماذج لا تعتمد على الشكل ثلاثي الأبعاد للبروتينات أو جزيئات الأدوية؛ فهي لا تحتاج لمعرفة الهيكل الدقيق لجيب الارتباط أو محاكاة كيفية التفاف وانثناء الجزيئات لتتلاءم مع بعضها البعض. بدلاً من ذلك، تعمل هذه النماذج باستخدام التسلسل الخام للأحماض الأمينية التي تشكل البروتينات، وخريطة ثنائية الأبعاد للهيكل الكيميائي للأدوية.
تظهر النتائج أن نهج المقارنة المباشرة هذا يعمل بدقة مدهشة. فعند سؤاله عن الاختيار بين بروتينين من عائلتين مختلفتين، اختار النموذج الهدف المفضل الصحيح بنسبة 75 بالمائة تقريباً. وعندما كان البروتينان ينتميان إلى العائلة نفسها، ارتفرت الدقة إلى 78 بالمائة. وبالنسبة للسؤال العكسي —الاختيار بين دوائين لبروتين واحد— كان النموذج صحيحاً بنسبة 71 بالمائة. ووجد الباحثون أن ثقة النموذج تعد دليلاً موثوقاً؛ فعندما يكون النموذج متأكداً جداً من خياره، تقفز دقته إلى أكثر من 90 بالمائة. ومع ذلك، عندما يكون الخياران متشابهين جداً في نشاطهما المقاس، تنخفض قدرة النموذج على التمييز بينهما، مما يعكس حقيقة أن البيانات التجريبية نفسها تصبح أصعب في الفصل في تلك الحالات. وقد تم اختبار النماذج على جزيئات دوائية لم يسبق لها رؤيتها من قبل، مما ضمن أن النتائج لم تكن مجرد ذاكرة لبيانات سابقة، بل قدرة حقيقية على التعميم.
إن أحد النتائج الرئيسية لهذا العمل هو أن دقة هذه التنبؤات تعتمد بشكل كبير على البيانات المتوفرة في السجل العلمي، وليس فقط على تطور الخوارزمية الحاسوبية. فلكي يتمكن النموذج من مقارنة عائلتين مختلفتين من البروتينات، يحتاج إلى رؤية دواء تم اختباره ضد كليهما. واكتشف الباحثون أن حوالي 4.6 بالمائة فقط من جزيئات الأدوية في قاعدة بياناتهم قد تم قياسها عبر عائلتين مختلفتين من البروتينات. هذا الندرة في البيانات العابرة للعائلات تضع حداً طبيعياً لمدى قدرة النموذج على الأداء عند مقارنة أهداف متباعدة. في المقابل، فإن البيانات داخل عائلة بروتينية واحدة تكون أغنى بكثير، مما يسمح بإجراء المزيد من المقارنات. ليست النماذج مصممة للتنبؤ بقوة الرابطة الدقيقة أو لاستبدال التجارب الفيزيائية، بل تعمل كأداة فرز قوية، تساعد الباحثين على تحديد الأولويات بشأن التجارب التي يجب إجراؤها أولاً. ومن خلال ترتيب الأهداف والمركبات بناءً على التفضيل بدلاً من القيم المطلقة، توفر هذه الأدوات طريقة للتنقل في المشهد المعقد لتفاعلات الأدوية دون الحاجة لمعرفة البنية التفصيلية ثلاثية الأبعاد لكل بروتين معني.
ملخص تقني: قد يكون المقارِنان هما كل ما نحتاجه
بيان المشكلة في مجال اكتشاف الأدوية، يتفاعل المركب داخل الخلية مع طيف من البروتينات عبر عائلات متعددة في آن واحد، ومع ذلك، فإن عمليات الفحص والنمذجة القياسية تستهدف عادةً هدفًا واحدًا في كل مرة. وبينما تتسم الجزيئات الصغيرة بكونها متعددة الأهداف بطبيعتها، وغالبًا ما تؤدي الأنشطة خارج الهدف إلى تعثر السلامة، فإن معظم النماذج التنبؤية تقوم بتقييم بروتين واحد ومركب واحد بشكل فردي. وبناءً على ذلك، فإن استخلاص الانتقائية أو التفضيل يتطلب طرح تنبؤين منفصلين للتقارب (affinity)، وهي عملية تواجه صعوبة بسبب عدم تجانس بيانات القدرة المتاحة علنًا (والتي يمكن أن تتباين بمقدار وحدة لوغاريتمية كاملة تقريبًا عبر المختبرات والاختبارات المختلفة)، وتفشل في الإجابة مباشرة على الأسئلة المقارنة التي توجه عملية اتخاذ القرار: "أي من هذين الهدفين يفضله المركب؟" و"أي من هذين المركبين يفضله هدف معين؟"
المنهجية قام المؤلفون ببناء نموذجين متبادلين، خاليين من الاعتماد على البنية (structure-free)، تم تدريبهما حصريًا على البيانات العامة من ChEMBL 37، والتي تغطي 2,279 بروتينًا بشريًا ضمن 34 عائلة بروتينية. لا يستخدم أي من النموذجين بنى البروتينات، أو مواقع الارتباط، أو وضعيات الإرساء (docked poses)، أو التحليل التشكيلي.
تنسيق البيانات: تتكون مجموعة البيانات من 1,263,266 قياسًا (Ki، IC50، Kd، EC50، Kb) لـ 794,638 مركبًا. تم قصر البيانات على البروتينات البشرية أحادية البروتين ذات تسميات فئة ChEMBL من المستوى الثاني. تم تحويل القراءات إلى pActivity (اللوغاريتم السالب للتركيز)، وتم استبعاد حالات التساوي.
تمثيل الميزات:
البروتينات: مُثلت كمتجهات متوسطة لكل بقايا (residue-wise mean vectors) بأربعة أبعاد (480 بُعدًا) مشتقة من نموذج لغة البروتين ESM2-t12-35M.
المركبات: مُثلت ببصمات أصابع Morgan (radius-2) بقيمة 1,024، بالإضافة إلى 14 واصفًا للجزيء بالكامل (مثل الوزن الجزيئي، وأعداد الذرات).
بنية النموذج: كلا المقارنين هما من نوع الغابات العشوائية (Random Forests) المكونة من 300 شجرة لكل منهما، ويأخذان تنسيق مدخلات زوجي (pairwise).
مقارن الهدف (Target Comparator): المدخلات هي (التسلسل A، المركب، التسلسل B). يتنبأ بأي من الهدفين يفضلهما المركب. يتعامل هذا النموذج مع سيناريوهين: المقارنات عبر عائلات مختلفة والمقارنات داخل عائلة واحدة.
مقارن المركب (Compound Comparator): المدخلات هي (المركب A، التسلسل، المركب B). يتنبأ بأي من المركبين يفضلهما هدف واحد.
استراتيجية التدريب: لضمان التعميم الصارم، تم تقييم النماذج على عينات اختبار منفصلة عن حيث المركبات (compound-disjoint holdouts). بالنسبة لمقارن المركب، لم يتم تضمين أي مقارنة في مجموعة الاختبار إلا إذا كان كلا المركبين غير موجودين في مرحلة التدريب؛ وتم استبعاد المقارنات التي تتداخل مع التقسيم. تم إدخال كل مقارنة مرتين مع تبديل المواضع وعكس التسميات لفرض التماثل.
المخرجات: تعيد النماذج احتمالية (قوة التفضيل) تتراوح من 0.50 (غير مقرر) إلى 1.00 (متأكد)، بدلاً من قيمة تقارب متوقعة.
النتائج الرئيسية تم تقييم النماذج على مقارنات محجوزة حيث لم يظهر أي من الهدف أو المركب (حسب نوع المقارن) خلال التدريب.
تفضيل الهدف (عبر العائلات): في 8,689 مقارنة محجوزة بين أهداف من عائلات مختلفة، حدد النموذج الهدف المفضل بدقة 75% من الوقت. وارتفعت الدقة إلى 94% لأكثر التنبؤات ثقة (القوة ≥ 0.80).
تفضيل الهدف (داخل العائلة الواحدة): في 32,738 مقارنة بين أهداف من نفس العائلة، بلغت الدقة 78%، وارتفعت إلى 95% للتنبؤات عالية الثقة. شكلت عائلات الكيناز (Kinase) الصعوبة الأكبر بدقة 73%، ويرجع ذلك على الأرجح إلى التشابه الهيكلي العالي بين الكينازات.
تفضيل المركب: في 65,725 مقارنة محجوزة حيث لم يُرَ أي من المركبين أثناء التدريب، حدد النموذج المركب المفضل بدقة 71% من الوقت. ووصلت هذه الدقة إلى 96% لأكثر التنبؤات ثقة.
تأثير حجم الفرق: ترتبط الدقة ارتباطًا وثيقًا بحجم فرق النشاط الحقيقي. عندما اختلف القياسان بأكثر من وحدتين لوغاريتميتين، تراوحت الدقة بين 90% و92%. وعندما كانا ضمن نصف وحدة لوغاريتمية، انخفضت الدقة إلى مستويات قريبة من الصدفة (0.57–0.64).
قيود التغطية: سقف الأداء للمقارنات عبر العائلات محدود بسجل البيانات المتاح، وليس ببنية النموذج. 4.6% فقط من المركبات المصنفة في قاعدة البيانات لديها قياسات عبر أكثر من عائلة بروتينية واحدة.
الأهمية والادعاءات يفترض البحث أن المقارنة الزوجية المباشرة هي نهج أكثر عملية وقوة من التنبؤ بقيم التقارب المطلقة لعمليات تحديد الأولويات. ويدعي المؤلفون أن هذين المقارنين يوفران مجموعة كاملة من أدوات التصنيف لمسار اكتشاف الأدوية التقليدي: يساعد مقارن المركب في تحديد ما يجب تصنيعه أو شراؤه لاحقًا، بينما يساعد مقارن الهدف في تحديد ما يجب إجراء فحص مضاد (counter-screen) ضده.
تشمل المساهمات الرئيسية ما يلي:
الشمولية: توسيع نطاق المقارنة الزوجية لما وراء العائلات المنفردة (مثل الكيناز أو GPCR) لتغطية 34 عائلة بروتينية متنوعة.
التنبؤ الخالي من البنية: إثبات أن التسلسل والواصفات الكيميائية ثنائية الأبعاد وحدها يمكن أن تصنف الأهداف والمركبات بفعالية دون الحاجة إلى بيانات هيكلية.
التقييم الصارم: وضع معيار مرجعي دقيق باستخدام تقسيمات منفصلة للمركبات، مما يضمن قدرة النماذج على التعميم على الكيمياء غير المرئية.
الفائدة التشغيلية: تُخرج النماذج احتمالية تفضيل ترتبط بالدقة، مما يسمح للمستخدمين بتصفية القرارات عالية الثقة. ويشير المؤلفون إلى أنه بينما تصنف النماذج المركبات والأهداف جيدًا ضمن المساحة الكيميائية والهدفية الممثلة، إلا أنها لا تقدر القدرة (potency) ولا يمكنها التنبؤ بالسمية أو نتائج السلامة بشكل مباشر.
يُقدم هذا العمل كخطوة تأسيسية ("نموذج عائلة التأسيس" - Family Foundation Model) يمكن للمستخدمين توسيعها ببياناتهم الخاصة، حيث تسمح بنية الغابات العشوائية بدمج أشجار جديدة دون إعادة تدريب النموذج بالكامل. تم إصدار النماذج والتعليمات البرمجية بموجب تراخيص مفتوحة لتسهيل تبني المجتمع لها وتوسيعها.