A Large Scale Investigation of Scaling Limits in Chemical Language Models
تكشف هذه الدراسة واسعة النطاق التي شملت أكثر من 30,000 تجربة أنه في حين أن توسيع نطاق نماذج اللغة الكيميائية يحسن فقدان ما قبل التدريب وفهم القواعد التركيبية الكيميائية، إلا أن هذه المكاسب لا تترجم إلى تحسينات متناسبة في التصميم الجزيئي الموجه نحو الأهداف، مما يسلط الضوء على انفصال حرج بين تعلم التمثيل والمنفعة اللاحقة رغم تقديم مجموعة أدوات NovoMolGen المتطورة.
في المشهد الواسع للعلم الحديث، هناك اعتقاد متزايد بأنه إذا قمت ببساطة بجعل النموذج الحاسوبي أكبر وتغذيتُه بمزيد من البيانات، فإنه سيصبح ذكياً بشكل حتمي. هذه الفكرة، المعروفة باسم "التوسع" (scaling)، قد غيرت فهمنا للغة، مما سمح للآلات بكتابة المقالات، وترجمة النصوص، وإجراء المحادثات من خلال التعلم من مكتبات ضخمة من الكتابات البشرية. وقد طبق العلماء مؤخراً هذا المنطق نفسه على الكيمياء، حيث أنشأوا "نماذج لغة كيميائية". هذه النماذج هي أنظمة ذكاء اصطناعي تم تدريبها على قراءة وكتابة سلاسل الحروف التي تمثل الجزيئات، تماماً كما يتعلم الحاسوب قراءة الجمل. وكان الأمل هو أنه من خلال جعل هذه النماذج الكيميائية أكبر وتدريبها على المزيد من الجزيئات، ستصبح بطبيعة الحال أفضل في تصميم أدوية جديدة من الصفر، والعثور على مركبات مبتكرة يمكنها علاج الأمراض أو معالجة العلل.
ومع ذلك، فإن تحقيقاً واسع النطاق أجري مؤخراً يتحدى هذا الافتراض المباشر. فقد سعى الباحثون لاختبار ما إذا كانت القواعد التي تحكم تعلم اللغة تنطبق أيضاً على العالم المعقد للتصميم الكيميائي. قاموا ببناء عائلة من النماذج تتراوح من الصغيرة جداً إلى الضخمة للغاية، ودربوها على مليارات الجزيئات لمعرفة كيف سيتغير أداؤها. وتكشف الدراسة، التي أجراها فريق من مؤسسات تشمل المعهد الهندي للتكنولوجيا في مدراس ومعهد ميلا - كيبيك للذكاء الاصطناعي، عن انفصال مفاجئ. فبينما أصبحت النماذج بالفعل أفضل في فهم القواعد الأساسية للكيمياء مع نموها، إلا أن هذا التحسن لم يترجم إلى نتائج أفضل عند مطالبتها بتصميم أدوية محددة ومفيدة. في الواقع، وجد الباحثون أن نموذجاً صغيراً نسبياً يمكنه أن يؤدي بشكل جيد تماماً مثل نموذج ضخم عندما يُكلف بالمهمة الصعبة المتمثلة في إيجاد أدوية جديدة، مما يشير إلى أن مجرد جعل الحاسوب أكبر ليس هو المفتاح لفك أسرار اكتشاف الأدوية.
بدأ الباحثون بتدريب أكثر من ثلاثين ألف نسخة مختلفة من هذه النماذج الكيميائية. فقد تباينت أحجام النماذج من نصف مليون معلمة (parameter) إلى مليار معلمة، وغذوها بأنواع مختلفة من البيانات الجزيئية، واختبروها باستخدام طرق متنوعة لتمثيل الهياكل الكيميائية. وكان أحد النتائج الرئيسية هو أن النماذج تعلمت بالفعل التنبؤ بالجزء التالي من السلسلة الكيميائية بدقة متزايدة مع كبرها ورؤيتها لمزيد من البيانات. وهذا يشبه كيف يصبح الطفل الذي يتعلم لغة ما أفضل في النهاية في تخمين الكلمة التالية في جملة ما. لقد أصبحت النماذج ممتازة في فهم قواعد بناء الجمل الكيميائية (syntax)، ومعرفة أي تركيبات الذرات تشكل جزيئات صالحة وأيها لا تشكل. واستمر هذا الفهم الداخلي للهيكل الكيميائي في التحسن حتى بالنسبة لأكبر النماذج، مما يشير إلى أن الحاسوب كان ينجح في حفظ "المفردات" و"القواعد" الخاصة بالكيمياء.
ولكن، عندما اختبر الباحثون هذه النماذج في الهدف الفعلي لتصميم الأدوية، تغيرت القصة بشكل دراماتيكي. فقد طلبوا من النماذج توليد جزيئات جديدة يمكن أن ترتبط بأهداف مرضية محددة أو تلبي مجموعة من الخصائص الكيميائية المرغوبة، وهي عملية تتضمن حلقة معقدة من التجربة والخطأ. وهنا، تلاشت فوائد الحجم؛ فقد استقر أداء النماذج في تصميم هذه الجزيئات الموجهة نحو هدف معين، أو "تسطح"، بمجرد وصول النماذج إلى حجم يبلغ حوالي خمسة ملايين معلمة. إن زيادة حجم النموذج إلى مليار معلمة، وهو ما يعادل مائتين ضعف الحجم السابق، لم تؤدِ إلى أي تحسن إضافي تقريباً في جودة الأدوية التي يمكنها تصميمها. فقد أدى نموذج بـخمسة ملايين معلمة أداءً يضاهي النموذج الضخم ذي المليار معلمة في إيجاد مرشحات جديدة لاكتشاف الأدوية.
تشير هذه النتيجة إلى أن الطريقة الحالية لتدريب هذه النماذج، والتي تركز على التنبؤ بالحرف التالي في السلسلة الكيميائية، تعلم الحاسوب قواعد الكيمياء ولكنها لا تعلمه بالضرورة المعنى الأعمق لكيفية تفاعل تلك الجزيئات مع الأنظمة البيولوجية. لقد تعلمت النماذج التحدث بلغة الكيمياء بطلاقة، لكنها لم تتعلم استخدام تلك اللغة لحل مشكلات محددة. ووجد الباحثون أنه بينما استطاعت النماذج الأكبر توليد جزيئات صالحة، إلا أنها لم تصبح أفضل بشكل ملحوظ في إيجاد الجزيئات النوعية عالية الجودة المطلوبة للطب. وتشير الدراسة إلى أن العائق ليس حجم النموذج أو كمية البيانات، بل هو الطريقة التي تُدرب بها النماذج والأهداف التي يُطلب منها تحسينها.
إن تداعيات هذا الاكتشاف كبيرة لمستقبل الذكاء الاصطناعي في العلوم. فهي تشير إلى أن الطريق للمضي قدماً في اكتشاف الأدوية قد لا يكمن في بناء نماذج حاسوبية أكبر فأكبر، بل في تطوير طرق أذكى لتدريب النماذج التي نمتلكها بالفعل. ويقترح الباحثون أنه بدلاً من مجرد تعليم الحواسيب التنبؤ بالرمز الكيميائي التالي، نحتاج إلى تعليمها فهم الخصائص الوظيفية للجزيئات، مثل كيفية تفاعلها مع البروتينات أو كيفية سلوكها في جسم الإنسان. ومن خلال التركيز على هذه المعاني الكيميائية الأعمق بدلاً من مجرد الأنماط السطحية، قد يتمكن العلماء من إنشاء أدوات أكثر كفاءة وفعالية لتصميم الجيل القادم من الأدوية المنقذة للحياة. ويعمل هذا العمل كتذكير بأنه في عالم الكيمياء المعقد، ليس الأكبر هو الأفضل دائماً، وأن الذكاء الحقيقي يتطلب ما هو أكثر من مجرد ذاكرة هائلة للأنماط.
ملخص تقني: تحقيق واسع النطاق في حدود التوسع لنماذج اللغة الكيميائية
بيان المشكلة
تبنت نماذج اللغة الكيميائية (CLMs) بشكل متزايد نموذج التوسع المتبع في معالجة اللغات الطبيعية (NLP)، وذلك عبر التدريب المسبق للنماذج المحولة (transformers) ذات التوليد الذاتي (autoregressive) على مجموعات ضخمة من البيانات الجزيئية، مع افتراض ضمني بأن تقليل الخطأ في التوقع (cross-entropy) للرمز التالي يترجم مباشرة إلى تحسين تصميم الجزيئات. ومع ذلك، لا تزال العلاقة بين خيارات التصميم، وديناميكيات التدريب، وجودة التوليد الموجه نحو الأهداف في المهام النهائية غير مفهومة بشكل جيد. وبينما استكشفت الدراسات الحديثة التوسع في نماذج اللغة الكيميائية، إلا أنها غالباً ما تفشل في توضيح كيف تترجم مكاسب التدريب المسبق إلى تحسين عملي في التصميم الجزيئي المستهدف، أو كيفية مراعاة تكاليف التحسين اللاحقة. يبحث هذا البحث فيما إذا كان التحسن المستمر في خسارة التدريب المسبق والتمثيلات الكيميائية الداخلية يؤدي بالضرورة إلى مكاسب مماثلة في التصميم الجزيئي الموجه نحو الأهداف.
المنهجية
يقدم المؤلفون دراسة متحكم بها حوسبياً تتضمن أكثر من 30,000 تجربة عبر مجموعة واسعة من المتغيرات:
مقاييس النماذج: نماذج تتراوح أحجامها من 0.5 مليون إلى مليار معلمة (parameter).
التمثيلات والترميز (Tokenization): ثلاثة تمثيلات لسلاسل الجزيئات (SMILES، SELFIES، SAFE) واستراتيجيتان للترميز (على مستوى الذرة، وتشفير زوج البايت - BPE).
البنى الهيكلية (Architectures): نماذج تعتمد فقط على فك الترميز (decoder-only) باستخدام خلفية Qwen3، ونماذج مشفر-فك تشفير (encoder–decoder) باستخدام خلفية T5Gemma.
مجموعات البيانات: أربع مجموعات بيانات خاضعة للتحكم في تسرب البيانات (leakage-controlled) متفاوتة الحجم والتنوع: MOSES، وChEMBL، وPubChem، وZINC-22. ولمنع تسرب البيانات، تمت إزالة الجزيئات ذات التشابه العالي (Tanimoto similarity) مع المواد النشطة المعروفة والأهداف المرجعية من جميع مجموعات بيانات التدريب.
مقاييس التقييم:
التدريب المسبق: تم قياس "الاحتمال اللوغاريتمي السالب" لمجموعة التحقق بوحدة بت لكل جزيء (bits per molecule) لتوحيد المقارنة بين التمثيلات المختلفة رغم اختلاف أطوال السلاسل.
تحليل التوسع: استخدام تحليل IsoFLOP لتحديد أحجام النماذج المثلى من حيث الحوسبة (Nopt) وأحجام البيانات المثلى (Dopt) عند ميزانيات حوسبية ثابتة (C≈6ND).
التمثيلات الداخلية: استخدام الاختبار الخطي للطبقات (layer-wise linear probing) لـ 36 خاصية جزيئية (الخصائص الفيزيوكيميائية، أهداف PMO، درجات الارتباط/docking scores) والصلاحية (validity). وتحليل المشفّر التلقائي المتناثر (Sparse Autoencoder - SAE) لقياس أحادية المعنى للميزات (monosemanticity) وارتباط الخصائص.
الأداء النهائي: تقييم التوليد الموجه نحو الأهداف باستخدام معيار التحسين الجزيئي العملي (PMO) (22 مهمة، 10 آلاف استدعاء لـ oracle) والارتباط القائم على البنية (5 أهداف، 3 آلاف استدعاء). تم إجراء الضبط الدقيق باستخدام إطار عمل REINVENT مع خوارزمية التعلم التعزيزي Augmented Hill-Climb تحت ميزانيات ثابتة لـ oracle.
المساهمات الرئيسية
مجموعة NovoMolGen: إصدار عائلة من 42 نموذج لغة كيميائية (CLM) تم تدريبها مسبقاً من الصفر، مما يضع معياراً جديداً لنمذجة اللغة الكيميائية.
ملفات تعريف IsoFLOP للكيمياء: أول تطبيق لتحليل IsoFLOP على نماذج اللغة الكيميائية، مما يحدد علاقات قانون القوة (power-law) لنمذجة التسلسلات الكيميائية.
الفصل بين التدريب المسبق والتصميم: تقديم برهان تجريبي شامل على أنه بينما تتحسن خسارة التدريب المسبح والتمثيلات الكيميائية الداخلية مع زيادة الحجم، فإن أداء التوليد الجزيئي الموجه نحو الأهداف يصل إلى مرحلة التشبع مبكراً.
تحليل التمثيل والمجموعات النصية: مقارنة منهجية تظهر أن التمثيل الجزيئي (SMILES مقابل SELFIES مقابل SAFE) وتنوع المجموعة النصية لهما تأثير أكبر على الخسارة من عملية الترميز أو البنية الهيكلية.
رؤى حول القابلية للتفسير: أدلة على أن القواعد النحوية الكيميائية (chemical syntax) تُتعلم في مرحلة مبكرة، بينما تظهر الخصائص الدلالية (المجموعات الوظيفية، درجات الارتباط/docking scores) لاحقاً وتصبح أكثر سهولة في الوصول إليها مع زيادة الحجم، ومع ذلك، فإن هذا لا يترجم خطياً إلى مكاسب في التحسين اللاحق.
النتائج
1. قوانين التوسع في التدريب المسبق
تتبع نمذجة التسلسل الكيميائي اتجاهات التوسع المثلى للحوسبة بشكل مشابه لمعالجة اللغات الطبيعية. وجدت الدراسة أن حجم النموذج الأمثل يتناسب طردياً كـ Nopt∝C0.69 وحجم البيانات الأمثل كـ Dopt∝C0.31. وتنخفض خسارة مجموعة التحقق (بت لكل جزيء) بسلاسة مع زيادة الحوسبة عبر جميع أحجام النماذج (من 0.5 مليون إلى مليار).
2. تأثير خيارات التصميم
التمثيل: حقق SMILES باستمرار أقل عدد من "البت لكل جزيء" عبر جميع المقاييس، متفوقاً على SELFIES وSAFE. ورغم أن رموز SELFIES أسهل في التنبؤ بكل رمز على حدة، إلا أن طول التسلسل المطلوب لترميز الجزيئات أدى إلى زيادة الخسارة لكل جزيء.
المجموعة النصية (Corpus): كان للمجموعة النصية للتدريب المسبق التأثير الأكبر على الخسارة. سجلت مجموعة MOSES (ضيقة، شبيهة بالأدوية) أدنى خسارة، بينما سجلت ZINC-22 (واسعة، جاهزة للتصنيع) أعلى خسارة، مما يعكس صعوبة نمذجة الفضاءات الكيميائية المتنوعة.
الترميز والبنية الهيكلية: كانت هذه العوامل لها تأثيرات طفيفة تعتمد على الحجم فيما يتعلق بالخسارة مقارنة بالتمثيل والمجموعة النصية.
3. التمثيلات الداخلية
النحو مقابل الدلالة: كشف الاختبار الخطي عن مسار تعلم متميز. حيث تشبع النحو الكيميائي (الصلاحية/validity) مبكراً (وصل إلى 90% من المكسب النهائي بعد 0.1 رمز لكل معلمة). وفي المقابل، تظهر الخصائص الدلالية (درجات الارتباط، أهداف PMO، الواصفات الفيزيوكيميائية) ببطء أكبر وتستمر في التحسن مع زيادة الحجم ورموز التدريب.
تحليل SAE: أظهرت المشفرات التلقائية المتناثرة زيادة في أحادية المعنى وارتباطات الميزات بالخصائص مع تقدم التدريب، مما يشير إلى أن الميزات الكيميائية تصبح أكثر سهولة في الوصول إليها خطياً في الفضاء الكامن.
4. التوليد الموجه نحو الأهداف في المهام النهائية
على الرغم من التحسن المستمر في خسارة التدريب المسبق والتمثيلات الداخلية، إلا أن أداء التوليد الموجه نحو الأهداف يتشبع عند حوالي 5 ملايين معلمة.
معيار PMO: تفوق نموذج NovoMolGen بحجم 5 ملايين معلمة على REINVENT وf-RAG. وزيادة الحجم إلى مليار معلمة لم تؤدِ إلا إلى مكاسب هامشية (ارتفع إجمالي درجة PMO من 16.45 إلى 16.68).
الارتباط (Docking): وبالمثل، استقرت درجات الارتباط للنواتج الجديدة عند تجاوز 5 ملايين معلمة، حيث تحسنت إجمالي درجة الارتباط من -65.8 إلى -66.2 كيلو كالوري/مول فقط.
التوليد غير المقيد: لم يؤدِ التوسع إلى تحسين التعميم في أخذ العينات غير المقيدة؛ إذ لم تنخفض مسافة Fréchet ChemNet Distance (FCD) باستمرار مع انخفاض الخسارة، وظلت الجزيئات التي تم سحب عيناتها مرتبطة بالتوزيع التدريبي.
الأهمية والادعاءات
يدعي البحث وجود انفصال جوهري بين تعلم التمثيل الكيميائي والتصميم الجزيئي الموجه نحو الأهداف في ظل أهداف النصوص الذاتية الحالية. ويرى المؤلفون أن:
تناقص العوائد: إن مجرد زيادة عدد المعلمات تحت أهداف التدريب المسبق الحالية يؤدي إلى تناقص العوائد في مهام اكتشاف الأدوية العملية.
الكفاءة: النماذج المدمجة (~5 ملايين معلمة) تحافظ على أداء تنافسي في المهام النهائية مع تقليل تكلفة التوليد وتحديثات السياسة بشكل هائل (أرخص بنحو 200 مرة لكل تحديث سياسة مقارنة بنماذج المليار معلمة).
محدودية المعايير الحالية: تفشل المعايير الحالية وأهداف التدريب المسبق (التي تركز على الصلاحية الكيميائية والنحو) في التقاط التعقيد الكيميائي المطلوب للتصميم الوظيفي. فالإشارة السائدة في المكتبات الكيميائية الضخمة (مثل PubChem وZINC-22) تعلم النحو بدلاً من الدلالات الوظيفية.
الاتجاهات المستقبلية: يحفز المؤلفون تطوير نماذج تدريب مسبق تتعلم الدلالات الكيميائية بشكل مباشر أكثر، مثل دمج إشارات التفاعل بين البروتين واللجين (protein-ligand interaction)، أو الخصائص الفيزيوكيميائية، أو استخدام التعلم التعزيزي كإشارة "لياقة" (fitness) في مرحلة مبكرة من التدريب. ويقترحون أن التقدم المستقبلي يتطلب أهدافاً تتجاوز مجرد الصلاحية الكيميائية وليس فقط زيادة حجم النماذج.
يخلص المؤلفون إلى أنه بينما تنطبق قوانين التوسع المستوحاة من معالجة اللغات الطبيعية على خسارة التدريب المسبق والتمثيلات الداخلية، إلا أنها لا تنطبق على التوليد الموجه نحو الأهداف، مما يشير إلى ضرورة تحول المجال من التركيز على زيادة حجم النموذج إلى تحسين كفاءة العينات وأهداف التعلم.