RNASeek: A Cross-Phyla Generative Foundation Model for Multipurpose RNA Modeling and Reinforcement Learning-Based Design
يُعد RNASeek نموذجاً تأسيسياً توليدياً بـ 1.6 مليار معلمة، يستفيد من التعلم المعزز لتوحيد تمثيل تسلسل الحمض النووي الريبوزي (RNA)، والتنبؤ الوظيفي، والتصميم الابتكاري، حيث نجح في توليد ريبوزيمات وأجزاء 3' UTR تم التحقق منها تجريبياً مع تعزيز الأداء.
المؤلفون الأصليون:Chen, S., Fernandes, N., Li, W. V., Wang, L., Jia, Z., Xiang, J. S.
داخل كل خلية حية، تجري محادثة شاسعة ومعقدة، ليس بالكلمات، بل بالجزيئات. وفي قلب هذا الحوار يكمن الحمض النووي الريبوزي (RNA)، وهو جزيء متعدد الاستخدامات يعمل كرسول ومنظم في آن واحد، حيث يحمل التعليمات من المخطط الجيني ويقرر كيفية تنفيذ تلك التعليمات. لعقود من الزمن، أدرك العلماء أن الترتيب المحدد للحروف في شريط الـ RNA هو ما يحدد شكله ووظيفته، تماماً كما يحدد ترتيب الحروف في الجملة معناها. ومع ذلك، كان التنبؤ بكيفية سلوك تسلسل جديد من الحروف تحدياً هائلاً. فالقواعد معقدة، وتتضمن تفاعلات بعيدة المدى وفروقاً هيكلية دقيقة يصعب رسم خرائطها يدوياً. والآن، طور الباحثون أداة جديدة تتعلم هذه القواعد من خلال قراءة الأدبيات البيولوجية للحياة نفسها، مما يسمح لهم ليس فقط بالتنبؤ بكيفية سلوك الـ RNA، بل بتصميم جزيئات جديدة تماماً ذات خصائص محددة ومرغوبة.
قام الفريق وراء هذا العمل، بقيادة باحثين من جامعة كاليفورنيا، ريفرسايد وجامعة كولومبيا، بإنشاء برنامج حاسوبي ضخم أطلقوا عليه اسم RNASeek. فكر في هذا البرنامج كطالب قرأ كل كتاب في مكتبة تحتوي على التعليمات الجينية لأكثر من مئة نوع مختلف، من النباتات والحيوانات إلى الفطريات والفيروسات. وخلافاً للأدوات السابقة التي صُممت لحل لغز واحد محدد فقط، بُني RNASeek لفهم اللغة العامة للـ RNA. لقد تم تدريبه على مجموعة بيانات تضم حوالي 150 مليار قطعة من المعلومات الجينية، ليتعلم التعرف على الأنماط في كيفية بناء الكائنات الحية المختلفة للـ RNA الخاص بها. كما تعلم البرنامج قراءة تعليمات اللغة الطبيعية، مما يعني أنه يمكن للعالم ببساطة أن يخبره بما يريد، مثل "أنشئ تسلسلاً مستقراً من الـ RNA" أو "صمم جزيئاً يقطع نفسه"، وسيحاول النموذج توليد حل.
لاختبار ما إذا كان هذا الطالب الرقمي قد تعلم اللغة حقاً، طلب الباحثون منه أولاً التنبؤ بسلوك "الريبوزيمات" (ribozymes). والريبوزيمات هي جزيئات RNA تعمل كإنزيمات، قادرة على قطع نفسها أو جزيئات أخرى. زود الفريق النموذج بآلاف تسلسلات الريبوزيمات المعروفة وسرعات قطعها المقاسة. نجح RNASeek في تعلم التنبؤ بالتسلسلات التي تقطع بسرعة وتلك التي تقطع ببطء، محددًا السمات الدقيقة التي تساهم في السرعة، مثل مرونة بعض العراوي في بنية الجزيء. وقد كان أداء النموذج مساوياً، أو حتى أفضل، من العديد من الأدوات المتخصصة المصممة خصيصاً لهذه المهمة، مما أثبت أنه استوعب المبادئ الأساسية لكيفية تحديد بنية الـ RNA للوظيفة.
وبتشجيع من هذا النجاح، دفع الباحثون النموذج إلى أبعد من ذلك، بطلب تصميم تسلسلات RNA جديدة من الصفر. وقد ركزوا على نوع مختلف من الـ RNA الموجود في المنطقة 3' غير المترجمة (3' untranslated region)، وهي قسم من الجزيء يساعد في تحديد مدى بقاء الـ RNA داخل الخلية. فالعمر الأطول يعني أن الخلية تنتج المزيد من البروتين الذي يشفر له الـ RNA، وهو أمر بالغ الأهمية للعلاجات مثل لقاحات mRNA. استخدم الباحثون تقنية تسمى "التعلم المعزز" (reinforcement learning)، وهي طريقة يلعب فيها البرنامج الحاسوبي لعبة التجربة والخطأ؛ حيث قام بتوليد آلاف التسلسلات المرشحة، بينما عمل جزء منفصل من النموذج كحكم، يقوم بتقييمها بناءً على مدى استقرارها المتوقع. ثم عدل البرنامج استراتيجيته لتوليد مرشحين أفضل، ليتعلم تدريجياً إنتاج تسلسلات عالية الاستقرار.
كانت النتائج مذهلة. فالتسلسلات التي صممها RNASeek لم تكن مجرد مجموعات عشوائية من الحروف؛ بل احتوت على أنماط محددة، مثل وفرة من الأدينين واليوراسيل، وهي أنماط معروفة بقدرتها على تثبيت الـ RNA. وعندما اختبر الباحثون هذه التصميمات الناتجة عن الحاسوب في بيئة مختبرية، وجدوا أن التسلسلات الجديدة أدت أداءً استثنائياً. بل إن بعض الجزيئات المصممة كانت أكثر استقراراً من أفضل التسلسلات الموجودة في الطبيعة أو تلك التي أنشأتها أدوات الذكاء الاصطناعي الأخرى. والأهم من ذلك، عندما قام الباحثون بخلط حروف هذه التصميمات الناجحة، أي تغيير ترتيبها مع الاحتفاظ بنفس المكونات، اختفى الاستقرار. وقد أكد هذا أن النجاح جاء من الترتيب المحدد للحروف، وليس فقط من التركيب الكيميائي، مما أثبت أن النموذج قد تعلم "النحو" الحقيقي للغة.
كما أظهرت الدراسة أن النموذج يمكنه اتباع تعليمات معقدة. إذ يمكن للعلماء أن يطلبوا من البرنامج توليد تسلسل RNA مستقر يتضمن "نمطاً" (motif) معيناً للاستنساخ أو يستبعد نمطاً معيناً قد يسبب مشاكل. وقد نجح النموذج في الالتزام بهذه القيود مع الاستمرار في تحسين الاستقرار. تشير هذه القدرة على اتباع أوامر اللغة الطبيعية وإنتاج أجز تط بيولوجية وظيفية إلى طريقة جديدة لهندسة الحياة. فبدلاً من الاعتماد على دورات بطيئة ومكلفة من التجربة والخطأ في المختبر، يمكن للعلماء الآن استخدام نظام موحد للتنبؤ بكيفية سلوك الـ RNA وتصميم جزيئات جديدة لتلبية احتياجات دقيقة. يرسخ هذا العمل حقيقة أن نموذجاً واحداً واسع النطاق يمكنه سد الفجوة بين فهم البيانات البيولوجية وابتكار أدوات بيولوجية وظيفية جديدة، مما يفتح الباب أمام تصميم أكثر كفاءة للعلاجات والأدوات البحثية.
ملخص تقني: RNASeek
بيان المشكلة بينما أحدثت النماذج اللغوية الكبيرة (LLMs) ثورة في معالجة اللغات الطبيعية وتصميم البروتينات، لا يزال الإطار العام الذي يربط بين نماذج تأسيسية للحمض النووي الريبي (RNA) وتصميم التسلسلات الوظيفية محدودًا. صُممت نماذج الـ RNA الحالية بشكل أساسي لتعلم التمثيل والتنبؤ بالنتائج اللاحقة، بدلاً من توليد تسلسلات مشروطة بالتعليمات وموجهة بمكافآت تجريبية كمية. علاوة على ذلك، يتطلب التعلم المعزز (RL) الفعال لتصميم الـ RNA إشارات مكافأة كثيفة وكمية تربط التباين في التسلسل بالنتائج الوظيفية عبر مساحات تسلسل متنوعة، وهي قدرة تفتقر إليها سير عمل تصميم الـ RNA التنظيمي الحالية.
المنهجية يقدم المؤلفون RNASeek، وهو نموذج تأسيسي توليدي بـ 1.6 مليار معلمة (parameter)، مبني على بنية DeepSeek (تحديداً محول decoder-only يعتمد على Qwen2.5) وتم تدريبه على مجموعة نصوص ترانسكريبتومية (transcriptomic corpus) عابرة للأسلاف.
البنية والترميز (Tokenization): يستخدم RNASeek مفردات توحيد (unified token vocabulary) تضم:
رموز النيوكليوتيدات (A, U, C, G).
رموز البنية الثانوية المتوقعة للـ RNA (تمثيل dot-bracket).
رموز العلامات الجينومية (مثل |u5u|, |u3u|, |s|, |t|, |i|) لتحديد المناطق الوظيفية.
رموز اللغة الطبيعية (12,000 رمز مستمدة من PubMed/PMC) لتعليمات المهام. تسمح هذه الاستراتيجية الهجينة للنموذج بقبول أوامر مهام بأسلوب اللغة الطبيعية (مثل `$predict_efficiency`) جنباً إلى جنب مع بيانات التسلسل، مما يتيح تنبؤاً وتصميماً مشروطاً مرناً دون الحاجة لإعادة تدريب المرمز (tokenizer) لكل مهمة.
التدريب المسبق (Pretraining): تم تدريب النموذج مسبقاً على ما يقرب من 1.5×1011 رمز mRNA من أكثر من 100 نوع متنوع (نباتات، حيوانات، فطريات، فيروسات) و2 مليار رمز لغة طبيعية. بلغت نافذة سياق التدريب 32,768 رمزاً. تم تعزيز حوالي 50% من التسلسلات بالبنية الثانوية المتوقعة (RNAfold) لتعلم الارتباط بين البنية والتسلسل.
الضبط الدقيق الخاضع للإشراف (التنبؤ): تم ضبط العمود الفقي المدرب مسبقاً باستخدام رأس انحدار (regression head) للتنبؤ بـ:
نشاط الانقسام الذاتي للريبوزيم (Ribozyme self-cleavage activity): باستخدام بيانات المقايسة المتوازية الضخمة للمراسل (MPRA) لمكتبات ريبوزيم hammerhead (متغيرات c-di-GMP وLoop I/II العشوائية).
استقرار mRNA الفيروسي: باستخدام بيانات MPRA حيث تم إدراج قطع RNA فيروسية داخل 3′ UTRs. تم تحويل القيم المستهدفة باستخدام درجات z (z-scores) بـ (log-plus-one) لتثبيت التباين.
التعلم المعزز (التصميم): للانتقال من التنبؤ إلى التصميم، استخدم المؤلفون تحسين السياسة النسبي للمجموعة (Group Relative Policy Optimization - GRPO).
نموذج المكافأة: عملت نماذج الانحدار التي تم ضبطها بدقة كدوال مكافأة (تتنبأ بكفاءة الريبوزيم أو استقرار 3′ UTR).
تحسين السياسة: تم تحديث العمود الفقري التوليدي لتعظيم المكافآت مع الالتزام بالقيود التي يحددها المستخدم (مثل تضمين/استبعاد موتيف IUPAC، قيود الطول) والمشفرة في مطالبات اللغة الطبيعية.
المكافأة المركبة: دمجت المكافأة النهائية درجة نموذج الانحدار (40%) مع درجة بناء الجملة/البنية (60%) لضمان تكوين نيوكليوتيدات صالح، وعلامات صحيحة، والالتزام بقيود IUPAC.
المساهمات الرئيسية
إطار عمل موحد: يؤسس RNASeek لعمود فقري ذاتي الانحدار (autoregressive) قادر على كل من التنبؤ الوظيفي الكمي وتوليد التسلسلات من العدم (de novo) بشكل قابل للتحكم، مما يسد الفجوة بين تعلم التمثيل والتصميم التوليدي.
التعميم عبر الأسلاف: من خلال التدريب على مجموعة متنوعة تشمل ممالك وفيروسات متعددة، يلتقط النموذج السمات النسخية الخاصة بالأنواع وحدود الإنترون-الإكسون في وضع الصفر (zero-shot).
التوليد المشروط بالتعليمات: يسمح دمج رموز اللغة الطبيعية للمستخدمين بتحديد أهداف تصميم معقدة (مثل "استبعاد موتيف X، تضمين موتيف Y") دون تغييرات هيكلية.
التحسين المدفوع بالتعلم المعزز (RL): يوضح تطبيق GRPO على تصميم الـ RNA مساراً عملياً لتحسين التسلسلات نحو خصائص بيولوجية مرغوبة (الاستقرار، النشاط التحفيزي) مع تلبية قيود التركيب الصارمة.
النتائج
قدرات الصفر (Zero-Shot): أظهرت تضمينات (embeddings) التدريب المسبق فصلاً واضحاً للأنواع في مخططات UMAP وحققت تنبؤاً بحدود الإنترون في وضع الصفر بمعامل تعقيد (perplexity) يبلغ ~323، مما يمثل تحسناً بنحو 37 ضعفاً عن محدد الرموز الموحد.
الأداء التنبئي:
الريبوزيمات: حقق RNASeek معامل ارتباط بيرسون للتحقق من الصحة قدره r=0.628 في كفاءة الريبوزيم، متفوقاً على معظم النماذج المرجعية (بما في ذلك RNA-FM، وNucleotide Transformer، ونماذج متنوعة من نوع BERT) ومتجاوزاً نموذج LSTM المخصص.
الاستقرار: بالنسبة لاستقرار 3′ UTR الفيروسي، حقق RNASeek معامل ارتباط سبيرمان قدره r=0.342، وهو أداء تنافسي مع النماذج رفيعة المستوى مثل UTR-BERT-6mer وRiNALMo-micro.
التصميم التوليدي:
3′ UTRs: أنتج التوليد الموجه بـ GRPO تسلسلات ذات استقرار متوقع أعلى بكثير من التسلسلات العشوائية، والـ 3′ UTRs البشرية الطبيعية، والتسلسلات المولدة بواسطة ChatGPT-5 أو GEMORNA.
التحقق التجريبي (الاستقرار): تم التحقق تجريبياً من أربعة مرشحين لـ 3′ UTRs من إنتاج RNASeek باستخدام مقايسة مراسل ثنائية اللوسيفيريز. أظهرت جميع المرشحين زيادة في تعبير المراسل مقارنة بالضوابط السلبية. ومن الجدير بالذكر أن RNASeek527 أظهر نشاطاً أعلى بكثير من جميع تسلسلات GEMORNA المختبرة وتجاوز أداء أفضل تسلسل (K4) من مجموعة البيانات الأصلية.
الريبوزيمات: أظهرت ريبوزيمات GRPO نشاطاً متوقعاً أعلى من الضوابط المبعثرة وبيانات المختح الرطب. وأكد التحقق التجريبي أن ريبوزيمات مختارة من إنتاج RNASeek حققت مستويات النوع البري (wild-type) من نشاط الانقسام الذاتي في الخلايا.
الرؤى الميكانيكية: كشف تحليل التسلسلات المولدة أن الريبوزيمات عالية الكفاءة فضلت الحلقات المرنة ذات المحتوى المنخفض من GC واحتمالية عدم الازدواج العالية. بالنسبة لـ 3′ UTRs، تعلم النموذج استخدام بناء (syntax) غني بـ AU وتوزيعات نيوكليوتيدية موضعية محددة لتعزيز الاستقرار، بشكل يختلف عن مجرد خلط التركيب.
الأهمية يزعم البحث أن RNASeek يوفر استراتيجية عامة لهندسة الـ RNA التنظيمي بخصائص مرغوبة من خلال ربط وظيفة الـ RNA المتعلمة بتصميم تسلسل من العدم وقابل للتحكم. كما يثبت أن بنيات النماذج اللغوية الكبيرة وطرق تحسين السياسة (GRPO) التي طُورت للغة الطبيعية يمكن تكييفها بنجاح لتصميم التسلسلات البيولوجية. يضع هذا العمل إطاراً موحداً للتدريب المسبق–التنبؤ–التحسين يقلل من الاعتماد على تكرار تجارب المختح الرطب لفحص التسلسلات. وبينما يشير المؤلفون إلى قيود تتعلق بخصوصية نوع الخلية وإمكانية وجود تحيز في نموذج المكافأة، إلا أنهم يرون أن هذا النهج يقدم أساساً قابلاً للتوسع لمهام مستقبلية تشمل التنبؤ بإنزيمات النشاط، ونمذجة الربط (splicing)، وتصميم العلاجات القائمة على الـ RNA.