Evaluation of multiple sclerosis risk loci reveals that genomic oracles fail to generalise sequence effects across host contexts
تُظهر هذه الدراسة أن عرافات الجينوم القائمة على التعلم العميق تفشل في تعميم تأثيرات التسلسل عبر سياقات المضيف المختلفة، حيث تعتمد تنبؤاتها بنشاط العناصر التنظيمية بشكل كبير على الموقع الجينومي المحدد ولا يمكن التنبؤ بها بشكل موثوق من خلال سمات التسلسل وحدها.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في المشهد الشاسع للجينوم البشري، تعمل أجزاء معينة من الحمض النووي (DNA) كمفاتيح، حيث تقوم بتشغيل الجينات أو إيقافها للتحكم في كيفية عمل الخلايا. لطالما سعى العلماء لفهم الشفرة الدقيقة التي تخبر هذه المفاتيح أين تعمل ومتى تتنشط. وفي السنوات الأخيرة، ظهرت برامج حاسوبية قوية للمساعدة في فك رموز هذه اللغة. هذه البرامج، التي تُسمى غالبًا "أوراكل الجينوم" (genomic oracles)، يمكنها النظر إلى سلسلة من أحرف الحمض النووي والتنبؤ بكيفية سلوكها داخل خلية حية، وتقدير ما إذا كانت ستفتح للسماح بنشاط الجينات أو ستبقى مغلقة. ولأن هذه الأدوات الرقمية سريعة وغير مكلفة مقارنة بالتجارب المختبرية، يتجه الباحثون بشكل متزايد لاستخدامها لتصميم تسلسلات جديدة من الحمض النووي، آملين في ابتكار مفاتيح مخصصة تعمل تمامًا كما هو مخطط لها. والأمل الكامن وراء ذلك هو أنه إذا قال برنامج حاسوبي إن تسلسلًا معينًا من الحمض النووي يعد مفتاحًا جيدًا في جزء معين من الجينوم، فسيظل مفتاحًا جيدًا إذا نُقل إلى موقع مختلف.
يتحدى دراسة جديدة هذا الافتراض الأساسي من خلال اختبار ما إذا كانت هذه التنبؤات الرقمية تصمد عندما يُوضع نفس تسلسل الحمض النووي في "أحياء" مختلفة من الجينوم. ركز الباحثون على التصلب المتعدد، وهو مرض يهاجم فيه الجهاز المناعي الجهاز العصبي، ونظروا في المناطق الجينية المحددة المعروفة بزيادة خطر الإصابة بهذه الحالة. استخدموا نموذجًا للذكاء الاصطناعي لتوليد الآلاف من التسلسلات المرشحة للحمض النووي التي تبدو وكأنها يمكن أن تعمل كمفاتيح تنظيمية في الخلايا المناعية. ثم استخدموا "أوراكل الجينوم" لتقييم هذه المرشحات، واختاروا تلك التي توقع الحاسوب أنها ستكون الأكثر نشاطًا. ثم أجرى الفريق اختبارًا صارمًا: أخذوا نفس التسلسلات المختارة ووضعوها في أربعة وعشرين موقعًا مختلفًا داخل الجينوم لمعرفة ما إذا كان تنبؤ الحاسوب سيظل ثابتًا.
كشفت النتائج عن نقص مذهل في الاتساق. فبينما استطاع البرنامج الحاسوبي ترتيب التسلسلات بشكل جيد داخل موقع واحد، فشلت تنبؤاته في التعميم عند نقل التسلسلات. لم يكن تأثير تغيير محدد في تسلسل الحمض النووي خاصية ثابتة للتسلسل نفسه؛ بل اعتمد كليًا على مكان وجود التسلسل في الجينوم. ففي بعض المواقع، جعل تعديل معين في الحمض النووي التسلسل أكثر نشاطًا، بينما في مواقع أخرى، جعل التعديل ذاته التسلسل أقل نشاطًا أو لم يكن له أي تأثير على الإطلاق. وجد الباحثون أن سلوك التسلسل كان معتمدًا للغاية على محيطه، حيث كان التباين بين المواقع المختلفة هائلًا، مع انعكاس اتجاه التأثير في ما يقرب من نصف المواقع المختبرة.
لفهم ما كان الحاسوب "يراه" حقًا، أجرى الفريق تدخلات مباشرة على تسلسلات الحمض النووي. واختبروا ما إذا كان تفضيل الحاسوب مدفوعًا بوجود مواقع ارتباط محددة للبروتينات المعروفة بالتحكم في الجينات، أو بكثافة هذه المواقع. وكانت الإجابة هي لا؛ إذ لم يؤدِ إزالة هذه المواقع أو تغيير عددها إلى تغيير درجة تقييم الحاسوب بطريقة يمكن التنبؤ بها. بدلاً من ذلك، كان العامل الذي يهم حقًا هو محتوى هيكل كيميائي محدد يسمى "CpG"، والذي يتضمن اقتران حرفين من أحرف الحمض النووي. ومع ذلك، حتى هذا العامل لم يعمل بمفرده؛ فزيادة كمية هذا الهيكل في الحمض النووي حسنت الدرجة في بعض المواقع الجينومية ولكنها أضرت بالدرجة في مواقع أخرى. وقد تم تحديد اتجاه التأثير بواسطة الموقع المضيف، وليس بواسطة التعديل نفسه.
اختبرت الدراسة أيضًا ما إذا كان برنامج حاسوبي ثانٍ، تم تدريبه بشكل مستقل، سيقدم نفس النتائج. أكد هذا النموذج الجديد، المبني ببنية مختلفة ومدرب على بيانات مختلفة، النتيجة الرئيسية: كان تأثير تعديل الحمض النووي غير مستقر للغاية ويختلف بشكل كبير اعتمادًا على الموقع الجينومي. ومع ذلك، لم يتفق البرنامجان على المواقع التي ستظهر تأثيرًا إيجابيًا أو سلبيًا بالضبط، مما يشير إلى أنه بينما يعد عدم الاستقرار ظاهرة حقيقية، فإن التفاصيل المحددة لكيفية تفسير النموذج للموقع هي فريدة لكل نموذج.
والأهم من ذلك، تحقق الباحثون مما إذا كانت التسلسلات التي اختارها الحاسوب تعمل بالفعل بشكل أفضل في تجربة واقعية. قارنوا درجات الحاسوب بالنشاط المقاس من تجربة مختبرية واسعة النطاق شملت آلاف العناصر من الحمض النووي. وفشلت معايير اختيار الحاسوب في التنبؤ بالتسلسلات التي كانت نشطة حقًا في الخلايا. في الواقع، أظهرت التسلسلات التي صنفها "الأوراكل" على أنها الأفضل سلوكًا معاكسًا في المختبر، حيث حصلت العناصر الأكثر تحديدًا ونشاطًا على أدنى الدرجات من "الأوراكل". ويشير هذا الانفصال إلى أن الهدف المحدد الذي كان يحسن الحاسوب من أجله لا يعكس النشاط البيولوجي الفعلي للحمض النووي.
اكتشف الباحثون أيضًا أن طريقة رياضية أبسط بكثير، تعتمد على عد أنماط الحروف في الحمض النووي، يمكنها توليد تسلسلات تضاهي ما تنتجه نماذج الذكاء الاصطناعي المعقدة القائمة على التعلم العميق. هذه الطريقة البسيطة، التي لا تتطلب حواسيب قوية ويمكن ضبطها في ثوانٍ، طابقت أداء الشبكات العصبية المتقدمة في كل مقياس تم اختباره. ويشير هذا الاكتشاف إلى أن تعقيد نماذج التعلم العميق لم يكن ضروريًا لالتقاط الأنماط الأساسية لتسلسلات الحمض النووي في هذا السياق.
في الختام، تخلص الدراسة إلى أن التأثير على مستوى التسلسل الذي يتعلمه أو يقيسه "أوراكل الجينوم" ليس خاصية للتسلسل وحده، بل هو خاصية للتسلسل مدمجة مع السياق الجينومي المحدد الذي يوجد فيه. وهذا الاعتماد على الموقع لا يمكن التنبؤ به من خلال السمات البسيطة والرخيصة للحمض النووي المحيط. وبالنسبة للعلماء الذين يصممون عناصر جينية جديدة، فإن هذا يعني أن التصميم الذي يتم اختياره والتحقق منه في محاكاة حاسوبية في موقع واحد لا يضمن أبدًا كيف سيتصرف بمجرد نقله أو إدراجه في مكان آخر. وتعمل هذه النتائج كتحذير من أن هذه الأدوات الرقمية القوية، رغم فائدتها، لا يمكن الوثوق بها بعد في التنبؤ بسلوك التسلسلات المصممة عبر المشهد المتنوع للجينوم البشري دون تحقق تجريبي مباشر في مواقع متعددة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.