Ancestral Sequences Cannot be Accurately Reconstructed via Interpolation in a Variational Autoencoder's Latent Space
تُظهر هذه الدراسة أنه على الرغم من قدرة المشفرات التلقائية التباينية على نمذجة التفاعلات الوراثية الجينية، إلا أن فقدان المعلومات المتأصل خلال عملية فك التشفير يمنعها من إعادة بناء التسلسلات السلفية بدقة، حيث تتفوق عليها باستمرار الطرق القائمة على الاحتمالية وطرق الاقتصاد في التغيير.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل
في أعماق تاريخ الحياة، يحمل كل كائن حي سجلاً جزيئياً لأسلافه. لطالما سعى العلماء لقراءة هذا السجل، وهي عملية تُعرف باسم إعادة بناء التسلسل السلفي. تخيل أنك تحاول تخمين الكلمات الدقيقة لرسالة كتبها جدٌّ أكبر، بناءً فقط على النسخ التي يحتفظ بها أحفاد أحفاده الكثر. في علم الأحياء، هذه "الكلمات" هي سلاسل من الأحماض الأمينية التي تشكل البروتينات، وهي محركات العمل في كل خلية. لعقود من الزمن، استخدم الباحثون نماذج إحصائية لملء الكلمات المفقودة، بافتراض أن كل حرف في السلسلة يتغير بشكل مستقل عن الحروف الأخرى، مثل كلمة واحدة في جملة يتم استبدالها دون التأثير على معنى الجملة بأكملها. كان هذا النهج هو الأداة القياسية لفهم كيفية تطور البروتينات عبر ملايين السنين.
ومع ذلك، نادراً ما تكون البيولوجيا بهذه البساطة. في الواقع، غالباً ما تعتمد الحروف في سلسلة البروتين على بعضها البعض؛ فتغيير حمض أميني واحد قد يكون آمناً فقط إذا حدث تغيير آخر محدد في مكان قريب. هذا الاعتماد المتبادل المعقد، المعروف باسم "الارتباط الجيني" (epistasis)، يصعب التقاطه باستخدام الأدوات الإحصائية التقليدية. مؤخراً، قدم جيل جديد من أدوات الذكاء الاصطناعي، وتحديداً نوع من نماذج التعلم العميق يُسمى "المشفّر التلقائي التبايني" (variational autoencoder)، مساراً مختلفاً. هذه النماذج بارعة في إيجاد الأنماط الخفية في كميات هائلة من البيانات؛ حيث يمكنها ضغط تسلسل بروتيني طويل إلى ملخص رياضي مقتضب، أو "تضمين" (embedding)، ثم تحاول إعادة بناء التسلسل الأصلي من ذلك الملخص. ولأن هذه النماذج تتعلم مباشرة من البيانات دون أن تُؤمر بتجاهل الروابط بين الحروف، أمل العديد من العلماء أن تتمكن من حل مشكلة الارتباط الجيني وإعادة بناء البروتينات القديمة بدقة غير مسبوقة.
وضع فريق من الباحثين هذا الأمل تحت الاختبار المباشر. لقد بنوا مساراً برمجياً يستخدم نماذج الذكاء الاصطناعي هذه لتخمين تسلسلات البروتينات القديمة. كانت الفكرة بسيطة: خذ البروتينات الحديثة التي نمتلكها اليوم، واضغطها في هذه الملخصات الرياضية، ثم استخدم شجرة العائلة المعروفة لهذه البروتينات لعمل استكمال (interpolation)، أو تخمين، لما كانت تبدو عليه ملخصات الأسلاف القدامى. وبمجرد حصولهم على هذه الملخصات المخمنة، سيقومون بتغذيتها مرة أخرى في الذكاء الاصطناعي لتوليد تسلسلات الأحماض الأمينية الفعلية. إذا نجح هذا، فسيعني ذلك أن التعلم العميق يمكنه تجاوز قيود الإحصاء التقليدي وكشف التاريخ الحقيقي للبروتينات، حتى عندما تكون تلك التواريخ مشكلة بالتفاعلات المعقدة بين أجزاء مختلفة من الجزيء.
وضع الباحثون هذه الفكرة قيد الاختبار باستخدام عمليات محاكاة حاسوبية. لقد أنشأوا آلاف عائلات البروتينات الوهمية التي تطورت بمرور الوقت، أولاً باستخدام القواعد البسيطة والمستقلة التي تفترضها النماذج التقليدية، ثم باستخدام قواعد معقدة تتضمن التغييرات المترابطة الموجودة في الطبيعة. ثم حاولوا إعادة بناء أسلاف هذه العائلات الوهمية باستخدام كل من طريقة الذكاء الاصطناعي الجديدة والطرق الإحصائية الراسخة. كانت النتائج واضحة ومتسقة؛ ففي كل سيناريو، سواء تطورت البروتينات ببساطة أو مع تبعات معقدة، تفوقت الطرق الإحصائية التقليدية على نهج الذكاء الاصطناعي. فشل نموذج التعلم العميق في إنتاج تسلسلات سلفية دقيقة، حتى في الحالات التي كان من المفترض أن يتألق فيها.
تعمق البحث لفهم سبب فشل الذكاء الاصطناعي. وتبين أن المشكلة لم تكن في أن الذكاء الاصطناعي قد أغفل هيكل شجرة العائلة؛ فعندما فحص الباحثون الملخصات الرياضية، وجدوا أن الذكاء الاصطناعي قد تعلم بالفعل تنظيم البروتينات بطريقة تعكس علاقاتها التطورية. كان الفشل يكمن في خطوة إعادة البناء نفسها. ففي محاولة النموذج لضغط البيانات في ملخص صغير، فقدَ حتماً بعض التفاصيل الدقيقة للتسلسل الأصلي. وعندما حاول الباحثون إعادة بناء البروتينات القديمة من تلك الملخصات، كانت المعلومات ضبابية للغاية؛ إذ لم يستطع النموذج توليد تسلسل بدقة كافية لمطابقة التاريخ الحقيقي. وحتى عندما زاد الباحثون حجم الملخص الرياضي لمحاولة الاحتفاظ بمزيد من المعلومات، كانت المكاسب ضئيلة، وبدأ النموذج ببساطة في حفظ البروتينات الحديثة بدلاً من تعلم القواعد العامة للتطور.
اختبر الباحثون أيضاً نسخة أكثر تقدماً من الذكاء الاصطناعي تم تعليمها شجرة العائلة صراحةً أثناء تدريبها. وكانوا يأملون أن يساعد هذا التوجيه الإضافي، لكنه لم يحسن النتائج. ظل الاختناق الأساسي كما هو: عملية ضغط التسلسل في ملخص ثم توسيعه مرة أخرى كانت عملية تفقد الكثير من المعلومات (lossy) بالنسبة لمهمة دقيقة مثل تخمين الماضي. خلصت الدراسة إلى أنه بينما تعد "تضمينات" الذكاء الاصطناعي هذه أدوات قوية لتصور عائلات البروتين والتنبؤ بكيفية سلوك البروتينات الحديثة، إلا أنها ليست جاهزة بعد لاستبدال الطرق الإحصائية الراسخة في إعادة بناء الماضي. إن الأمل في أن يتمكن التعلم العميق بسهولة من حل التفاعلات التطورية المعقدة كان، في هذا التطبيق المحدد، طريقاً مسدوداً. فالطرق التقليدية، رغم افتراضاتها الأكثر بساطة، تظل الطريقة الأكثر موثوقية لقراءة التاريخ الجزيئي للحياة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.