💻 bioinformatics

Guided tokenization and domain knowledge enhance genomic language models' performance

تقدم هذه الورقة "الترميز الموجه" (Guided Tokenization)، وهي استراتيجية تعطي الأولوية للتسلسلات الفرعية ذات الأهمية البيولوجية والإحصائية لتعزيز أداء النماذج اللغوية الجينومية المدمجة ووعيها البيولوجي عبر مختلف مهام التصنيف والتوصيف.

Mahangade, V., Mollerus, M., Crandall, K. A., Rahnavard, A.2026-02-18
💻 bioinformatics

Supporting Metadata Curation from Public Life Science Databases Using Open-Weight Large Language Models

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة ذات الأوزان المفتوحة، عند دمجها في سير عمل الاسترجاع والترشيح الدلالي، يمكنها تحقيق دقة تقارب الكمال في أتمتة تنسيق البيانات الوصفية غير المهيكلة من قواعد بيانات علوم الحياة العامة، مما يتغلب على قيود عمليات البحث التقليدية بالكلمات المفتاحية ويمكّن من إعادة استخدام البيانات بشكل قابل للتوسع والتكرار.

Shintani, M., Andrade, D., Bono, H.2026-02-18
💻 bioinformatics

Wayfarer: A multiscale framework for spatial analysis of tumor progression

تقدم الورقة البحثية Wayfarer، وهو إطار عمل متعدد المقاييس بلغة R للبيانات المكانية الأومية (spatial -omics)، يقوم بتحويل خيارات التجميع المكاني التعسفية إلى إشارات تشخيصية من خلال تتبع كيفية تطور مقاييس الارتباط المكاني عبر مستويات متداخلة، مما يكشف عن تحولات قابلة للتكرر ومعتمدة على المقياس في تطور الورم، والتي يتم إغفالها في التحليلات أحادية الدقة.

Moses, L., Herault, A., Cabon, L., Dumitrascu, B.2026-02-18
💻 bioinformatics

SCiMS: Sex Calling in Metagenomic Sequences

تُعدُّ SCiMS أداةً معلوماتية حيوية مبتكرة وقابلة للتوسع تتنبأ بدقة بجنس المضيف من بيانات التسلسل الميتاجينومي —حتى في العينات ذات الكتلة الحيوية المنخفضة وعبر أنواع متنوعة— وذلك عبر الاستفادة من نسب كثافة قراءات الكروموسومات الجنسية ضمن مصنف بايزي (Bayesian classifier) لاستعادة البيانات الوصفية المفقودة وضمان نزاهة البحث.

Tran, H. N., Kirven, K. J., Davenport, E. R.2026-02-18
💻 bioinformatics

Fast structural search for classification of gut bacterial mucin O-glycan degrading enzymes

تقدم الورقة البحثية DEFT، وهي طريقة تعلم آلي هجينة تجمع بين نماذج لغة البروتين للتصنيف الواسع للإنزيمات والمحاذاة القائمة على البنية للتصنيف الفرعي دقيق التفاصيل، محققةً دقة وكفاءة حوسبية فائقتين في التنبؤ بأرقام تصنيف الإنزيمات (EC numbers) لإنزيمات تحلل الميوكين في بكتيريا الأمعاء.

Erden, M., Schult, T., Yanagi, K., Sahoo, J. K., Kaplan, D. L., Cowen, L. J., Lee, K.2026-02-18
💻 bioinformatics

Reliable Evaluation and Learning in Multi-input Biological Association Prediction

تتناول هذه الورقة المبالغة في تقدير الأداء في التنبؤ بالارتباطات البيولوجية متعددة المدخلات والناجمة عن اختصارات نسبة الدرجة، وذلك من خلال تقديم إطار تقييم متوازن الكيانات واستراتيجية تدريب UnbiasNet لضمان تقييمات عادلة وقوية وذات مغزى لتعلم العلاقات الحقيقي.

Ahmadian Moghadam, S., Montazeri, H.2026-02-18
💻 bioinformatics

Resolving Genome-to-Phenotype Links in Bacteria: Machine-Learned Inference from Downsampled k-mer Representations

تُثبت هذه الورقة أن خوارزمية جديدة لتقليل العينات تعتمد على البادئات، والتي تعمل على اختزال الجينومات البكتيرية إلى تمثيلات k-mer، تتيح تنبؤاً دقيقاً وقابلاً للتفسير بالأنماط الظاهرية باستخدام نماذج تجميعية فعالة، مما يوفر بديلاً خفيف الوزن لتحليل الجينوم الكامل وبنى التعلم العميق.

Regueira, T. G. B., Barra, C., Lund, O.2026-02-18
💻 bioinformatics

Drug-Target Interaction Prediction with PIGLET

يُعد PIGLET طريقة جديدة للمحولات الرسومية (graph transformer) تستفيد من رسم بياني معرفي على مستوى البروتينوم للتنبؤ بالتفاعلات بين العقار والهدف، حيث أظهر أداءً فائقاً على النماذج الحالية في تقسيمات العقاقير الصارمة وأثبت فائدته في اكتشاف الأدوية في العالم الحقيقي.

Carpenter, K. A., Altman, R. B.2026-02-18
💻 bioinformatics

Information-Content-Informed Kendall-tau Correlation Methodology: Interpreting Missing Values in Metabolomics as Potentially Useful Information

تقدم هذه الورقة منهجية "كيندال-تاو المستندة إلى محتوى المعلومات" (ICI-Kt)، والتي تعيد تفسير القيم المفقودة ذات التمركز اليساري في علم الأيض باعتبارها معلومات مفيدة لتحسين كشف القيم المتطرفة وبناء شبكة الميزات-الميزات، مدعومة بتنفيذ متوازٍ بلغتي R وPython.

Flight, R. M., Bhatt, P. S., Moseley, H. N. B.2026-02-17
💻 bioinformatics

ProteomeLM: A proteome-scale language model enables accurate and rapid prediction of protein-protein interactions and gene essentiality across taxa

يُعد ProteomeLM نموذج لغة جديداً قائماً على تقنية المحولات (transformer) يعمل على بروتيومات كاملة لتوليد تمثيلات بروتينية سياقية، مما يتيح تنبؤاً دقيقاً وسريعاً وغير مُشرف عليه للتفاعلات بين البروتينات، بالإضافة إلى تنبؤ مُشرفٍ متطورٍ لضرورة الجينات عبر أصناف حيوية متنوعة.

Malbranke, C., Zalaffi, G. P., Bitbol, A.-F.2026-02-17