HiDAC: A Hierarchical Dictionary-Aided Compression Framework for Genomic Sequences
تقترح الورقة البحثية HiDAC، وهو إطار عمل للضغط المعتمد على القواميس الهرمية يحقق نسب ضغط للحمض النووي (DNA) تنافسية مع تمكين إجراء تحليلات لاحقة أسرع بكثير، مثل استعلامات تكرار السلاسل الفرعية، مباشرة على التمثيل الرمزي المضغوط دون الحاجة إلى فك الضغط الكامل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل
تُكتب قصة الحياة في شفرة تتكون من أربعة أحرف فقط: A وC وG وT. هذه الأحرف، التي تمثل قواعد كيميائية، ترتبط معاً في سلاسل طويلة لتشكل الحمض النووي (DNA) الذي يوجه كل خلية في الكائن الحي. لعقود من الزمن، تمكن العلماء من قراءة هذه السلاسل، لكن الحجم الهائل للبيانات الناتجة عن أجهزة التسلسل الحديثة خلق مشكلة لوجستية ضخمة. فالملفات التي تحتوي على هذه التعليمات الجينية ضخمة للغاية، مما يجعل من الصعب تخزينها، أو إرسالها عبر الشبكات ببطء، أو تحليلها بصعوبة. وبينما توجد أدوات حاسوبية قياسية لتقليص ملفات النصوص، إلا أنها ليست مصممة للأنماط الفريدة الموجودة في الحمض النووي، وغالباً ما تفشل في التقاط الهياكل العميقة والمتكررة التي تحدد الجينوم. وقد حاول الباحثون استخدام طرق متخصصة مختلفة لضغط هذه البيانات، لكن العديد من هذه النهج بُنيت خصيصاً للتخزين فقط؛ فلطرح سؤال حول البيانات، مثل البحث عن علامة جينية محددة، يجب أولاً فك ضغط الملف بالكامل، وهي عملية تهدر الوقت وقوة الحوسبة.
لقد طور فريق من الباحثين إطار عمل جديداً يسمى HiDAC يهدف إلى حل مشكلتي التخزين والتحليل في آن واحد. فبدلاً من مجرد تقليص حجم الملف، تقوم هذه الطريقة بإعادة كتابة الشفرة الجينية إلى لغة أكثر كفاءة قبل حفظها. تبدأ العملية بمسح تسلسل الحمض النووي للعثور على الأنماط التي تتكرر كثيراً، مثل تسلسلات قصيرة من الأحرف التي تظهر مراراً وتكراراً. ثم يقوم النظام باستبدال هذه الأنماط المتكررة برموز فريدة واحدة، مما ينشئ قاموساً يربط هذه الرموز الجديدة بالحروف الأصلية. وهذا ليس مجرد استبدال لمرة واحدة؛ بل يبني النظام تسلسلاً هرمياً، حيث يمكن للرمز الجديد نفسه أن يصبح جزءاً من نمط أكبر، مما يسمح للطريقة بالتقاط التكرارات المعقدة والمتداخلة التي تغفل عنها الأدوات الأبسط. وبمجرد إعادة كتابة التسلسل باستخدام هذه الرموز، يطبق النظام تقنية ترميز متطورة تضغط الرموز في أصغر مساحة ممكنة، تماماً مثل حزم حقيبة سفر عبر طي الملابس بإحكام وملء كل الفراغات.
ما يميز هذا النهج هو أن النسخة المعاد كتابتها والمضغوطة تظل مفيدة للتحليل دون الحاجة إلى فك حزمتها بالكامل. ولأن الرموز الجديدة تمثل أجزاءً من التسلسل الأصلي، يمكن للحاسوب البحث عن نمط معين من خلال البحث في الرموز أولاً. وإذا كان الرمز لا يمكن أن يحتوي بالضرورة على النمط الذي يتم البحث عنه، يتخطاه النظام تماماً، مما يوفر قدراً هائلاً من الوقت. اختبر الباحثون هذه الطريقة على جينومات من البشر والبكتيريا وكائنات أخرى، مقارنين إياها بكل من أدوات الضغط العامة والبرمجيات الجينومية المتخصصة. وأظهرت النتائج أن HiDAC قلل أحجام الملفات بشكل أكثر فعالية من الطرق الأخرى، محققاً انخفاضاً بنسبة 76 بالمائة تقريباً في بعض الحالات. والأهم من ذلك، عندما استخدم الفريق البيانات المضغوطة للبحث عن تسلسلات جينية محددة، كانت العملية أسرع بثلاث مرات تقريباً من البحث في البيانات الأصلية غير المضغوطة.
كما كشفت الدراسة أن الأنماط التي تعلمها النظام لم تكن عشوائية. فالرموز الأكثر شيوعاً التي أنشأها الحاسوب كانت تتوافق مع تركيبات حرفية قصيرة ومتكررة تُعرف بأنها وحدات بناء أساسية للحمض النووي عبر مختلف الأنواع. وهذا يشير إلى أن الطريقة تلتقط هياكل بيولوجية حقيقية بدلاً من مجرد سمات بيانات عشوائية. ومن خلال إثبات إمكانية ضغط البيانات بكفاءة مع بقائها قابلة للبحث في شكلها المضغوط، يفتح هذا العمل آفاقاً جديدة للتعامل مع التدفق المتزايد للمعلومات الجينية. فهو يسمح للعلماء بتخزين كميات هائلة من البيانات في مساحة أصغر مع الاحتفاظ بالقدرة على إجراء استعلامات معقدة مباشرة على تلك البيانات المخزنة، مما قد يسرع الاكتشافات في علم الوراثة والطب دون الحاجة إلى موارد حوسبة ضخمة ومستهلكة للطاقة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.