Hybrid quantum-classical attention for histopathology-based molecular profiling in data-limited cancers
تقدم هذه الورقة استراتيجية هجينة كمومية-كلاسيكية تستبدل آلية الانتباه "softmax" القياسية بمصفوفة ثنائية العشوائية مشتقة كمومياً في نماذج المحولات الخاصة بعلم أمراض الأنسجة، مما يظهر تحسينات انتقائية في التنبؤ بالتعبير الجيني لأنواع السرطان ذات البيانات المحدودة والأهداف ذات الصلة بيولوجياً، مع التحقق من الآلية الكامنة على معالجات IBM الكمومية.
في المعركة ضد السرطان، يعتمد الأطباء غالباً على نوعين متميزين من المعلومات لفهم الورم. يأتي النوع الأول من فحص الأنسجة تحت المجهر، وهي عملية روتينية حيث يفحص عالم الأمراض شريحة رقيقة من خزعة لرؤية كيفية ترتيب الخلااء وما تبدو عليه. أما النوع الآخر فيأتي من قراءة التعليمات الكيميائية داخل تلك الخلايا، والمعروفة بالتنميط الجيني أو الجزيئي، والتي تكشف عن الجينات النشطة وكيف يمكن للسرطان أن يتصرف. وبينما تُعد الرؤية المجهرية معياراً عالمياً في المستشات حول العالم، فإن القراءة الجينية تتطلب معدات باهظة الثمن وكمية كبيرة من الأنسجة، مما يجعل من الصعب إجراءها للعينات الصغيرة، أو أنواع السرطان النادرة، أو للمرضى في الأماكن التي تفتقر إلى المختبرات المتقدمة. وتترك هذه الفجوة العديد من المرضى دون صورة كاملة لمرضهم. وقد حاول العلماء سد هذا الانقسام عبر تعليم الحواسيب النظر إلى صور المجهر الروتينية والتنبؤ بالنشاط الجيني الخفي بداخلها، آملين في استخراج الرؤى الجزيئية من الأنماط البصرية للأنسجة وحدها.
لقد اتخذ فريق من الباحثين في "آي بي إم ريسيرش" (IBM Research) نهجاً جديداً لمواجهة هذا التحدي من خلال إدخال أداة من المجال الناشئ للحوسبة الكمومية في البرمجيات التي تحلل هذه الصور الطبية. فقد طوروا نظاماً هجيناً يجمع بين المعالجة الحاسوبية القياسية ونوع محدد من الحسابات الكمومية المصممة لمساعدة البرنامج على الانتباه إلى الأجزاء الصحيحة من الصورة. وفي دراستهم، اختبروا هذا النظام على صور رقمية لعينات من الأنسجة من 29 نوعاً مختلفاً من السرطان، تتراوح من الأنواع الشائعة مثل سرطان الثدي والرئة إلى الأنواع النادرة والصعبة الدراسة. وكان الهدف هو معرفة ما إذا كان هذا النهج المستوحى من الكم يمكن أن يساعد الحاسوب في تقديم تخمينات أكثر دقة حول التركيبة الجينية للورم عندما تكون البيانات الجينية الفعلية مفقودة أو عندما تتوفر عينات قليلة جداً من المرضى للتعلم منها.
وجد الباحثون أن النظام الهجين لم يكتفِ بمجرد جعل الحاسوب أفضل في تخمين كل جين على حدة، بل عمل أشبه بمرشح انتقائي، حيث حسن الدقة لبعض الجينات المحددة بينما جعل التنبؤات لغيرها أسوأ قليلاً. ولم يكن هذا التبادل عشوائياً؛ فالجينات التي أصبحت أسهل في التنبؤ كانت تنتمي إلى مجموعات بيولوجية معروفة بأهميتها لهذا النوع المحدد من السرطان. فعلى سبيل المثال، في نوع نادر وعدواني من سرطان الغدة الكظرية يسمى سرطان القشرة الكظرية، حسن النظام الهجين بشكل كبير التنبؤ بالجينات المشاركة في انقسام الخلايا وإصلاح الحمض النووي (DNA). والأهم من ذلك، أن الجينات التي شهدت أكبر تحسن كانت هي نفسها المرتبطة بآفاق طبية سيئة للمرضى. وهذا يشير إلى أن الطريقة الجديدة كانت تنجح في التقاط العلامات البصرية لأكثر الجوانب خطورة في المرض، حتى في ظل ندرة البيانات.
استكشفت الدراسة أيضاً ما إذا كان هذا الأسلوب يمكن أن يعمل عبر مجموعات مختلفة من المرضى. فعندما درب الباحثون النظام على مجموعة كبيرة من بيانات سرطان البنكرياس ثم اختبروه على مجموعة أخرى مستقلة تماماً، كانت النتائج مختلطة. فقد حسن النظام التنبؤات لمجموعة محددة من الجينات المتعلقة بالتمثيل الغذائي وسلالة الخلايا، لكنه واجه صعوبة مع العديد من الجينات الأخرى. ويشير هذا إلى أن التكنولوجيا ليست حلاً عالمياً يعمل بشكل مثالي لكل جين في كل موقف، بل تبدو كأداة متخصصة يمكن ضبطها للتركيز على مسارات بيولوجية معينة. كما اختبر الباحثون الجزء الكمومي من نظامهم على معالجات كمومية فعلية، وهي الأجهزة المتخصصة المصممة لهذه الحسابات. وقد أكدوا أن العملية الرياضية الأساسية المستخدمة في نظامهم يمكن تنفيذها بنجاح على هذه الآلات، على الرغم من أن تحليل الصورة الكاملة لا يزال يتم على حواسيب قياسية.
كانت إحدى أهم النتائج هي أن النظام الهجين بدا يعمل بشكل أفضل عندما كانت البيانات قليلة جداً في البداية. ففي المجموعات الأصغر من المرضى، حيث تعاني النماذج الحاسوبية التقليدية غالباً في التعلم، قدمت آلية "الانتباه" المستوحاة من الكم أكبر المكاسب الملحوظة. وهذا يعد إشارة واعدة لأنواع السرطان النادرة، حيث يكون جمع أعداد كبيرة من العينات أمراً مستحيلاً تقرياً. كما اكتشف الباحثون أنهم ليسوا بحاجة لاستخدام الحساب الكمومي لعملية التدريب بأكملها للحصول على فوائد؛ إذ كان استخدامها فقط في الخطوات الأولى من عملية التعلم كافياً لتوجيه النظام نحو أداء أفضل، مما قد يجعل هذه التكنولوجيا أكثر عملية للاستخدام في المستقبل.
في نهاية المطاف، يشير هذا العمل إلى طريقة جديدة للتفكير في استخدام الحوسبة المتقدمة في الطب. فبدلاً من محاولة استبدال الأساليب القياسية بالكامل، يوفر النهج الهجين وسيلة لتعزيز أجزاء محددة من التحليل. وهو يوضح أنه من خلال تغيير كيفية تحديد الحاسوب للأجزاء التي يجب التركيز عليها في الصورة، باستخدام هيكل مشتق من الفيزياء الكمومية، فإنه من الممكن الكشف عن الإشارات الجزيئية الخفية في شرائح الأنسجة الروتينية. ورغم أن هذه التكنولوجيا لا تزال في مراحلها الأولى وتتطلب المزيد من الاختبارات لاستخدامها في المستشفيات، إلا أنها تقدم مساراً محتملاً لمنح المرضى المصابين بأنواع نادرة أو محدودة البيانات فهماً أكثر اكتمالاً لمرضهم، باستخدام الصور المتاحة بالفعل في سجلاتهم الطبية.
ملخص تقني: الانتباه الهجين الكمي-الكلاسيكي للتنميط الجزيئي القائم على علم أمراض الأنسجة
بيان المشكلة
يعد التنميط الجزيئي أمرًا بالغ الأهمية لتشخيص السرطان، والتنبؤ بسير المرض، واختيار العلاج، ومع ذلك فإن الوصول إلى فحوصات النسخ الجيني (مثل تسلسل الحمض النووي الريبوزي RNA-seq) غير متكافئ بسبب التكلفة، ومحدودية الأنسجة، وصعوبة الحصول على عينات من الخزعات الصغيرة، أو السرطانات النادرة، أو المجموعات الاسترجاعية. وبينما تتوفر صور كاملة الشريحة (WSIs) لصبغة الهيماتوكسيلين والإيوسين (H&E) الروتينية على نطاق واسع، فإن التنبؤ بالتعبير الجيني من هذه الصور يظل تحديًا. تعاني نماذج التعلم العميق الحالية، وخاصة تلك القائمة على بنى المحولات (Transformers) مثل SEQUOIA، من ضعف القدرة على التعميم، وتحديد الأهداف، والأداء في البيئات محدودة البيانات. قد تؤدي آليات الانتباه القياسية (softmax) إلى تفاعلات غير متوازنة بين الرموز (tokens) أو "انهيار الرموز" (token collapse)، مما قد يحد من قدرة النموذج على استخراج الإشارات الجزيئية من بيانات علم أمراض الأنسجة المعقدة، خاصة عندما تكون مجموعات التدريب صغيرة.
المنهجية
يقترح المؤلفون استراتيجية انتباه هجينة كمية-كلاسيكية مدمجة في إطار عمل SEQUOIA، وهو نموذج قائم على المحولات للتنبؤ بالتعبير الجيني من صور علم أمراض الأنسجة.
البنية الأساسية: QDSFormer في SEQUOIA
التكامل: تستبدل الدراسة تطبيع الـ softmax الصفّي القياسي في وحدة انتباه SEQUOIA بـ مصفوفة ثنائية التوزيع (Doubly Stochastic Matrix) مشتقة كميًا (QDSM).
الآلية:
الانتباه القياسي: يحسب درجات التشابه (S=QKT/d) ويطبق softmax صفّي، مما ينتج عنه مصفوفة أحادية التوزيع جهة اليمين (مجموع الصفوف يساوي 1، بينما الأعمدة لا تساوي 1).
انتباه QDSM: يستبدل softmax بمصفوفة ثنائية التوزيع مشتقة كميًا حيث مجموع الصفوف والأعمدة يساوي 1. يتم توليد هذه المصفوفة باستخدام إجراء النقل الأمثل الشرطي الكمي (QDSFormer).
القيد: يفرض قيد التوزيع الثنائي هيكل تخصيص أكثر توازنًا، مما يؤدي نظريًا إلى استقرار الانتباه وتقليل انهيار الرموز.
تفاصيل التنفيذ:
التدريب: تم تقييم انتباه QDSM عبر محاكاة كلاسيكية للدائرة الكمية المقابلة أثناء تدريب النموذج. ظلت بقية الخطوات (استخراج الميزات ResNet-50، انحدار MLP، والتحسين) كلاسيكية.
حجم المصفوفة: لضمان القدرة الحسابية في 29 نوعًا من السرطانات من مجموعات TCGA، تم تقييد مصفوفة الانتباه لتكون 8 × 8 (تم توليدها بواسطة دائرة مكونة من 14 كيوبت).
استراتيجيات التدريب: تمت مقارنة استراتيجيتين:
Full-QDSM: تطبيق انتباه QDSM لجميع دورات التدريب البالغ عددها 200 دورة.
البداية الدافئة (Warm-Start): تطبيق انتباه QDSM فقط في الدورات الأولية (مثل أول 5 دورات) قبل العودة إلى softmax القياسي.
التصميم التجريبي
مجموعات البيانات:
الأساسية: 29 نوعًا من السرطان من مشروع The Cancer Genome Atlas (TCGA) مع بيانات WSIs وRNA-seq متطابقة (عدد العينات ≥ 50 لكل نوع).
التحقق الخارجي: مجموعة مستقلة لسرطان البنكرياس من مشروع Clinical Proteotic Tumor Analysis Consortium (CPTAC).
التحقق من الأجهزة: تجارب منفصلة على معالجات IBM الكمية (Eagle R3 وHeron R1) لاستعادة المصفوفات ثنائية التوزيع بأحجام 8×8 و64×64 و128×128.
مقاييس التقييم:
قياس أداء التنبؤ على مستوى الجين عبر معامل ارتباط بيرسون بين التعبير المتوقع والمقاس.
تحديد الأهمية الإحصائية عبر اختبارات t ثنائية الجانب عبر 10 تقسيمات تدريب-اختبار.
نمذجة فائدة مستوى الجين: نموذج انحدار التأثيرات المختلطة (باستخدام التحقق المتبادل "ترك نوع سرطان واحد خارج المجموعة") للتنبؤ بالتحسن (Δr) بناءً على سمات الجين الأساسية (الوفرة، التباين، درجة التعبير المشترك).
تحليل البقاء: نماذج مخاطر كوكس (Cox proportional hazards) المطبقة على الجينات التي حسنتها طريقة QDSM في سرطان الغدة الكظرية (ACC).
النتائج الرئيسية
1. مكاسب انتقائية في السرطانات محدودة البيانات
لم تعمل آلية الانتباه الهجينة على تحسين التنبؤ بشكل موحد عبر جميع الجينومات؛ بدلاً من ذلك، قامت بإعادة توزيع الأداء التنبؤي:
التحسن الصافي: في 16 من أصل 29 نوعًا من السرطان، أظهرت جينات أكثر تحسنًا ملحوظًا مقارنة بالجينات التي ساء أداؤها.
ميزة البيانات المحدودة: لوحظت أكبر التحسينات النسبية في المجموعات الأصغر والمحدودة البيانات. وُجد ارتباط سلبي بين حجم المجموعة ونسبة الجينات المتحسنة إلى الجينات التي ساء أداؤها (r=−0.35 للجينات؛ r=−0.42 لمجموعات الجينات المثرية).
أفضل المؤدين: أظهر كل من سرطان الغدة الكظرية (ACC)، والورم الميلانيني العيني (UVM)، وورم كهفي (PCPG)، وسرطان البنكرياس الغدي (PAAD) أقوى الفوائد الصافية.
2. الصلة البيولوجية في سرطان الغدة الكظرية (ACC)
كان ACC بمثابة دراسة حالة مفصلة لسرطان نادر ومتعدد الأشكال جزيئيًا:
التحسن على مستوى الجين: أظهر 1,020 جينًا تحسنًا ملحوظًا في التنبؤ تحت نظام QDSM، مقارنة بـ 130 جينًا فقط ساء أداؤها.
إثراء المسارات: كانت الجينات المحسنة غنية بالعمليات البيولوجية المتماسكة ذات الصلة بـ ACC، بما في ذلك إصلاح/تلف الحمض النووي، والتنظيم النسخي/فوق الجيني، واليوبيكويتين (ubiquitination) للبروتين.
القيمة الإنذارية: ارتبطت الجينات التي حسنتها QDSM بشكل تفضيلي بـ سوء البقاء الإجمالي (نسبة المخاطر HR > 1). شملت أبرز هذه الجينات LYG1 وKIF18A وHDAC4، مما يربط التحسن التقني للنموذج بالمعلومات السريرية ذات الأهمية الإنذارية.
3. قابلية النقل عبر المجموعات (سرطان البنكرياس)
في تجربة النقل من TCGA-PAAD إلى CPTAC:
النقل الانتقائي: حسنت QDSM التنبؤ لـ حوالي 2,000 جين ولكنها أساءت التنبؤ لـ حوالي 6,200 جين.
تحديد الأهداف: شملت الجينات المحسنة أهدافًا ذات صلة بيولوجية مثل كوابح الأورام (ARID1A، STK11)، ومنظمات الأيض (G6PD، ALDOB)، وعوامل النسخ المرتبطة بالسلالات (GATA6، FOXA2).
القصور: لم يقدم النموذج تحسنًا موحدًا تحت تأثير تغير النطاق (domain shift)، مما يعزز أن الفائدة هي هدف محدد وليست تعزيزًا عامًا للجينوم بأكل.
4. إمكانية التنبؤ بالفوائد
نمذجة مستوى الجين: شرح نموذج التأثيرات المختلطة باستخدام سمات الجين الأساسية (القدرة التنبؤية، الوفرة، التباين، التعبير المشترك) جزءًا معنويًا من التباين في فائدة QDSM (ارتباط LOCO ≈0.52).
تحليل البواقي: كانت الجينات التي تحسنت أكثر مما هو متوقع غنية بمسارات التطور والتشكل. أما الجينات التي تحسنت أقل مما هو متوقع، فكانت غنية باستقلاب الريبوسومات، وتضاعف الحمض النووي، والتنظيم المناعي التكيفي. يشير هذا إلى أن الفائدة قابلة للتنبؤ جزئيًا ولكنها تعتمد أيضًا على السياق.
5. جدوى الأجهزة
نجحت التجارب المنفصلة على معالجات IBM الكمية في استعادة المصفوفات ثنائية التوزيع (8×8، 64×64، 128×128) مع ارتباطات سبيرمان ≥0.7 مقابل الحلول الكلاسيكية الدقيقة ضمن 100,000 محاولة (shots).
يؤكد هذا أن الأداة الكمية الكامنة وراء آلية الانتباه قابلة للتنفيذ على الأجهزة الحالية، حتى لو لم يكن التدريب النهائي (end-to-end) على وحدات المعالجة الكمية (QPUs) ممكنًا بعد.
الأهمية والادعاءات
يضع البحث "الانتباه الهجين الكمي-الكلاسيكي" ليس كبديل عالمي لآلية softmax القياسية، بل كـ استراتيجية نمذجة مستهدفة ومعتمدة على السياق لعلم الأمراض الرقمي.
الفرز الجزيئي: تبرز قيمة هذا النهج في حالات "الفرز الجزيئي" حيث يكون التسلسل المباشر غير متاح، أو غير مكتمل، أو غير عملي (مثل السرطانات النادرة أو الخزعات الصغيرة). فهو يوفر وسيلة لاستعادة برامج جينية محددة وذات صلة بيولوجية من صور الأنسجة الروتينية.
كفاءة البيانات: تشير النتائج إلى أن قيد التوزيع الثنائي يعمل كتحيز استقرائي (inductive bias) مفيد في البيئات محدودة البيانات، مما ينظم تفاعلات الرموز لتحسين استنتاج أهداف جزيئية محددة مشفرة مورفولوجيًا.
الربط السريري: توضح الدراسة كيف يمكن ربط التحسينات التقنية في دقة التنبؤ مباشرة بالنتائج السريرية ذات الصلة (مثل البقاء في حالة ACC)، مما يؤكد فائدة الطريقة لتطبيقات طب الدقة حيث تكون البيانات شحيحة.
سير العمل الهجين المجزأ: يدعم هذا العمل بنية مجزأة حيث تتعامل الأنظمة الكلاسيكية مع استخراج الميزات والانحدار، بينما توفر العمليات الفرعية الكمية (أو محاكاتها الكلاسيكية) تطبيع انتباه مهيكل.
يخلص المؤلفون إلى أنه على الرغم من أن الطريقة لا تعزز دقة الجينوم بأكمله بشكل موحد، إلا أن قدرتها على تحسين التنبؤ بالجينات ذات الأهمية الإنذارية في السرطانات محدودة البيانات تجعلها استراتيجية واعدة للتنميط الجزيئي القائم على الصور.