← أحدث الأبحاث
💻 computer science

Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers

يُعد SPECTRE نموذجاً تأسيسياً قابلاً للتوسع وقائماً بالكامل على تقنية المحولات (Transformer) للتصوير المقطعي المحوسب الحجمي، حيث يستفيد من التدريب المسبق ذاتي الإشراف والتدريب المسبق القائم على الرؤية واللغة على مجموعات بيانات مفتوحة للتغلب على تحديات التصوير ثلاثي الأبعاد وتحقيق أداء رائد في كل من مهام التصوير الطبي بنمط التعلم الصفري والمهام التي تم ضبطها بدقة.

المؤلفون الأصليون: Cris Claessens, Christiaan Viviers, Giacomo D'Amicantonio, Egor Bondarev, Fons van der Sommen

نُشر 2026-03-31
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Cris Claessens, Christiaan Viviers, Giacomo D'Amicantonio, Egor Bondarev, Fons van der Sommen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم كمبيوتر كيف "يرى" و"يفهم" المسوحات الطبية ثلاثية الأبعاد (مثل الأشعة المقطعية للصدر أو البطن). هذا تحدٍ هائل لأن الأشعة المقطعية ليست مجرد صورة مسطحة؛ بل هي مجموعة ضخمة من آلاف الشرائح التي تشكل حجماً ثلاثي الأبعاد.

تقدم هذه الورقة البحثية نموذج SPECTRE، وهو نموذج ذكاء اصطناعي جديد صُمم خصيصاً لإتقان هذا العالم ثلاثي الأبعاد. إليك كيف يعمل، مشروحاً عبر تشبيهات بسيطة.

1. المشكلة: لغز "أكبر من أن يتسع"

نماذج الذكاء الاصطناعي القياسية (مثل تلك التي تتعرف على القطط في الصور) بارعة في الصور ثنائية الأبعاد. ولكن إذا حاولت تغذية هذه النماذج بمسح مقطعي ثلاثي الأبعاد، فالأمر يشبه محاولة حشر مكتبة كاملة من الكتب في صندوق بريد واحد؛ فالبيانات ضخمة جداً، وسينفد ذاكرة الكمبيوتر.

أيضاً، الأشعة المقطعية "غريبة" مقارنة بالصور العادية:

  • هي غير متساوية الأبعاد: المسافة بين الشرائح غالباً ما تختلف عن المسافة بين البكسلات داخل الشريحة الواحدة (مثل طوبة طويلة ولكنها نحيفة).
  • التصنيفات غير منظمة: يكتب الأطباء التقارير كنصوص حرة، وليس كعلامات اختيار مرتبة. أحياناً يذكر التقرير خمسة أمراض مختلفة معاً، مما يجعل من الصعب على الذكاء الاصطناعي معرفة ما هو "إيجابي" وما هو "سلبي".

2. الحل: بنية "المنزل ذو الطابقين"

يحل SPECTRE مشكلة الحجم عن طريق بناء منزل ذي طابقين بدلاً من ناطحة سحاب.

  • الطابق الأرضي (الرؤية المحلية): تخيل أنك تنظر إلى مسح مقطعي من خلال نافذة صغيرة. ينظر النموذج إلى أجزاء صغيرة من المسح (مثل كتلة ثلاثية الأبعاد من الأنسجة) لفهم التفاصيل الدقيقة. يتعلم كيف يبدو الكيس، أو الورم، أو الرئة السليمة عن قرب. هذا هو "المحول المحلي" (Local Transformer).
  • الطابق الثاني (الرؤية العالمية): بمجرد أن يقوم الطابق الأرضي بتلخيص تفاصيل كل جزء، يرسل "تقرير أداء" إلى الطابق الثاني. ينظر الطابق الثاني إلى كل هذه التقارير معاً لفهم المريض بأكثر. إنه يربط النقاط ببعضها: "الرئة بها بقعة، والكبد به كيس، لذا قد يعاني هذا المريض من حالة معينة". هذا هو "المحول العالمي" (Global Transformer).

من خلال تقسيم العمل، يستطيع SPECTRE معالجة المسوحات ثلاثية الأبعاد الضخمة دون أن يتوقف الكمبيوتر عن العمل.

3. التدريب: التعلم بدون معلم، ثم التعلم من طبيب

يتعلم النموذج في مرحلتين متميزتين، مثل طالب في المدرسة.

المرحلة الأولى: "الدراسة الذاتية" (التعلم الخاضع للإشراف الذاتي)
تخيل طالباً لديه مكتبة من 200,000 مسح مقطعي ولكن بدون كتب مدرسية ولا معلم.

  • يلعب النموذج لعبة "الغميضة" (Hide and Seek). يقوم بتغطية أجزاء من المسح ويحاول تخمين ما يوجد تحتها بناءً على البكسلات المحيطة.
  • كما ينظر إلى نفس المسح من زوايا ومسافات مختلفة، ليتعلم أن الكلية تظل كلية سواء تم تكبيرها أو تصغيرها.
  • النتيجة: يصبح النموذج خبيراً في الشكل، والملمس، والهندسة للتشريح البشري دون أن يقرأ كلمة واحدة من النصوص الطبية.

المرحلة الثانية: "درس اللغة" (المواءمة بين الرؤية واللغة)
الآن، أصبح لدى النموذج معلم (تقارير الأشعة).

  • يُعرض على النموذج مسح مقطعي وتقرير الطبيب المكتوب جنباً إلى جنب.
  • يتعلم ربط "الكتلة المرئية" في المسح بكلمة "ورم" أو "التهاب" في النص.
  • التحول: لأن تقارير الأطباء فوضوية وغالباً ما تسرد أشياء متعددة، يستخدم النموذج تقنية خاصة (SigLIP) أكثر مرونة. فهو لا يتطلب تطابقاً تاماً بنسبة 1 إلى 1؛ بل يتعلم أن المسح قد يرتبط بعدة أوصاف مختلفة.
  • النتيجة: يفهم النموذج الآن ليس فقط كيف يبدو التشريح، بل ماذا يعني سريرياً.

4. النتيجة: "المترجم العالمي"

اختبرت الورقة البحثية SPECTRE مقابل 10 نماذج ذكاء اصطناعي رائدة أخرى. وإليك ما حدث:

  • اختبار "القدرة على التنفيذ المباشر" (Zero-Shot): أعطوا SPECTRE مهمة جديدة لم يسبق له رؤيتها (مثل التنبؤ بما إذا كان المريض سيعيش لمدة عامين) وطلبوا منه التخمين باستخدام معرفته المسبقة فقط. فاز SPECTRE في معظم الحالات. كان الأمر كأنه طالب لم يدرس لامتحان محدد، لكنه حصل على درجة امتياز لأنه فهم المبادئ الأساسية جيداً.
  • اختبار "الاسترجاع": طلبوا من النموذج: "جد لي جميع المسوحات التي تطابق هذه الجملة المحددة في تقرير ما". كان SPECTRE أفضل بكثير في إيجاد الصور الصحيحة من النماذج السابقة، مما يثبت أنه يفهم حقاً العلاقة بين اللغة والصور ثلاثية الأبعاد.
  • اختبار "التجزئة" (Segmentation): طلبوا منه رسم حدود حول الأعضاء (مثل الكبد أو الكليتين). على الرغم من أن SPECTRE لم يتم تدريبه خصيصاً على الرسم، إلا أن فهمه للهيكل ثلاثي الأبعاد كان جيداً لدرجة أنه رسم حدوداً أفضل من النماذج المصممة خصيصاً للرسم.

لماذا هذا مهم؟

قبل SPECTRE، كان بناء ذكاء اصطناعي طبي ثلاثي الأبعاد ذكي يتطلب:

  1. بيانات خاصة ومكلفة لا تملكها إلا المستشفيات الكبيرة.
  2. كميات هائلة من التوسيم اليدوي (الأطباء يرسمون على كل مسح).

يثبت SPECTRE أنه يمكنك بناء عقل طبي ثلاثي الأبعاد عالمي الغرض باستخدام البيانات المتاحة للجمهور فقط والأكواد مفتوحة المصدر. إنه يشبه أخذ نموذج لغوي عام ومفتوح المصدر وتعليمه كيف يتحدث "اللغة الطبية ثلاثية الأبعاد" بطلاقة، بحيث يمكن لأي مستشفى استخدامه للكشف عن الأمراض بشكل أسرع وأكثر دقة.

باختة القول: SPECTRE هو ذكاء اصطناعي ذكي ومفتوح المصدر، يتعلم كيف يرى داخل جسم الإنسان ثلاثي الأبعاد من خلال إتقان أشكال التشريح أولاً، ثم تعلم قراءة ملاحظات الأطباء، وكل ذلك دون الحاجة إلى بيانات خاصة باهظة الثمن.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →