← أحدث الأبحاث
🤖 machine learning

VariViT: A Vision Transformer for Variable Image Sizes

تقترح الورقة البحثية VariViT، وهي بنية "Vision Transformer" تتعامل مع أحجام الصور المتغيرة من خلال مخطط مبتكر لإعادة تحجيم التضمين الموضعي واستراتيجية تجميع فعالة، محققة أداءً فائقاً في تصنيف أورام الدماغ والتنبؤ بالنمط الجيني مع تقليل التكاليف الحسابية بنسبة تصل إلى 30%.

المؤلفون الأصليون: Aswathi Varma, Suprosanna Shit, Chinmay Prabhakar, Daniel Scholz, Hongwei Bran Li, Bjoern Menze, Daniel Rueckert, Benedikt Wiestler

نُشر 2026-02-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Aswathi Varma, Suprosanna Shit, Chinmay Prabhakar, Daniel Scholz, Hongwei Bran Li, Bjoern Menze, Daniel Rueckert, Benedikt Wiestler

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك محقق يحاول حل لغز من خلال النظر في سلسلة من الصور الفوتوغرافية. في عالم الذكاء الاصطناعي (AI)، تُسمى هؤلاء "المحققون" بـ محولات الرؤية (Vision Transformers - ViTs). إنهم أذكياء للغاية في النظر إلى الصور للعثور على الأنماط، مثل رصد ورم في فحص للدماغ.

ومع ذلك، هناك مشكلة كبيرة في كيفية عمل هؤلاء المحققين عادةً: إنهم لا يقبلون إلا صوراً بحجم محدد للغاية.

المشكلة: البدلة التي "تناسب مقاساً واحداً للجميع"

تخيل أن لديك مجموعة من الصور للأورام. بعضها عبارة عن نقاط صغيرة، وبعضها كتل ضخمة.

  • الطريقة القديمة (Vanilla ViT): لإدخال هذه الصور في الذكاء الاصطناعي، عليك إجبارها جميعاً على الدخول في إطار قياسي.
    • إذا كان الورم صغيراً، يجب عليك تمديد الصورة لتناسب الإطار. هذا يجعل الورم يبدو ضبابياً ويُدخل تفاصيل مزيفة (artifacts)، مثل شد شريط مطاطي حتى ينقطع.
    • إذا كان الورم ضخماً، فقد تضطر إلى قطع الحواف أو تصغير الصورة بأكملها. قد يؤدي هذا إلى قطع أدلة مهمة أو جعل الورم يبدو صغيراً جداً بحيث يصعب رؤيته بوضوح.
    • النتيجة: يصاب الذكاء الاصطناعي بالارتباك. يقضي وقتاً طويلاً في النظر إلى الخلفية الفارغة (الدماغ السليم) لأن الورم تعرض للتشويه أو التقلص، مما يهدر طاقته.

الحل: VariViT (المحقق المرن)

ابتكر المؤلفون نموذجاً جديداً للذكاء الاصطناعي يسمى VariViT. فكر في VariViT كمحقق لا يحتاج إلى إطار جامد؛ يمكنه النظر إلى صورة كما هي تماماً، سواء كانت مربعاً صغيراً أو مستطيلاً ضخماً.

إليك كيف يعمل VariViT، باستخدام بعض التشبيهات البسيطة:

1. خدعة "المركز والاختيار" (الخريطة الموضعية)

لفهم صورة ما، يحتاج الذكاء الاصطناعي إلى خريطة ليعرف أين توجد الأشياء (على سبيل المثال: "الورم في الزاوية العلوية اليسرى").

  • الطريقة القديمة: إذا تغير حجم الصورة، يحاول الذكاء الاصطناعي تمديد أو سحق خريطته لتناسب الحجم الجديد. هذا يشبه محاولة تمديد خريطة مطاطية؛ حيث تتشوه الشوارع ويضيع الذكاء الاصطناعي.
  • طريقة VariViT: تخيل أن لدى الذكاء الاصطناعي خريطة ضخمة ومثالية لأكبر ورم ممكن. عندما ينظر إلى ورم أصغر، بدلاً من تمديد الخريطة، يقوم ببساطة بالتركيز (Zoom in) على مركز تلك الخريطة الضخمة.
    • بما أن الأورام عادة ما تكون متمركزة في الفحصات الطبية، فإن "مركز" الخريطة الكبيرة و"مركز" الورم الصغير هما نفس الشيء.
    • يقوم VariViT فقط بجلب الجزء ذي الصلة من منتصف الخريطة. لا تمديد، لا تشويه، فقط رؤية واضحة وحادة للورم.

2. استراتيجية "التجميع الذكي" (Batching)

تدريب الذكاء الاصطناعي يشبه تعليم فصل من الطلاب. عادةً، تضع الطلاب الذين لديهم نفس الطول في نفس الصف حتى يتمكنوا جميعاً من رؤية السبورة.

  • الطريقة القديمة: إذا كان لديك طلاب بأطوال مختلفة (أحجام صور مختلفة)، فعليك إما جعل القصار يقفون على صناديق (padding) أو جعل الطوال يجلسون على الأرض (cropping). هذه العملية بطيئة وفوضوية.
  • طريقة VariViT: ابتكر المؤلفون طريقتين ذكيتين لتجميع الطلاب:
    1. التجميع حسب الحجم: ضع جميع صور "الأورام الصغيرة" في دفعة واحدة، وجميع صور "الأورام الكبيرة" في دفعة أخرى. يتعلم الذكاء الاصطناعي لكل منها على حدة ولكن بكفاءة.
    2. طريقة "التراكم" (Accumulate): إذا كان لزاماً عليك خلط الأحجام، يأخذ الذكاء الاصطناعي بضع صور صغيرة، ويتعلم منها، ثم يأخذ بضع صور كبيرة، ويتعلم منها، وبعد ذلك يقوم بتحديث دماغه. هذا يوفر قدراً هائلاً من القدرة الحوسبية.

لماذا يهم هذا الأمر؟

اختبر الباحثون VariViT على فحوصات الدماغ للقيام بشيئين:

  1. تحديد نوع ورم الدماغ (أولي مقابل ثانوي/منتشر).
  2. التنبؤ بالطفرات الجينية (حالة IDH)، وهو ما يساعد الأطباء في اختيار العلاج المناسب.

النتائج:

  • دقة أفضل: كان VariViT أفضل في رصد الأورم والتنبؤ بجيناتها مقارنة بالنماذج القديمة التي تعتمد على "الشد والتقليص". لقد حقق درجات أعلى (درجات F1 حوالي 75-76%) لأنه لم يتشتت بالخلفيات الضبابية.
  • سرعة أكبر: نظرًا لأنه لم يضع وقتاً في تمديد الصور أو معالجة مساحات الخلفية الفارغة، فقد تدرب بسرعة أكبر بنسبة 30%.

الخلاصة

VariViT يشبه إعطاء المحقق الذكاء الاصطناعي نظارات ذكية تتكيف تلقائياً مع حجم الشيء الذي ينظر إليه. بدلاً من إجبار العالم على التوافق مع قواعد الذكاء الاصطناعي الجامدة، يتكيف VariViT مع الواقع غير المنتظم والمتغير للتشريح البشري. وهذا يعني أن الأطباء يمكنهم الحصول على تشخيصات أسرع وأكثر دقة دون أن يصاب الذكاء الاصطناعي بالارتباك بسبب الصور المشوهة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →