← أحدث الأبحاث
💻 computer science

Effect of Patch Size on Fine-Tuning Vision Transformers in Two-Dimensional and Three-Dimensional Medical Image Classification

تُظهر هذه الدراسة أن الضبط الدقيق لنماذج "Vision Transformers" باستخدام أحجام رقع أصغر (1، 2، و4) يحسن بشكل كبير أداء التصنيف على مجموعات بيانات متنوعة من الصور الطبية ثنائية وثلاثية الأبعاد مقارنة بالرقع الأكبر، مع تحقيق مكاسب إضافية من خلال استراتيجية التجميع، وإن كان ذلك على حساب زيادة التكلفة الحسابية.

المؤلفون الأصليون: Massoud Dehghan, Ramona Woitek, Amirreza Mahbod

نُشر 2026-02-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Massoud Dehghan, Ramona Woitek, Amirreza Mahbod

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تحديد حيوان معين في صورة ضبابية وبعيدة. الطريقة التي تنظر بها إلى تلك الصورة تغير كل شيء. هل تضيق عينيك وتنظر إلى الصورة ككل ككتلة واحدة كبيرة؟ أم تقوم بالتكبير، قطعة قطعة، لترى ملمس الفراء، وشكل الأذن، وانحناء الذيل؟

هذا هو بالضبط موضوع هذا البحث العلمي، ولكن بدلاً من الحيوانات، هم ينظرون إلى الصور الطبية (مثل الأشعة السينية، والأشعة المقطعية، والرنين المغناطيسي) باستخدام نوع من الذكاء الاصطناعي يسمى محول الرؤية (Vision Transformer - ViT).

إليك تفصيل لاكتشافهم بكلمات بسيية:

المشكلة: معضلة "مستوى التكبير"

في عالم الذكاء الاصطناعي، يعمل "محول الرؤية" عن طريق تقسيم الصورة إلى مربعات صغيرة تسمى "الرقع" (patches). فكر في هذه الرقع كأنها بلاطات في لوحة فسيفساء.

  • الرقع الكبيرة: تخيل أنك تنظر إلى شبكة مكونة من 14×14 بلاطة. كل بلاطة ضخمة جداً. أنت ترى الشكل العام للجسم، لكنك تفقد التفاصيل الدقيقة.
  • الرقع الصغيرة: تخيل أنك تنظر إلى شبكة 1×1 حيث كل بكسل هو بلاطة مستقلة. أنت ترى كل التفاصيل الدقيقة، ولكن هناك آلاف البلاطات التي يجب معالجتها.

لفترة طويلة، اكتفى معظم الباحثين باختيار حجم "بلاطة قياسي" (غالباً 14×14) ولم يتساءلوا: "ماذا لو استخدمنا بلاطات أصغر؟ هل سيساعد ذلك الذكاء الاصطناعي على رؤية المرض بشكل أفضل؟"

التجربة: قصة محقق طبي

قرر الباحثون لعب دور المحقق. أخذوا 12 مجموعة بيانات طبية مختلفة (بعضها صور ثنائية الأبعاد مثل الأشعة السينية، والبعض الآخر مجلدات ثلاثية الأبعاد مثل الأشعة المقطعية) واختبروا الذكاء الاصطناعي بمستويات "تكبير" مختلفة (أحجام رقع مختلفة).

اختبروا أحجام رقع تتراوح من 28 (بعيد جداً، حيث يرى الصورة ككتلة واحدة كبيرة) وصولاً إلى 1 (مقرب جداً لدرجة أنك ترى كل بكسل بمفرده).

التشبيه:
فكر في الذكاء الاصطناعي كطالب يؤدي اختباراً.

  • حجم الرقعة 28: يُعطى الطالب صورة ضبابية لورم ويُطلب منه: "هل هذا سرطان؟" فيخمن بناءً على الشكل العام.
  • حجم الرقعة 1: يُعطى الطالب عرضاً مجهرياً عالي الدقة. يمكنه رؤية الخلايا الفردية. يمكنه القول: "نعم، هذا سرطان لأنني أرى هذه الهياكل الخلوية المحددة".

الاكتشاف الكبير: "كلما صغرت، كان أفضل"

كانت النتائج مفاجئة ولكنها واضحة: أصبح الذكاء الاصطناعي أفضل بكثير في تشخيص الأمراض عندما نظر إلى رقع أصغر.

  • للصور ثنائية الأبعاد (مثل الأشعة السينية): أدى استخدام الرقع الصغيرة جداً إلى تحسين الدقة بنسبة تصل إلى 12.8%.
  • للصور ثلاثية الأبعاد (مثل الأشعة المقطعية): كان التحسن هائلاً، حيث وصل إلى 23.8%.

لماذا؟
الأمراض الطبية غالباً ما تختبئ في التفاصيل الصغيرة. قد تفوت الرقعة الكبيرة كسرًا صغيرًا في العظم أو عقيدة صغيرة في الرئة لأنها "ضبابية" للغاية عند ذلك المقياس. باستخدام رقع أصغر، يمكن للذكاء الاصطناعي التركيز على التفاصيل الدقيقة التي تهم فعلياً للتشخيص.

العقبة: تكلفة "الوقود"

هناك مقايضة.

  • الرقع الكبيرة: الذكاء الاصطناعي يكون "كسولاً". يعالج الصورة بسرعة ويستهلك القليل جداً من قوة الكمبيوتر (الوقود).
  • الرقع الصغيرة: الذكاء الاصطناعي "عامل مجد". عليه النظر في آلاف البلاطات الصغيرة بدلاً من بضع بلاطات كبيرة. وهذا يتطلب قوة حوسبة أكبر بكثير.

التشبيه:
تخيل أنك تقود سيارة.

  • الرقع الكبيرة تشبه القيادة على طريق سريع بسرعة 60 ميلاً في الساعة. إنها سريعة وتستهلك القليل من الوقود.
  • الرقع الصغيرة تشبه القيادة عبر مدينة مزدحمة، حيث تتوقف عند كل تقاطع لتفحص إشارات المرور. تصل بدقة أكبر، لكنك تحرق الكثير من الوقود وتستغرق وقتاً أطول.

وجد الباحثون أنه بالنسبة للمسحات ثلاثية الأبعاد، جعل تقليل حجم الرقع إلى النصف يجعل الكمبيوتر يعمل بقوة أكبر بـ 64 مرة. هذا ثمن باهظ جداً!

حل "الفريق الخارق"

للحصول على أفضل ما في العالمين، جرب الباحثون حيلة تسمى "التجميع" (Ensembling).
تخيل أن لديك ثلاثة أطباء:

  1. الطبيب (أ) ينظر إلى الصورة بتكبير متوسط.
  2. الطبيب (ب) ينظر بتكبير عالٍ.
  3. الطبيب (ج) ينظر بتكبير شديد.

بدلاً من اختيار طبيب واحد فقط، طلبوا من الثلاثة إعطاء رأيهم وقاموا بمتوسط النت actually. هذا النهج الذي يسمى "الفريق الخارق" غالباً ما أعطى أعلى دقة من بين الجميع، حيث جمع بين سرعة الرقع الكبيرة وتفاصيل الرقع الصغيرة.

الخلاصة

يخبرنا هذا البحث أمرين مهمين لمستقبل الذكاء الاصطناعي الطبي:

  1. لا ترضَ بالإعدادات القياسية. إذا كنت تريد للذكاء الاصطناعي تشخيص الأمراض بدقة، فيجب عليك تجربة "التكبير" (استخدام رقع أصغر) لالتقاط التفاصيل الدقيقة.
  2. إنها عملية توازن. عليك أن تقرر ما إذا كان لديك قوة حوسبة كافية للتعامل مع العرض "المكبر". إذا كان لديك ذلك، فسيكون الذكاء الاصطناعي طبيباً أفضل بكثير.

لقد جعل الباحثون كود البرمجة الخاص بهم متاحاً للعامة، حتى يتمكن العلماء الآخرون من تجربة استراتيجية "التكبير" هذه في مشاريعهم الطبية الخاصة دون الحاجة إلى كمبيوتر خارق (لقد تمكنوا من القيام بذلك كله على بطاقة رسوميات واحدة قياسية).

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →