Initialization matters in few-shot adaptation of vision-language models for histopathological image classification
تقترح هذه الورقة البحثية التعلم متعدد الحالات صفري المعرفة (ZS-MIL)، وهو طريقة تكيف قليلة المعرفة لنماذج الرؤية واللغة في علم أمراض الأنسجة، والتي تستخدم تضمينات فئات مشفر النصوص لتهيئة المصنفات الخطية، مما يؤدي إلى تفوقها على التهيئة العشوائية في كل من الدقة والاستقرار لتصنيف الصور كاملة الشريحة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أن لديك صورة فوتوغرافية ضخمة وعالية الدقة لمدينة (صورة كاملة الشريحة أو ما يعرف بـ WSI) تم التقاطها من الفضاء. هذه الصورة ضخمة للغاية لدرجة أنه من المستحيل على الكمبيوتر أن ينظر إليها بأكملها في وقت واحد. بدلاً من ذلك، يتعين على الكمبيوتر أن يقوم بعمل زووم (تكبير) وينظر إلى آلاف الأحياء الصغيرة (التي تسمى الرقع أو patches).
في العالم الطبي، تكون هذه "المدن" في الواقع شرائح مجهرية لأنسجة بشرية، و"الأحياء" هي مربعات صغيرة من الخلايا. يحتاج الأطباء لتصنيف هذه الشرائح لتشخيص أمراض مثل سرطان الرئة، لكن تسمية كل مربع صغير من هذه المرببات عملية مرهقة للغاية؛ فهي تستغرق الكثير من الوقت والمال.
هنا يأتي دور هذا البحث. إنه يدور حول تعليم ذكاء اصطناعي فائق الذكاء تشخيص هذه الشرائح باستخدام عدد قليل جداً من الأمثلة، وقد وجد حيلة ذكية تجعل هذا الذكاء الاصطناعي أكثر موثوقية.
المشكلة: فخ "التخمين العشوائي"
لقد بنى العلماء بالفعل ذكاءً اصطناعياً فائقاً (يسمى نموذج الرؤية واللغة أو VLM) قد "قرأ" ملايين الكتب و"رأى" ملايين الصور. هو يعرف كيف يبدو "الرئة" وكيف يبدو "السرطان" بمجرد قراءة الأوصاف.
عندما تريد استخدام هذا الذكاء الاصطناعي لتشخيص شريحة جديدة، فلديك عادة خياران:
- التعلم بدون أمثلة (Zero-Shot): تسأل الذكاء الاصطناعي: "هل هذا سرطان؟" بناءً على ما يعرفه بالفعل. الأمر يشبه سؤال أمين مكتبة واسع الاطلاع لتخمين نوع كتاب بمجرد النظر إلى غلافه. إنه أمر جيد، لكنه ليس مثالياً.
- التعلم بالقليل من الأمثلة (Few-Shot Learning): تعرض للذكاء الاصطناعي بعض الأمثلة (مثلاً 4 أو 16 شريحة) وتقول له: "انظر؟ هذا سرطان. وهذا ليس سرطاناً". ثم يحاول الذكاء الاصطناعي تعلم النمط.
تظهر المشكلة في الخطوة الثانية. لكي يتمكن الذكاء الاصطناعي من التعلم من تلك الأمثلة القليلة، عليك إرفاق "طبقة قرار" (مصنف) في نهاية الذكاء الاصطناعي. تقليدياً، يبدأ العلماء هذه الطبقة بـ أرقام عشوائية، مثل رمي النرد لتحديد كيفية تفكير الذكاء الاصطناعي.
التشبيه: تخيل أنك توظف مديراً جديداً لفريق.
- البداية العشوائية: توظف المدير عن طريق اختيار اسم من قبعة. ليس لديه أدنى فكرة عن طبيعة العمل، لذا عليه تعلم كل شيء من الصفر. إذا أعطيته 4 أمثلة فقط ليتعلم منها، فقد يرتبك، ويفرط في التفكير، ويتخذ قرارات سيئة.
- النتيجة: يؤدي الذكاء الاصطناعي في هذه الحالة إلى أداء أسوأ مما كان عليه عندما كان يعتمد فقط على معرفته العامة!
الحل: ZS-MIL (مجموعة "البداية الذكية")
قال مؤلفو هذا البحث (بابلو، روسيو، وفاليري): "لماذا نبدأ بأرقام عشوائية؟ لنبدأ بمعرفة الذكاء الاصطناعي نفسه!"
لقد اقترحوا طريقة تسمى التعلم متعدد الأمثلة بأسلوب الصفر (Zero-Shot Multiple-Instance Learning أو ZS-MIL).
كيف يعمل:
بدلاً من رمي النرد لبدء طبقة القرار، يستخدمون المعرفة النصية للذكاء الاصطناعي لتحديد نقطة البداية.
- يسألون الذكاء الاصطناعي: "كيف يبدو صوت 'سرطان الخلايا الحرشفية في الرئة'؟"
- يقرأ الذكاء الاصطناعي مكتبته الداخلية وينشئ "مخططاً ذهنياً" مثالياً (تمثيلاً أو embedding) لهذا المرض.
- يستخدمون هذا المخطط كـ أوزان البداية لطبقة القرار.
التشبيه:
بدلاً من توظيف مدير من قبعة، أنت توظف مديراً قد قرأ بالفعل دليل الموظف ودرس رؤية الشركة. إنه يبدأ بـ "دفعة للأمام". حتى لو أعطيته 4 أمثلة فقط ليتعلم منها، فلن يرتبك لأنه يمتلك بالفعل أساساً صلباً لما يجب أن يكون عليه العمل.
النتائج: لماذا هذا مهم؟
لقد اختبروا ذلك على شرائح سرطان الرئة (تحديداً التمييز بين نوعين من سرطان الرئة).
- الاتساق: عندما استخدموا بدايات عشوائية، كان أداء الذكاء الاصطناعي يتذبذب بجنون اعتماداً على الأمثلة القليلة التي اختاروها بالصدفة. كان الأمر أشبه بطالب يحصل على درجة ممتاز يوماً ودرجة رسوب في اليوم التالي لمجرد الحظ.
- الأداء: مع "البداية الذكية" (ZS-MIL)، كان الذكاء الاصطناعي أكثر اتساقاً. لم يهم أي أمثلة قليلة اخترناها؛ فقد كان الذكاء الاصطناعي يؤدي بشكل جيد في كل مرة.
- التفوق على المنافسين: في أصعب سيناريو (4 أمثلة فقط لكل مرض)، كانت طريقتهم أكثر دقة بنسبة تقارب 20% من الطريقة العشوائية القياسية.
ميزة "الخريطة الحرارية" (Heatmap)
أظهر البحث أيضاً أن هذه الطريقة "قابلة للتفسير". نظرًا لأن الذكاء الاصطناعي يبحث عن أنماط محددة تعلمها من النصوص، فبإمكانه تحديد مكان وجود السرطان بدقة على الشريحة.
- بصرياً: تخيل الذكاء الاصطناعي وهو يرسم دائرة حمراء حول الخلايا المشبوهة على الشريحة.
- النتي نتيجة: تطابقت الدوائر الحمراء تماماً مع الأماكن التي رسم فيها أطباء علم الأمراض (Pathologists) دوائرهم الخاصة. هذا يبني الثقة، ويظهر للطبيب أن الذكاء الاصطناعي لا يخمن فحسب، بل ينظر إلى الأشياء الصحيحة.
الخلاصة
في عالم الذكاء الاصطناعي الطبي، غالباً ما نمتلك صوراً ضخمة ولكن لدينا أمثلة قليلة جداً مصنفة. يعلمنا هذا البحث أن كيفية البداية أمر بالغ الأهمية.
إذا حاولت تعليم ذكاء اصطناعي فائق المهمة من خلال البدء من الصفر بتخمينات عشوائية، فسوف يعاني مع البيانات المحدودة. ولكن إذا سمحت للذكاء الاصطناعي باستخدام "منطقه السليم" (معرفته النصية) لتهيئة المسرح، فسيصبح مساعد طبيب أفضل بكثير وأكثر موثوقية، حتى لو كان لديه حفنة فقط من الأمثلة ليتعلم منها.
باختصار: لا تبدأ بلوحة فارغة. ابدأ بدفعة للأمام.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.