An Empirical Study into Clustering of Unseen Datasets with Self-Supervised Encoders
تثبت هذه الورقة تجريبياً أنه في حين أن المشفرات ذاتية الإشراف تعمم بشكل أفضل على مجموعات البيانات غير المرئية مقارنة بالمشفرات الخاضعة للإشراف، فإن الضبط الدقيق لها على مجموعة بيانات ImageNet-1k يعكس هذه الميزة، وتؤكد أيضاً أن درجة السيلويت (silhouette score) في فضاء UMAP تعمل كبديل موثوق لتقييم أداء التجميع على البيانات غير المصنفة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في المشهد الشاسع للذكاء الاصطناعي الحديث، تجذرت فكرة قوية: يمكن للآلات أن تتعلم رؤية العالم ليس فقط من خلال إخبارها بماهية كل شيء، ولكن ببساطة من خلال النظر إلى ملايين الصور بمفردها. هذا النهج، المعروف باسم التعلم الخاضع للإشراف الذاتي، يسم يسمح للحواسيب ببناء خريطة ذهنية للأنماط البصرية — التعرف على الأشكال، والملمس، والهياكل — دون الحاجة إلى إنسان يضع تسمية لكل صورة على حدة. وبمجرد أن يبني الحاسوب هذه الخريطة، يمكن استخدامه لحل مشكلات جديدة، مثل تحديد نوع معين من الطيور أو فرز المسحات الطبية. ومع ذلك، ظل هناك سؤال جوهري يلوح في الأفق: إذا أخذنا حاسوباً تعلم من مكتبة ضخمة من الصور العامة وأعطيناه مجموعة جديدة تماماً من الصور التي لم يرها من قبل، فهل لا يزال بإمكانه فهمها؟ هل يمكنه تجميع هذه الصور المجهولة معاً بطريقة منطقية، بمجرد النظر إلى الأنماط التي تعلمها سابقاً، دون أي تدريب إضافي؟
لقد وضع فريق من الباحثين هدفاً للإجابة على هذا السؤال من خلال التعامل مع "الخريطة" الداخلية للحاسوب كأداة للاكتشاف. لقد أخذوا عدة أنواع مختلفة من نماذج الرؤية الحاسوبية المدربة مسبقاً — بعضها تعلم من خلال إخباره بالإجابات الصحيحة، والبعض الآخر تعلم من خلال إيجاد الأنماط في البيانات بمفرده — وطلبوا منها فرز مجموعة متنوعة من مجموعات الصور غير المرئية. تراوحت هذه المجموعات من أشياء مألوفة مثل السيارات والزهور إلى فئات أكثر تجريداً مثل الأنسجة، والأرقام المكتوبة بخط اليد، وحتى المناظر المجهرية لأنسجة الأورام. لم يعلم الباحثون النماذج أي شيء جديد؛ بل تركوا النماذج تنظر إلى الصور، وتحولها إلى قائمة من الأرقام التي تمثل سماتها، ثم استخدمت خوارزميات فرز قياسية لتجميع الأرقام المتشابهة معاً. كان الهدف هو معرفة ما إذا كانت المجموعات التي كونها الحاسوب تتطابق مع الفئات الواقعية التي نعرفها، مثل "كلب" أو "سيارة"، أم أن الحاسوب كان يجمعها بناءً على شيء آخر تماماً، مثل لون الخلفية أو أسلوب الصورة.
كشفت النتائج عن انقسام رائع في كيفية تفكير هذه الأنواع المختلفة من النماذج. فعندما كانت الصور مشابهة لتلك التي رأتُها النماذج خلال تدريبها الأولي، حققت النماذج التي عُلِّمت صراحةً الأسماء الصحيحة للأشياء أفضل أداء؛ حيث استطاعت فرز هذه العناصر المألوفة بدقة عالية. ومع ذلك، عندما انتقل الباحثون إلى صور مختلفة جداً عن بيانات التدريب — مثل الرسومات التخطيطية، أو اللوحات، أو الشرائح المجهرية — بدأت النماذج التي تعلمت بمفردها في التفوق على تلك التي عُلِّمت. كانت هذه النماذج ذاتية التعلم أفضل في إيجاد الهيكل الأساسي في العوالم البصرية الغريبة تماماً. ويبدو أن النماذج التي دربها البشر للتعرف على أشياء محددة أصبحت شديدة التركيز على التفاصيل الدقيقة لتلك الأشياء المحددة، بينما طورت النماذج ذاتية التعلم فهماً أكثر مرونة للأنماط البصرية التي تصمد حتى عندما يتغير السياق تماماً.
كما كشفت الدراسة عن نقطة ضعف مفاجئة في النماذج ذاتية التعلم عندما أُجبرت على تعلم أسماء محددة لاحقاً. فعندما أخذ الباحثون النماذج ذاتية التعلم وأعطوها دورة مكثفة في تسمية الأشياء، أصبحت ممتازة في فرز العناصر المألوفة، لكن قدرتها على التعامل مع الصور الغريبة والبعيدة أصبحت في الواقع أسوأ؛ فقد أصبحت أقل مرونة، وفقدت الصفة التي جعلتها جيدة في التعامل مع المجهول في المقام الأول. يشير هذا إلى وجود مقايضة: تعليم النموذج ليكون خبيراً في مهمة محددة يمكن أن يجعله أقل قدرة على أن يكون عاماً. علاوة على ذلك، وجد الباحثون أن النماذج ذاتية التعلم كانت أكثر عرضة للارتباك بسبب خلفية الصورة؛ فإذا تغيرت خلفية الصورة، تعثرت النماذج ذاتية التعلم في التعرف على الشيء، بينما كانت النماذج المدربة بتسميات بشرية أفضل في تجاهل الخلفية والتركيز على الموضوع الأساسي. يشير هذا إلى أن النماذج ذاتية التعلم تعامل الصورة بأكملها كوحدة واحدة لا تتجزأ، بينما تتعلم النماذج الخاضعة للإشراف فصل الموضوع الرئيسي عن محيطه.
ومن الاكتشافات العملية الهامة لهذا العمل، طريقة جديدة لتقييم مدى جودة أداء النموذج دون الحاجة إلى الإجابات الصحيحة. عادةً، لمعرفة ما إذا كان الحاسوب قد فرز كومة من الصور بشكل صحيح، تحتاج إلى معرفة الإجابة الصحيحة لكل صورة. وجد الباحثون أنه يمكنهم التنبؤ بمدى نجاح عملية الفرز بمجرد النظر إلى مدى إحكام تكتل المجموعات معاً. فإذا كانت المجموعات من الصور المتشابهة قريبة جداً من بعضها البعض وبعيدة عن المجموعات الأخرى، فمن المرجح أن يكون الفرز صحيحاً. عملت درجة "الإحكام" هذه بشكل جيد بشكل خاص عندما تم تبسيط الصور أولاً إلى مساحة ذات أبعاد أقل، وهي عملية تجرد البيانات من الضجيج غير الضروري. وهذا الاكتشاف مهم لأنه يعني أن العلماء يمكنهم الآن اختبار مدى فهم النموذج لمجموعة بيانات جديدة حتى عندما لا يملكون أي تسميات، وذلك ببساطة من خلال التحقق من كيفية تكتل البيانات بشكل طبيعي.
كما اختبر الباحثون مدى قدرة هذه النماذج على التعامل مع الصور التي تتطلب تمييزاً دقيقاً للغاية، مثل التفريق بين أنواع مختلفة من الطيور أو أصناف الزهور. ووجدوا أن النماذج تعاني عموماً مع هذه المهام المحددة للغاية، وتؤدي بشكل أفضل عندما تكون الفئات أوسع، مثل "طائر" مقابل "زهرة". وهذا يتماشى مع فكرة أنه بينما تعد هذه النماذج ممتازة في رؤية الصورة الكبيرة، إلا أنها ليست مهيأة طبيعياً للتفاصيل الدقيقة التي تميز نوعاً معيناً من الأشياء عن غيره. وتخلص الدراسة إلى أنه بالنسبة لفرز البيانات الجديدة وغير المعروفة، فإن أفضل نهج هو استخدام نموذج ذاتي التعلم لم يُجبر على تعلم أسماء محددة، وتبسيط البيانات أولاً لجعل الأنماط أكثر وضوحاً. وهذا يوفر مساراً واضحاً لاستخدام الذكاء الاصطناعي لتنظيم وفهم العالم البصري الشاسع غير المصنف الذي يوجد خارج مجموعات البيانات التي نستخدمها للتدريب.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.