SeBA: Semi-supervised few-shot learning via Separated-at-Birth Alignment for tabular data
تقترح الورقة البحثية إطار عمل SeBA، وهو إطار عمل جديد للتعلم بلقطات قليلة شبه مُشرف للبيانات الجدولية يلغي الحاجة إلى عمليات تعزيز البيانات التي يصعب تحديدها من خلال محاذاة رؤى مستقلة ومتكاملة بناءً على مراسلات الجار الأقرب، مما يحقق أداءً هو الأفضل في فئته عبر مختلف المعايك المرجعية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم كمبيوتر التعرف على أنواع مختلفة من السيارات (مثل سيارات السيدان، والسيارات الرياضية متعددة الاستخدامات SUV، والشاحنات) بناءً على جدول بيانات. المشكلة هي أن لديك فقط خمسة أمثلة مصنفة (على سبيل المثال: "هذه سيارة سيدان")، ولكن لديك آلاف الصفوف غير المصنفة حيث نوع السيارة مخفي. يُسمى هذا التعلم بلقطات قليلة شبه الموجه (Semi-supervised Few-Shot Learning).
بالنسبة للصور (مثل صور السيارات)، فإن أجهزة الكمبيوتر بارعة في ذلك. يمكنها أخذ صورة، وقصها، أو تدويرها، أو تغيير ألوانها، ثم تقول: "مهلاً، لا تزال هذه هي نفس السيارة!". هذه النسخ "الملتوية" تساعد الكمبيوتر على التعلم.
ولكن بالنسبة لـ البيانات الجدولية (الجداول التي تحتوي على أرقام وفئات)، فإن هذا لا يعمل. لا يمكنك حقاً "قص" جدول بيانات. إذا قمت بتغيير مسافة السيارة المقطوعة عشوائياً أو حولت اللون "الأحمر" إلى "أزرق"، فقد ينتهي بك الأمر بإنشاء سيارة وهمية لم توجد أبداً (مثل سيارة بمسافة مقطوعة 0 ميل ولكن عمرها 100 عام). هذا يربك الكمبيوتر.
إليك SeBA (المحاذاة عند الولادة - Separated-at-Birth Alignment).
يقول مؤلفو هذه الورقة: "دعونا نتوقف عن محاولة التلاعب بالبيانات. بدلاً من ذلك، دعونا نقسمها".
الفكرة الجوهرية: تشبيه "الشخصية المزدوجة"
تخيل أن لديك سيرة ذاتية مفصلة لشخص ما (صف البيانات). بدلاً من محاولة إنشاء نسخة مزيفة من هذا الشخص، يأخذ SeBA السيرة الذاتية ويقسمها إلى نصفين تماماً عند البوادر الأولى ("عند الولادة").
- عرض الميزات (The Feature View): أنت تعطي الكمبيوتر النصف الأول من القصة (مثل: "العمر"، "الوظيفة"، "المدينة").
- عرض الهدف (The Target View): أنت تعطي الكمبيوتر النصف الثاني (مثل: "الراتب"، "الهوايات"، "نوع السيارة").
الآن، إليك الخدعة السحرية:
- ينظر الكمبيوتر إلى عرض الميزات للشخص (أ) ويحاول تخمين من هو "أفضل تطابق" له في عرض الهدف.
- يكتشف أن "عرض الميزات" للشخص (أ) يشبه جداً "عرض الميزات" للشخص (ب).
- ثم يتحقق الكمبيوتر: "هل لدى الشخص (أ) والشخص (ب) 'عروض أهداف' متشابهة؟"
- إذا كانت الإجابة نعم، يتعلم الكمبيوتر: "آه! هذان الشخصان مرتبطان، رغم أنني رأيت نصف قصتهما فقط".
إنها تشبه لعبة "تخمين التوأم".
- تعرض للكمبيوتر صورة للجانب الأيسر من التوأم (أ).
- تعرض له صورة للجانب الأيسر من التوأم (ب).
- يقول الكمبيوتر: "هذان يبدوان كأنهما نفس الشخص!".
- ثم يتحقق: هل الجوانب اليمنى تتطابق أيضاً؟ إذا كانت الجوانب اليمنى تتطابق أيضاً، يتعلم الكمبيوتر أن "الجانب الأيسر أ" و"الجانب الأيسر ب" ينتميان إلى نفس عائلة "الجانب الأيمن".
من خلال القيام بذلك مراراً وتكراراً مع آلاف التقسيمات العشوائية، يتعلم الكمبيوتر طريقة ذكية جداً لتنظيم البيانات دون الحاجة أبداً لابتكار بيانات مزيفة أو التلاعب بالأرقام.
لماذا يعد هذا أفضل؟
- لا مزيد من البيانات المزيفة: حاولت الطرق السابقة "تعزيز" (Augment) البيانات (أي التلاعب بها)، مما أدى غالباً إلى كسر منطق الجدول (مثل جعل سيارة بمسافة مقطوعة سالبة). لا يفعل SeBA ذلك، بل يستخدم البيانات الحقيقية فقط، مقسمة إلى جزئين.
- خريطة "الجار الأقرب": يبني الكمبيوتر خريطة بناءً على من هو الأقرب لمن. يتعلم أنه إذا كان صفان متشابهان في نصف "الميزات"، فمن المرجح أنهما ينتميان إلى نفس المجموعة في نصف "الهدف".
- خفيف الوزن: نموذج الكمبيوتر المستخدم صغير وبسيط (مثل آلة حاسبة أساسية)، لذا لا يرتبك أو "يفكر بشكل مفرط" عندما تكون هناك أمثلة مصنفة قليلة جداً.
النتائج
اختبر المؤلفون SeBA على العديد من "الجداول" (مجموعات البيانات) التي شملت أشياء مثل:
- التشخيصات الطبية
- مخاطر الائتمان
- مبيعات السيارات
- بيانات الحمض النووي (DNA)
وجدوا أن SeBA كان الأفضل في تخمين التصنيفات الصحيحة في معظم الاختبارات، خاصة عندما كانت هناك أمثلة مصنفة قليلة جداً (1-shot أو 5-shot). لقد كان بارعاً بشكل خاص في التعامل مع البيانات الفوضوية، أو التي تحتوي على أعمدة كثيرة، أو التي تتكون في معظمها من فئات (مثل "نعم/لا" أو "أحمر/أزرق").
باختصار
SeBA هو طريقة جديدة لتعليم أجهزة الكمبيوتر كيفية التعلم من الجداول عندما يكون لديك أمثلة مصنفة قليلة جداً. بدلاً من محاولة "التلاعب" بالبيانات عبر إنشاء نسخ مزيفة، يقوم ببساطة بتقسيم البيانات إلى اثنين ويعلم الكمبيوتر كيفية مطابقة النصفين. هذا يتجنب ارتباك ابتكار بيانات مزيفة وينتج نموذجاً أكثر ذكاءً ودقة للمشكلات الواقعية القائمة على الجداول.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.