Probabilistic Multi-dimensional Classification with Incomplete Data
تقترح هذه الورقة نهجاً احتمالياً جديداً، وقابلاً للتوسع، ومتيناً للتصنيف متعدد الأبعاد باستخدام بيانات مختلطة وغير مكتملة، مع توفير أسس نظرية لخوارزمياته وأدلة تجريبية على فعاليته عبر سيناريوهات مختلفة من فقدان البيانات.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
في عالم علم البيانات، غالباً ما يُطلب من الحواسيب تقديم تنبؤات بناءً على أنماط تعلمتها من أمثلة سابقة. تخيل طبيباً يحاول تشخيص مريض؛ حيث ينظر الطبيب إلى قائمة من الأعراض، ونتائج فحوصات الدم، والتاريخ الطبي للتنبؤ بعدة أشياء في آن واحد: النوع المحدد للمرض، ومستوى شدته، وكيفية استجابة المريض لعلاجات مختلفة. هذه مهمة معقدة لأن البيانات مختلطة؛ فبعض المعلومات رقمية، مثل قراءة درجة الحرارة، بينما معلومات أخرى فئوية، مثل تشخيص يندرج تحت واحدة من عدة فئات متميزة. علاوة على ذلك، نادراً ما تكون بيانات العالم الحقيقي مثالية؛ فقد ينسى المريض الإبلاغ عن عرض ما، أو قد يفشل اختبار معملي في إعطاء نتيجة. وعندما يحاول نموذج حاسوبي التعلم من مثل هذه السجلات غير المكتملة، فإنه غالباً ما يواجه صعوبة، خاصة عندما تكون القطع المفقودة هي تلك الفئوية التي تحدد الفئات نفسها.
يقع هذا التحدي في قلب مجال يُعرف بالتصنيف متعدد الأبعاد. وخلافاً للمهام الأبسط حيث يتنبأ الحاسوب بنتيجة واحدة، يطلب التصنيف متعدد الأبعاد من الآلة التنبؤ بمجموعة كاملة من النتائج في وقت واحد. وتتضاعف الصعوبة عندما تكون البيانات غير مكتملة؛ فإذا لم يرَ النموذج مزيجاً معيناً من المعلومات المفقودة أثناء تدريبه، فقد يفشل في تقديم تخمين موثوق عندما يطرأ هذا الموقف لاحقاً. وقد سعى الباحثون طويلاً لإيجاد طريقة لبناء نماذج يمكنها التعامل مع هذه الفوضى دون أن تفقد قدرتها على إيجاد الروابط الدقيقة بين مختلف قطع المعلومات.
قام فريق من الباحثين في جامعة التكنولوجيا في كومبيين (Université de Technologie de Compiègne) في فرنسا بتطوير نهج جديد لحل هذه المشكلة. لقد ابتكروا نظاماً يسمى "المصنف الهجين متعدد الأبعاد الاحتمالي" (Hybrid Probabilistic Multi-Dimensional Classifier). فكر في هذا النظام كخريطة مرنة يبنيها الحاسوب لفهم كيفية ارتباط قطع المعلومات المختلفة ببعضها البعض. في الأساليب السابقة، كان الحاسوب يُجبر غالباً على الاختيار بين خيارين صعبين: إما أن يتمكن من التعامل مع العلاقات المعقدة بين المتغيرات ولكنه قد يتعطل إذا كانت البيانات مفقودة، أو يمكنه التعامل مع البيانات المفقودة ولكن عليه تجاهل الروابط الدقيقة بين المتغيرات ليبقى بسيطاً. يجسّر النهج الجديد هذه الفجوة؛ فهو يسمح للحاسوب بالتعلم من البيانات حتى عندما تكون بعض القيم الفئوية مفقودة أثناء مرحلة التدريب، ويسمح له بإجراء التنبؤات حتى عندما تكون تلك القيم نفسها مفقودة أثناء مرحلة الاختبار.
اختبر الباحثون نظامهم على ثلاث مجموعات بيانات من العالم الحقيقي تحتوي على أنواع مختلطة من البيانات. تضمنت إحدى مجموعات البيانات معلومات عن البالغين، مثل دخلهم ومستوى تعليمهم، للتنبؤ بفئات ديموغرافية مختلفة. وركزت أخرى على حالات التخلف عن سداد الائتمان، وتتعامل الثالثة مع تشخيصات أمراض الغدة الدرقية. وفي تجاربهم، قاموا عمداً بإزالة معلومات من السجلات، محاكيين سيناريوهات حيث كانت ما يصل إلى 80 بالمائة من الميزات الفئوية مفقودة، أو حيث كانت فئات كاملة من النتائج مجهولة. وقارنوا نهجهم الجديد بالتقنيات القديمة التي كانت ببساطة تخمن الإجابة الأكثر شيوعاً للبيانات المفقودة أو تحاول ملء الفراغات بتقديرات.
أظهرت النتائج أن النهج الهجين الجديد كان أكثر قوة بشكل ملحوظ. فعندما طُلب من الحاسوب التنبؤ بالنتائج مع وجود معلومات مفقودة، تفوق النهج الجديد باستمرار على النماذج المرجعية القديمة. وكان فعالاً بشكل خاص في التعامل مع استراتيجيات "التفاؤل" و"المتوسط"، وهي طرق للتعامل مع عدم اليقين. فبدلاً من الاستسلام أو التخمين الأعمى، استخدم النموذج العلاقات التي تعلمها من البيانات المتاحة لاستنتاج القطع المفقودة الأكثر احتمالاً. على سبيل المثال، في مجموعة بيانات الغدة الدرقية، حيث كانت إحدى النتائج شائعة للغاية، نجح النهج الجديد في تحسين التنبؤات للنتائج الأقل شيوعاً، والتي غالباً ما تكون هي الأكثر أهمية في النجاح. ووجد الباحثون أن نظامهم يمكنه الحفاظ على دقة عالية حتى عندما تكون بيانات التدريب نفسها غير مكتملة، وهو سيناريو كان من الصعب جداً إدارته في السابق.
كان أحد الاكتشافات الرئيسية هو أن النظام لا يحتاج إلى أن يكون معقداً للغاية ليعمل بشكل جيد. فمن خلال تحديد عدد الروابط التي يحاول النموذج تعلمها بين المتغيرات، حافظ الباحثون على قابلية الحسابات للإدارة مع الاستمرار في التقاط التبعيات الجوية. كما اكتشفوا أن نوعاً معيناً من قواعد التقييم الرياضي، المعروف باسم "معيار المعلومات البايزي" (Bayesian Information Criterion)، ساعد النموذج على اختيار المستوى الصحيح من التعقيد، مما منع "الفرط في التخصيص" (overfitting) للضجيج في البيانات. ورغم أن النظام ليس مثالياً ولا يزال يواجه تحديات حسابية عندما يصبح عدد المتغيرات المفقودة كبيراً جداً، إلا أنه يمثل خطوة كبيرة للأمام. فهو يوفر أداة عملية للحالات التي تكون فيها البيانات فوضوية وغير مكتملة، مما يسمح للآلات باتخاذ قرارات أفضل في مجالات تتراوح من الرعاية الصحية إلى التمويل، حيث تكون المعلومات المفقودة هي القاعدة وليس الاستثناء.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.