Valid inference for regression with best subset selection
تقترح هذه الورقة إجراءات استدلال فعالة حاسبياً وصالحة في العينات المحدودة لاختيار المجموعات الأفضل من خلال توصيف هندسة حدث اختيار معيار المعلومات الأكيد (AIC) باعتباره اتحاداً من الفترات، مما يتيح التكييف الدقيق لإنتاج قيم احتمالية وفترات ثقة موثوقة تصحح الإخفاقات التكرارية للطرق التقليدية لما بعد الاختيار.
في عالم علم البيانات، غالبًا ما يواجه الباحثون لغزًا يحتوي على قطع كثيرة جدًا. لديهم مجموعة من الحقائق — أرقام تقيس الدخل، أو درجة الحرارة، أو درجات الاختبار — ويريدون إيجاد المزيج المحدد من هذه الحقائق الذي يفسر بأفضل شكل نتيجة معينة، مثل مقدار ما ينفقه الشخص أو سرعة نمو نبات ما. ولحل ذلك، يستخدمون طريقة تسمى "اختيار المتغيرات" (variable selection)، وهي في جوهرها عملية غربلة للبيانات للاحتفاظ فقط بالقرائن الأكثر فائدة واستبعاد البقية. وأحد أكثر الأدوات شعبية لهذه المهمة هو قاعدة تُعرف باسم "معيار أكايكي للمعلومات" (AIC). فكر في هذا المعيار كحكم صارم يزن مدى ملاءمة النموذج للبيانات مقابل مدى تعقيده، ليختار النسخة التي تقدم أفضل توازن. يعتمد العلماء على هذا الحكم ليخبرهم أي المتغيرات مهمة، ثم يستخدمون أدوات إحصائية قياسية لإعلان ما إذا كانت تلك المتغيرات ذات دلالة حقيقية أم أنها مجرد مصادفات سعيدة.
ومع ذلك، هناك فخ خفي في سير العمل الشائع هذا. فالأدوات القياسية المستخدمة لقياس الدلالة صُممت لعالم كان فيه النموذج قد تم اختياره قبل رؤية أي بيانات على الإطلاق. عندما يستخدم الباحث البيانات نفسها لاختيار النموذج أولاً، ثم يطبق تلك الأدوات القياسية على النتيجة، فإن الرياضيات تنهار. تفترض الأدوات القياسية أن النموذج كان ثابتًا مسبقًا، ولكن نظرًا لأن النموذج قد تم اختياره بناءً على البيانات، فإن الأدوات القياسية تصبح متفائلة للغاية؛ فهي تميل إلى إعلان الأشياء كأشياء ذات دلالة بينما هي ليست كذلك، مما يؤدي إلى اكتشافات كاذبة وفترات ثقة ضيقة جدًا بحيث لا يمكن الوثوق بها. وهذه مشكلة تؤثر على كل شيء، من الأبحاث الطبية إلى التنبؤ الاقتصادي، حيث يمكن أن تؤدي بالعلماء إلى استخلاص استنتاجات حازمة من أرضية مهتزة.
لقد طور فريق من الإحصائيين في جامعة رايس طريقة جديدة لإصلاح هذه الرياضيات المكسورة. لقد ركزوا تحديدًا على السيناريو الذي يُستخدم فيه "معيار أكايكي للمعلومات" لاختيار أفضل مجموعة فرعية من المتغيرات من قائمة كبيرة. وبدلاً من تجاهل حقيقة أن النموذج قد تم اختياره من البيانات، فإن طريقتهم الجديدة تبني عدم اليقين مباشرة داخل الحسابات. لقد اكتشفوا أن عملية اختيار النموذج تخلق شكلاً محددًا وقابلًا للقياس في سلوك البيانات. تخيل القيم المحتملة لنتيجة ما كخط طويل؛ عملية الاختيار تعمل فعليًا على قطع أجزاء معينة من ذلك الخط، تاركةً فقط مقاطع محددة حيث يمكن أن تكون النتيجة قد استقرت. ومن خلال فهم الأجزاء التي تم قطعها بالضبط، يمكن للباحثين إعادة بناء التوزيع الاحتمالي الصحيح للنتيجة. وهذا يسمح لهم بحساب القيم الاحتمالية (p-values) وفترات الثقة التي تكون صالحة رياضيًا، حتى بعد اختيار النموذج.
أثبت الباحثون أن هذا النهج الجديد يعمل من خلال إجراء آلاف عمليات المحاكاة الحاسوبية. في هذه الاختبارات، قاموا بتوليد بيانات حيث يعرفون الحقيقة مسبقًا. وعندما استخدموا الطرق القديمة والقياسية، فشلت فترات الثقة في احتواء الإجابة الحقيقية في كثير من الأحيان أكثر مما ينبغي، وأعلنت الاختبارات عن إشارات كاذبة كأنها اكتشافات حقيقية بمعدل يقترب من أربعين بالمائة بدلاً من النسبة المستهدفة وهي خمسة بالمائة. في المقابل، أعادت طريقتهم المصححة الجديدة معدلات الخطأ إلى مستوياتها الصحيحة. وكانت فترات الثقة التي أنتجوها أوسع وأكثر صدقًا، حيث تعكس بدقة عدم اليقين الناتج عن عملية الاختيار. هذا التصحيح مهم بشكل خاص عندما يتبين أن النموذج المختار هو المجموعة الكاملة من المتغيرات، وهو موقف تقع فيه الطرق القديمة في الخطأ بشكل مفاجئ.
ولإظهار نجاح ذلك في العالم الحقيقي، طبق الفريق طريقتهم على مجموعة بيانات كلاسيكية حول الاستهلاك الشخصي في الولايات المتحدة، تمتد من عام 1970 إلى عام 2016. تضمنت هذه البيانات أربعة متغيرات محتملة للتنبؤ: الدخل الشخصي المتاح، والإنتاج الصناعي، والمدخرات، ومعدل البطالة. عندما قامت البرمجيات القياسية بتشغيل التحليل، اختارت النموذج الكامل الذي يحتوي على المتغيرات الأربعة جميعها. ثم أعلن الاختبار الإحصائي التقليدي أن الإنتاج الصناعي كان متنبئًا مهمًا للإنفاق، مع فترة ثقة لا تشمل الصفر. ومع ذلك، عندما طبق الباحثون تصحيحهم الجديد، تغيرت الصورة. أظهر التحليل المصحح أن الأدلة على أهمية الإنتاج الصناعي لم تكن قوية بما يكفي لاستبعاد الصدفة؛ إذ أصبحت فترة الثقة الخاصة به الآن تشمل الصفر، مما يعني أنه لم يعد ذا دلالة إحصائية. وتوافقت النتائج المصححة تمامًا مع درجات الاختيار الأصلية، والتي كانت قد أشارت بالفعل إلى أن الدخل والمدخرات هما العاملان المهيمنان بينما كان الإنتاج أقل أهمية.
كما عالج الفريق تحديًا ثانيًا أكثر صعوبة: ماذا يحدث عندما يكون مقدار الضجيج أو الخطأ في البيانات غير معروف، وهو أمر شائع جدًا في الحياة الواقعية؟ الممارسة القياسية هي تخمين مستوى الضجيج ووضع هذا التخمين في الصيغة، لكن الباحثين وجدوا أن هذا الاختصار يمكن أن يظل يؤدي إلى تضخم معدلات الخطأ في مجموعات البيانات الصغيرة. ولحل ذلك، طوروا تقنية تعتمد على الحوسبة المكثفة تقوم بمحاكاة عملية الاختيار آلاف المرات لبناء خريطة مخصصة للاحتمالات. وبينما يتطلب هذا قدرة حوسبية أكبر، إلا أنه يضمن بقاء الاستنتاجات صالحة حتى عندما يكون مستوى الضجيج غير معروف. إن عملهم يثبت أنه من خلال الاعتراف بواقع كيفية اختيار النماذج، يمكن للعلماء تجنب فخ الثقة الزائفة والوصول إلى نتائج سليمة إحصائيًا ومتسقة مع الأدلة.
ملخص تقني: الاستدلال الصالح لنموذذج الانحدار باستخدام اختيار أفضل مجموعة فرعية
بيان المشكلة يُعد "اختيار أفضل مجموعة فرعية" (Best subset selection) تقنية قياسية لاختيار المتغيرات في البرمجيات الإحصائية والممارسة العلمية، وغالباً ما تستخدم معايير مثل "معيار أكايكي للمعلومات" (AIC). ومع ذلك، فإن إجراءات الاستدلال الكلاسيكية (فترات الثقة والقيم الاحتمية p-values) المطبقة بعد اختيار النموذج تفشل في تحقيق ضماناتها التكرارية الاسمية. ينبع هذا الفشل من كون الطرق القياسية تتجاهل العشوائية المتأصلة في خطوة الاختيار، مما يؤدي إلى سوء معايرة معدلات الخطأ من النوع الأول (Type I error) ونقص في تغطية فترات الثقة. وبينما تناولت الأدبيات الحديثة الاستدلال ما بعد الاختيار لطرق مثل "اللاسو" (Lasso) والانحدار التدريجي الأمامي (Forward stepwise regression)، فإن الاستدلال الدقيق في العينات المحدودة لاختيار أفضل مجموعة فرعية يظل أمراً صعباً بسبب الهندسة المعقدة لحدث الاختيار. علاوة على ذلك، تعتمد الطرق الموجودة غالباً على "التكييف المفرط" (Excessive conditioning) (مثل التكييف على إشارات المتغيرات المختارة)، مما يؤدي إلى توسيع الفترات بشكل غير ضروري، أو أنها تفشل في تقديم استدلال صالح عندما يكون مستوى الضجيج (σ) غير معروف في العينات الصغيرة.
المنهجية يطور المؤلفون إطار عمل للاستدلال الدقيق في العينات المحدودة مشروطاً بحدث اختيار AIC.
توصيف حدث الاختيار: المساهمة النظرية الجوهرية هي التوصيف الهندسي للحدث {AIC selects S0}. من خلال تفكيك متجه الاستجابة Y إلى مكون يتناسب مع مُقدّر المصلحة (ηTY) ومكون متعامد (z)، يوضح المؤلفون أن المقارنة الزوجية {AIC(S0)<AIC(S)} تترجم إلى متباينة تربيعية في ηTY. وبناءً على ذلك، يتم توصيف حدث الاختيار كunion (اتحاد) لعدد منتهٍ من الفترات على الخط الحقيقي. هذه الهندسة تختلف عن المجموعات متعددة الأوجه (Polyhedral sets) المرتبطة بطريقة "اللاسو".
الاستدلال الشرطي الدقيق (عند معرفة التباين): بالاستفادة من هندسة اتحاد الفترات، يستنتج المؤلفون التوزيع العيني الشرطي للكمية المحورية ηTY بشرط حدث الاختيار. هذا التوزيع هو توزيع طبيعي مقطوع (Truncated normal distribution) فوق اتحاد الفترات. وباستخدام هذا المحور (Pivot)، يقومون ببناء قيم p وفترات ثقة تضمن معدل الخطأ من النوع الأول الاسمي واحتمالية التغطية مشروطة بالنموذج المختار. وثمة تبسيط رئيسي تم تحديده: المقارنات بين النموذج المختار S0 والمجموعات الفائقة له لا تؤثر على التوزيع الشرطي لـ ηTY، مما يسمح بتجاهل هذه القيود لتقليل العبء الحسابي دون التضحية بالصلاحية.
الاستدلال مع تباين غير معروف: عندما يكون σ غير معروف، يمكن لمقدرات "التعويض المباشر" (Plug-in estimators) أن تضخم الخطأ من النوع الأول في العينات المحدودة لأنها لا تأخذ في الاعتبار تماماً عدم اليقين الناتج عن كل من اختيار النموذج وتقدير التباين. ولمعالجة ذلك، يقترح المؤلفون إجراء استدلال انتقائي قائم على "مونت كارلو" (Monte Carlo) بناءً على إطار النموذج الانتقائي (Fithian et al., 2015, 2017). تقوم هذه الطريقة بالتكييف على حدث الاختيار وعلى نصف قطر متجه الاستجابة بالنسبة للمتوسط الصفري، وتوليد عينات عبر طريقة "القبول والرفض" لمونت كارلو (أو MCMC بنظام hit-and-run) لتقريب التوزيع الصفري. يتجنب هذا النهج الفقد الشديد للمعلومات المرتبط بالتكييف على المكمل المتعامد الكامل في إطار النموذج المشبع.
المعلمات المستهدفة: تنطبق المنهجية على التجميعات الخطية للمعاملات في النموذج المختار، بما في ذلك معاملات الانحدار الفردية ومتوسط الاستجابة عند نقاط بيانات جديدة. كما يستوعب إطار العمل عدم ملاءمة النموذج (Model misspecification) من خلال معاملة الهدف كمعلمة متحركة (الدالة الوظيفية المربعة الصغرى للنموذج المختار) بدلاً من افتراض أن النموذج المختار هو عملية توليد البيانات الحقيقية.
النتائج الرئيسية
الرؤية الهندسية: حدث الاختيار لاختيار أفضل مجموعة فرعية عبر AIC هو اتحاد لعدد منتهٍ من الفترات، مما يتيح التكييف الدقيق دون الحاجة إلى قيود إضافية (مثل الإشارات) التي تعيب طرق الاستدلال الانتقائي الأخرى.
أداء المحاكاة:
التغطية: في عمليات المحاكاة مع تباين معلوم، تحقق الفترات المصححة المقترحة تغطية قريبة من الاسمية (0.947 مقابل 0.894 للفترات غير المصححة).
الخطأ من النوع الأول: في العينات الصغيرة مع تباين غير معروف، تظهر الطرق غير المصححة تضخماً شديداً في الخطأ من النوع الأول (يصل إلى 28%). اختبارات النموذج المشبع ذات التعويض المباشر تقلل هذا التضخم ولكنها لا تزال تظهره (10%). أما اختبار مونت كارلو الانتقائي المقترح فيحافظ على الخطأ من النوع الأول قريباً من المستوى الاسمي (6%).
القوة (Power): يُظهر الاختبار الانتقائي قوة أعلى قليلاً من الاختبار المشبع مع زيادة قوة الإشارة، وهو ما يتوافق مع الفائدة النظرية للتكييف على معلومات أقل.
تطبيق على بيانات حقيقية: عند تطبيق الطريقة على مجموعة بيانات الاستهلاك في الولايات المتحدة حيث اختار AIC النموذج الكامل، أدت الطريقة المقترحة إلى استنتاجات مختلفة عن الاستدلال التقليدي. وتحديداً، المتغير "الإنتاج" (Production)، الذي بدا هاماً في التحليل غير المصحح، أصبح غير هام بعد التصحيح. هذه النتيجة تتماشى بشكل أفضل مع الأدلة التجريبية المقدمة من قيم AIC، والتي فضلت بقوة النماذج التي تحتوي على "الدخل" (Income) و"الادخار" (Savings) على تلك التي تستبعدهما.
الأهمية والادعاءات يزعم البحث تقديم أول إجراءات استدلال دقيقة في العينات المحدودة لاختيار أفضل مجموعة فرعية بناءً على AIC. وتكمن أهميته الأساسية في:
الدقة (Exactness): توفير قيم p وفترات ثقة صالحة مع ضمان التغطية في العينات المحدودة، وتجنب التقريبات التقاربية للأعمال السابقة.
الكفاءة: تسمح الهندسة الفترية بالتكييف الدقيق دون "التكييف المفرط" الذي يؤدي إلى فترات واسعة بشكل غير ضروري في طرق الاستدلال الانتقائي الأخرى.
المتانة (Robustness): يوفر إطار عمل مونت كارلو المقترح حلاً للتباين غير المعروف يتحكم في الخطأ من النوع الأول في العينات الصغيرة، وهو ضعف معروف في مناهج التعويض المباشر.
العمومية: المنهجية قابلة للتطبيق على معايير المعلومات الأخرى (مثل BIC، وAICc، وMallows' Cp) عن طريق تعديل حد الجزاء ω(S)، وتمتد لتشمل التجميعات الخطية للمعاملات في ظل عدم ملاءمة النموذج.
يخلص المؤلفون إلى أنه بينما يعد نهج مونت كارلو أكثر تطلباً من الناحية الحسابية من مناهج التعويض المباشر، إلا أنه ضروري للاستدلال الصالح في العينات الصغيرة مع تباين غير معروف. يعمل هذا العمل على سد الفجوة بين الجدوى الحسابية لاختيار أفضل مجموعة فرعية والصرامة الإحصائية المطلوبة للاستدلال العلمي الصحيح.