Incremental Predictive Value of Item-Adjusted Process Indicators for Mathematics Achievement among Korean Students in PISA 2022: A School-Level Out-of-Sample Validation Study
تُظهر هذه الدراسة أن مؤشرات العمليات المعدلة حسب الفقرات والمستمدة من التقييمات القائمة على الكمبيوتر تُحسن بشكل كبير التنبؤ بالتحصيل في الرياضيات بين الطلاب الكوريين في برنامج التقييم الدولي للطلاب (PISA) لعام 2022 بما يتجاوز بيانات الاستبيان التقليدية، حتى في ظل تصميم صارم للتحقق من صحة النموذج خارج العينة على مستوى المدرسة.
في كل عام، يخوض الملايين من المراهقين في سن الخامسة عشرة حول العالم اختباراً ضخماً يسمى "بيزا" (PISA)، وهو مصمم لمعرفة مدى قدرة الطلاب على استخدام ما يعرفونه في مواقف من واقع الحياة. وفي الجزء الخاص بالرياضيات من هذا الاختبار، يجلس الطلاب أمام جهاز كمبيوتر لحل المسائل. وبينما تخبرنا الدرجة النهائية بعدد الأسئلة التي أجابوا عليها بشكل صحيح، يقوم الكمبيوتر أيضاً بتسجيل طبقة خفية من البيانات: بالضبط كم من الوقت قضوه في كل مسألة، وكم عدد المرات التي نقروا فيها، وكم مرة عادوا لتغيير إجابة ما. ولسنوات، تساءل الباحثون عما إذا كانت هذه الآثار الرقمية للسلوك يمكن أن تخبرنا بشيء عن قدرة الطالب لا يمكن للاستبيان البسيط أن يفعله. نحن نعلم أن سؤال الطلاب عن ثقتهم، وقلقهم، وبيئتهم المدرسية يعطينا صورة جيدة عن إمكاناتهم، لكننا نعلم أيضاً أن ما يقول الطالب إنه يفعله وما يفعله بالفعل أثناء حل مسألة ما قد يكون مختلفين تماماً. والسؤال الكبير هو ما إذا كان السجل الخام وغير المفلتر لتفاعل الطالب مع الاختبار يضيف أي معلومات جديدة ومفيدة بمجرد أن نكون قد سألناهم بالفعل عن خلفياتهم ومشاعرهم.
لقد شرع باحث في كوريا الجنوبية في الإجابة على هذا السؤال باستخدام نهج دقيق للغاية، مستخدماً بيانات أكثر من 6,000 طالب خاضوا اختبار الرياضيات لعام 2022. بدأ ببناء نموذج أساسي قوي باستخدام المعلومات التي قدمها الطلاب في استطلاع رأي فقط. وقد غطى هذا الاستطلاع مجموعة واسعة من المواضيع، بما في ذلك الوضع الاقتصادي لعائلاتهم، ومدى إيمانهم بمهاراتهم الرياضية، ومدى شعورهم بالقلق، ومدى حبهم للمدرسة، ونوع المسائل الرياضية التي شاهدوها في الفصل. أثبتت بيانات الاستطلاع هذه وحدها أنها مؤشر قوي لدرجات الطلاب النهائية. وعندما نظر الباحث في سجلات الكمبيوتر لكيفية عمل الطلاب فعلياً خلال الاختبار — أي الوقت الذي استغرقوه وعدد الإجراءات التي قاموا بها — وجد أن هذه البيانات السلوكية كانت مفيدة أيضاً، لكنها لم تكن بدقة بيانات الاستطلاع. فكانت مشاعر الطلاب المعلنة وخلفياتهم وظروفهم أفضل ببساطة في التنبؤ بدرجاتهم النهائية من مجرد عد خام للنقرات والثواني المستغرقة.
ومع ذلك، تغيرت القصة عندما نظر الباحث في كيفية عمل هذين النوعين من المعلومات معاً. كان التحدي يكمن في أن سجلات الكمبيوتر كانت غير منظمة؛ فقد يعني قضاء وقت طويل في مسألة ما أن الطالب كان يعاني، أو قد يعني ببساطة أن تلك المسألة تحديداً كانت أصعب من غيرها. ولإصلاح ذلك، قام الباحث بتعديل البيانات بحيث تتم مقارنة وقت وإجراءات كل طالب بالطلاب الآخرين الذين واجهوا نفس المسألة تماماً. أدى هذا إلى إزالة تأثير تصميم الاختبار نفسه ولم يتبق سوى سلوك الطالب النسبي. وعندما أضاف الباحث هذه المؤشرات السلوكية المعدلة إلى نموذج الاستطلاع، تحسن التنبؤ بدرجات الطلاب في الرياضيات بشكل ملحوظ. فقد جعل النموذج المشترك الأخطاء أقل بنحو 11 نقطة في مقياس الاختبار مقارنة بنموذج الاستطلاع وحده. وكان هذا التحسن ثابتاً عبر خوارزميات حاسوبية مختلفة، وظل قائماً حتى عندما اختبر الباحث النموذج على مدارس جديدة تماماً على النظام، مما يعني أن النموذج يمكنه التنبؤ بأداء الطلاب الذين لم يسبق له رؤيتهم من قبل.
لقد كان الباحث حريصاً على توضيح ما يعنيه هذا التحسن وما لا يعنيه. فقد أكد أن البيانات السلوكية لم تثبت أن قضاء المزيد من الوقت أو النقر على المزيد من الأزرار يتسبب في حصول الطالب على درجة أفضل. بدلاً من ذلك، أظهرت الدراسة أن السجل الرقمي لجهد الطالب واستراتيجيته يحتوي على أدلة إضافية حول قدراته لا يمكن التقاطها من خلال سؤالهم. كما نفت الدراسة فكرة أن هذا التحسن كان مجرد نتيجة لشكل الاختبار. فمن خلال تعديل البيانات لمراعاة صعوبة كل مسألة، أظهروا أن القيمة تأتي من سلوك الطالب الفعلي، وليس من حقيقة أن الاختبار الحاسوبي قد وجه بعض الطلاب إلى أسئلة أصعب أو أسهل. وتشير النتائج إلى أنه في الاختبارات واسعة النطاق، فإن الطريقة التي يتفاعل بها الطالب مع الكمبيوتر هي مكمل قيم لما يخبروننا به عن أنفسهم، مما يقدم صورة أوضح وأكثر اكتمالاً لقدراتهم الرياضية.
ملخص تقني: القيمة التنبؤية المتزايدة لمؤشرات العمليات المعدلة حسب الفقرات في التحصيل في الرياضيات
بيان المشكلة تنتج التقييمات القائمة على الحاسوب، مثل دراسة PISA 2022، بيانات عمليات (مثل زمن الاستجابة، وعدد الإجراءات) تقدم أدلة سلوكية ملحوظة تختلف عن الدرجات النهائية والتقارير الذاتية. ومع ذلك، فإن مقاييس العمليات الخام تكون مشوشة بصعوبة الفقرة، وتصميم الاختبار، والتوجيه التكيفي؛ إذ قد يشير زمن محدد أو عدد إجراءات معين إلى سلوكيات مختلفة اعتماداً على سياق الفقرة. علاوة على ذلك، استخدمت الدراسات السابقة غالباً تقسيمات عشوائية على مستوى الطالب للتحقق من الصحة، مما ينطوي على خطر تسرب البيانات في الهياكل البيانية الهرمية حيث يتشارك الطلاب من نفس المدرسة خصائص غير ملاحظة. هناك حاجة لتحديد ما إذا كانت مؤشرات العمليات تحتفظ بقيمتها التنبؤية بعد التعديل الصارم على مستوى الفقرة وعند تقييمها مقابل خط أساس استبيان قوي ومحدد مسبقاً ضمن تصميم تحقق صارم خارج العينة على مستوى المدرسة.
المنهجية حللت الدراسة 6,038 طالباً كوريًا من 186 مدرسة من مشاركي PISA 2022. كانت النتائج هي القيم الممكنة العشرة للرياضيات (PV1MATH–PV10MATH)، والتي تمثل توزيع الكفاءة.
كتل المتنبئات:
Q-extended (الموسع بالاستبيان): كتلة محددة مسبقاً من 11 متغيراً استبيانياً تغطي الظروف المسبقة (الجنس، ESCS)، والاستعداد/العاطفة (الكفاءة الذاتية، القلق، المثابرة)، والخبرة (الألفة مع المفاهيم)، والسياق/الفرصة (الانتماء المدرسي، دعم المعلم، المناخ الانضباطي، التعرض للمهام).
P-adjusted (المعدل بالعمليات): خمسة مؤشرات على مستوى الطالب مستمدة من متغيرات العمليات العامة على مستوى الفقرة (إجمالي زمن الاستجابة، الوقت حتى أول إجراء، عدد الإجراءات، عدد الزيارات، عدد الزيارات القصيرة). تم تحويل هذه المتغيرات باستخدام تحويل لوغاريتمي وتنميط قوي خاص بالفقرة (التوسيط والقياس باستخدام الوسيط والمدى الربيعي/1.349) والذي حُسب فقط ضمن طية التدريب. هدف هذا التعديل إلى إزالة الاختلافات في الموقع والانتشار على مستوى الفقرة قبل التجميع.
تصميم التحقق: تم استخدام التحقق المتقاطع المتداخل على مستوى المدرسة. تم تقسيم الـ 186 مدرسة إلى خمس طيات خارجية، كُررت ثلاث مرات بتعيينات مختلفة. تم تدريب النماذج على أربع طيات وتقييمها على المدارس المستبعدة. ومن الأهمية بمكان أن جميع عمليات المعالجة المسبقة (التعويض، تعديل الفقرات) وضبط المعلمات الفائقة (عبر التحقق المتقاطع الداخلي) تمت حصرياً داخل بيانات التدريب الخارجية لمنع تسرب المعلومات.
النماذج: استُخدم الانحدار الخطي الموزون كمعيار مرجعي. كما تمت مقارنة ثلاثة خوارزميات أشجار تجميعية (الغابة العشوائية Random Forest، وXGBoost، وLightGBM). استخدمت جميع النماذج أوزان الطلاب النهائية وأوزان تكرار Fay-BRR لمراعاة التصميم المسحي المعقد وعدم يقين القيمة الممكنة.
المقاييس: تم قياس الأداء عبر جذر متوسط مربع الخطأ الموزون (RMSE)، ومتوسط الخطأ المطلق (MAE)، ومعامل التحديد (R2). تم تقييم القيمة المتزايدة من خلال مقارنة النموذج المشترك (Q-extended + P-adjusted) مع نموذج الاستبيان فقط (Q-extended).
النتائج الرئيسية
أداء خط الأساس: تفوق نموذج الاستبيان فقط (Q-extended) باستمرار على نموذج العمليات فقط (P-adjusted) عبر جميع الخوارزميات. بالنسبة لـ XGBoost، حقق Q-extended معامل تحديد (R2) قدره .426، بينما حقق P-adjusted قيمة .356.
القيمة التنبؤية المتزايدة: أدت إضافة كتلة العمليات المعدلة حسب الفقرة إلى نموذج الاستبيان إلى تحسينات جوهرية.
خفض RMSE: انخفض بمقدار 11.25 إلى 11.72 نقطة في درجات PISA عبر خوارزميات التجميع.
زيادة R2: زادت بمقدار .151 إلى .159.
الاتساق: كان اتجاه التحسن متطابقاً في جميع المقارنات الـ 90 (3 خوارزميات × 3 تكرارات × 10 قيم ممكنة).
الدلالة الإحصائية: استبعدت فترات الثقة 95% المعدلة حسب التصميم والقيمة الممكنة الصفر (على سبيل المثال، تحسن RMSE في XGBoost: 11.32 [9.76, 12.88]).
المتانة: لوحظت تحسينات مماثلة في نموذج الانحدار الخطي الموزون المرجعي (خفض RMSE بمقدار 11.25)، مما يشير إلى أن المكسب لم يكن نتاجاً لخصائص غير خطية في مجموعات الأشجار. أكدت تحليلات الحساسية أن النتائج ظلت ثابتة بالنسبة لمسار الاختبار الخطي فقط، والحالات الكاملة، وخطوط الاستبيان الموسعة، والمعلمات الفائقة الثابتة.
تأثير تعديل الفقرة: أعطت متغيرات العمليات غير المعدلة أداءً تنبؤياً خاماً أعلى (R2 = .440 لـ P-raw) من المتغيرات المعدلة (R2 = .356 لـ P-adjusted). ومع ذلك، يشير المؤلف إلى أن القيم الخام من المحتمل أنها التقطت إشارات مسار الاختبار والتعرض للفقرات، بينما قدمت القيم المعدلة تقديراً أكثر تحفظاً لسلوك الطلاب القابل للمقارنة.
الأهمية والادعاءات يدعي البحث أن مؤشرات العمليات المعدلة حسب الفقرة توفر معلومات تنبؤية متزايدة خارج العينة للتحصيل في الرياضيات تتجاوز نموذج الاستبيان الواسع والمحدد مسبقاً. وتثبت الدراسة أن هذه القيمة تستمر حتى في ظل تصميم تحقق صارم يأخذ في الاعتبار التكتل على مستوى المدرسة، وأوزان المسح، وعدم يقين القيمة الممكنة.
يصرح المؤلف صراحةً بأن هذه النتائج:
لا تثبت السببية: الدراسة تنبؤية وليست سببية؛ فالتحسين في التنبؤ لا يعني أن التلاعب بأزمنة الاستجابة أو الإجراءات سيغير التحصيل.
لا تتحقق من البناءات النفسية: المؤشرات لا تُثبت أنها تقيس الجهد أو الاستراتيجية أو الاندماج بشكل مباشر؛ بل هي أدلة سلوكية تكميلية.
مشروطة: النتائج خاصة بعينة PISA 2022 الكورية مع بيانات العمليات المرصودة وخط أساس الاستبيان المحدد المستخدم.
تدعم الاستخدام التكميلي: يجب النظر إلى بيانات العمليات كملحق لمعلومات الاستبيان المحددة جيداً وليس كبديل لها، خاصة عند تقييمها باستخدام تحقق صارم مضبوط التسرب.
تضع هذه الدراسة نفسها كدراسة منهجية تكميلية للبحث الكوري السابق (Woo & Choi, 2025)، حيث قامت بتنقيح الأدلة من خلال إدخال تعديلات على مستوى الفقرة وإطار تحقق أكثر تحفظاً لضمان أن القيمة التنبؤية ليست مجرد نتاج لتصميم الاختبار أو تسرب البيانات.