Auditing Frozen Time-Series Foundation Models Under Informative Context Missingness
تقدم هذه الورقة تدقيقاً مسجلاً مسبقاً يكشف أنه بينما يعد التكيف المتوازن في الآلية أقل ضرراً من التكيف متوسط المخاطر لنماذج التأسيس للسلاسل الزمنية المجمدة في ظل وجود فقدان معلوماتي، فإن جميع أهداف التكيف المتعلم تؤدي بشكل أسوأ بكثير من مجرد ترك النماذج دون تكيف، مما يجعل المقارنات بين استراتيجيات التكيف غير قابلة للتفسير دون مرجع صريح لعدم التكيف.
في عالم علم البيانات، هناك اعتقاد متزايد بأن النماذج الحاسوبية الضخمة والمدربة مسبقاً يمكنها التنبؤ بمستقبل أي شيء تقريباً يتغير بمرور الوقت، من استهلاك الكهرباء إلى أسعار الأسهم. هذه النماذج تشبه مكتبات هائلة من الأنماط، التي تدربت على كميات ضخمة من التاريخ لكي تتمكن من التعرف على الاتجاهات دون الحاجة إلى تعلمها من الصفر لكل مهمة جديدة. ومع ذلك، في العالم الحقيقي، نادراً ما يكون التاريخ مثالياً. فالمستشعرات تتعطل، والتقارير تصل متأخرة، والبيانات تضيع. وعندما يُطلب من نموذج ما تقديم تنبؤ بناءً على تاريخ مكسور أو غير مكتمل، فإن القطع المفقودة غالباً لا تكون عشوائية؛ بل تحدث لسبب ما. فقد يتوقف مستشعر عن العمل لأن آلة ما ترتفع حرارتها، أو قد يتأخر تقرير لأن شحنة ما عالقة في مكان ما. وهذا يعني أن نمط ما هو مفقود يحتوي في الواقع على أدلة حول ما يحدث. التحدي الذي يواجه العلماء هو معرفة كيفية تعليم هذه النماذج القوية والمجمدة الانتباه إلى تلك الأدلة دون كسر قدرتها على التنبؤ.
وضع باحث فكرة محددة للاختبار: هل يمكنهم تحسين هذه النماذج من خلال تعليمها معاملة أنواع مختلفة من البيانات المفقودة بأهمية متساوية؟ تخيل طالباً يدرس عادةً عن طريق أخذ متوسط ملاحظاته. تساءل الباحث عما إذا كان هذا الطالب سيؤدي بشكل أفضل إذا أجبر نفسه على دراسة كل نوع من الملاحظات الصعبة بالتساوي، بدلاً من التركيز فقط على الأنواع الأكثر شيوعاً. ولاختبار ذلك، أخذ اثنين من أكثر نماذج التنبؤ تقدماً المتاحة وأبقى "عقولهما" الجوهرية مجمدة تماماً، مما يعني أنها لا تستطيع تعلم أي شيء جديد. وبدلاً من ذلك، قام بتثبيت طبقة صغيرة قابلة للتعديل حولهما — محول (adapter) صغير — ودرب هذه الطبقة على التعامل مع البيانات المفقودة. واختبر هذا الإعداد عبر اثني عشر مجموعة بيانات مختلفة من العالم الحقيقي، تتراوح من شبكات الطاقة إلى أنماط الطقس، وأدخل بيانات مفقودة بأربع طرق متميزة: بعضها عشوائي، وبعضها يعتمد على القيم الماضية، وبعضها يتجمع في نوبات.
قارن الباحث أولاً طريقة التدريب القائمة على "الانتباه المتساوي" بطريقة "المتوسط" القياسية. في هذا الاختبار المباشر المحدد، حققت طريقة الانتباه المتساوي بالفعل نتائج أفضل قليلاً لأحد النماذج وأظهرت اتجاهاً واعداً للآخر. بدا الأمر، للوهلة الأولى، أن استراتيجية التدريب الجديدة كانت ناجحة. ومع ذلك، فقد صُممت الدراسة للنظر بعمق أكبر من مجرد مقارنة متغيرين لنفس الفكرة. كما سجل الباحث مقارنة ثالثة وحاسمة: ماذا يحدث إذا استخدمت النموذج الأصلي المجمد دون أي محول على الإطلاق؟ كان هذا هو مجموعة التحكم، وهو خط الأساس المتمثل في "عدم فعل شيء". وعندما أجرى هذا المقارنة، كانت النتائج مذهلة. فكل نسخة من المحول الجديد، بما في ذلك النسخة التي فازت للتو في الاختبار المباشر، أدت أداءً أسوأ من مجرد ترك النموذج كما هو. التعديلات الصغيرة التي أجرتها المحولات أربكت النماذج، مما أدى إلى تنبؤات أقل دقة مما لو لم تكن المحولات قد أضيفت أصلاً.
تعمق الباحث أكثر لفهم سبب ظهور النتائج بشكل مختلف اعتماداً على أي مقارنة يتم إجراؤها. واكتشف أن إحدى مجموعات البيانات الاثنتي عشرة التي استخدمها كانت تتصرف بشكل مختلف تماماً عن البقية. هذه المجموعة، التي تتبع حالات الوفاة خلال جائحة، شهدت ارتفاعاً هائلاً في القيم خلال فترة الاختبار لم يكن موجوداً في فترة التدريب. ولأن النماذج صُممت لضبط قيمها (normalization) بناءً على بيانات التدريب، انتهى الأمر بهذه المجموعة الواحدة بوزن يعادل أربعين ضعف أي مجموعة بيانات أخرى في المتوسط النهائي. لقد كانت تشوه النتيجة بأكملها، مما جعل المحولات تبدو وكأنها تفشل بشكل ذريع عند مقارنتها بطريقة تعويض (imputation) بسيطة، وجعل نهج "عدم فعل شيء" يبدو قوياً بشكل مفاجئ. وعندما أزال الباحث هذه المجموعة الشاذة الواحدة وأعاد تشغيل الأرقام، اتضحت الصورة: كانت المحولات باستمرار أسوأ من النموذج المجمد في جميع الحالات.
تخلص الدراسة إلى أنه بينما أظهرت طريقة التدريب المحددة المتمثلة في موازنة أنواع مختلفة من البيانات المفقودة ميزة صغيرة على الطريقة القياسية، إلا أنها كانت ميزة فقط في سباق بين استراتيجيتين خاسرتين. إن النتيجة الحقيقية كانت أن التدخل نفسه كان ضاراً. وأفضل طريقة للتعامل مع البيانات غير المكتملة، وفقاً لهذا التدقيق، هي ترك النموذج القوي والمدرب مسبقاً كما هو تماماً، بدلاً من محاولة ضبطه باستخدام محول صغير. ويؤكد الباحث أن هذا لا يعني أن المحولات لن تنجح أب الله، ولكن في هذا السياق المحدد، كانت تكلفة التعديل تفوق الفائدة. كما سلط الضوء على درس حاسم للمجال: عند تقييم الأساليب الجديدة، يجب على العلماء دائماً المقارنة مع خط أساس "عدم فعل شيء". فبدون ذلك المرتكز، من السهل إعلان فائز بين متغيرين لتقنية ما، لتدرك لاحقاً أن كليهما أدنى من النهج الأصلي. وتعمل الدراسة كفحص صارم للحماس لإضافة طبقات إلى النماذج المعقدة، مظهرة أن الأداة الأكثر فعالية أحياناً هي الأداة التي تمتلكها بالفعل.
ملخص تقني: تدقيق النماذج التأسيسية للسلاسل الزمنية المجمدة في ظل فقدان السياق المعلوماتي
بيان المشكلة تُقيّم نماذج السلالس الزمنية التأسيسية (مثل Chronos وTimesFM) عادةً بناءً على سياقات تاريخية كاملة. ومع ذلك، في البيئات التشغيلية، غالبًا ما تكون البيانات غير مكتملة بسبب انقطاع أجهزة الاستشعار، أو تأخر التقارير، أو التسجيل المرتبط بالأحداث. والأهم من ذلك، أن هذا الفقدان غالبًا ما يكون "معلوماتيًا" (مرتبطًا بالعملية الأساسية) وليس عشوائيًا. السؤال المركزي الذي تعالجه الدراسة هو ما إذا كان تزويد نموذج تأسيسي مجمد بمحول (adapter) عالمي صغير، يتم تدريبه باستخدام منهج متوازن الآليات، سيؤدي إلى تحسين التنبؤات الاحتمالية تحت ظروف الفقد المعلوماتي مقارنةً بالتكيف القائم على متوسط المخاطر القياسي.
المنهجية تستخدم الدراسة بروتوكول تدقيق مسجل مسبقًا مصمم لعزل تأثير تدخلات التكيف عن القدرات الجوهرية للنموذج الأساسي (backbone).
الإعداد التجريبي: يغطي التدقيق 12 مجموعة بيانات (48 سلسلة) عبر مجالات متنوعة (اقتصاد، طاقة، رعاية صحية، إلخ) مع طول سياق L=80 وأفق تنبؤ H=24. تم اختبار نموذجين أساسيين مجمدين: Chronos-T5-small و TimesFM 2.5.
آليات الفقد: يميز البروتوكول بين معدلات الفقد (10%,20%,40%) والآليات. تشمل أقنعة التدريب (training masks) كل من MCAR (فقد عشوائي تمامًا)، وMAR (فقد مرتبط بالتاريخ الملحوظ)، والانفجارات الهندسية (geometric bursts). ومن الناحية الحاسمة، تم حجز "أقنعة الاختبار" (test masks) بعيدًا عن بنك التدريب، وهي تشمل عائلات "معلوماتية" (دورية ومتوافقة مع الأحداث) لم تدخل أبدًا في عملية ضبط المحول، مما يضمن تقييمًا خارج نطاق التوزيع (out-of-distribution).
أهداف التكيف: يتم تدريب محول عالمي لتقليل الخسارة. المقارنة الأساسية هي بين:
التكيف المتوسط (Average Adaptation): يقلل من خسارة التدريب المجمعة.
التكيف المتوازن الآليات (Mechanism-Balanced Adaptation): يعطي وزنًا متساويًا لكل فئة آلية (MCAR، MAR، Burst) في المنهج الدراسي. أهداف ثانوية تشمل: Group DRO، وCVaR، والتكيف القائم على MCAR فقط.
مرساة "عدم التكيف" (The No-Adaptation Anchor): مكون حاسم في البروتوكول هو النموذج الأساسي المجمد الذي يُطبق مباشرة على السياق غير المكتمل دون أي محول. يعمل هذا كخط أساس لتحديد ما إذا كان أي تدخل مفيدًا، أم أننا نقارن فقط بين أفضل التدخلات.
الاستدلال والمقاييس:
المقياس الأساسي: درجة الفترة المعيارية (Normalized Interval Score) (عند فقد بنسبة 20%)، والتي تقيم معًا حدة التنبؤ ودقته (sharpness and calibration).
الهيكل الإحصائي: يحترم الاستدلال الهيكل المتداخل (مجموعة بيانات ← سلسلة ← أصل). تستخدم الدراسة "بوتستراب هرمي" واختبار تبديل إشارة (sign-flip permutation test) دقيق على مستوى العنقود (عبر تعداد جميع احتمالات 212 لتوزيع الإشارات) لتجنب تضخم الدقة عبر معاملة الآفاق أو الأصول ككيانات مستقلة.
تدقيق المعايرة (Normalization Audit): تدقق الدراسة صراحةً في صحة مقام المعايرة لكل سلسلة، وتتحقق مما إذا كان بادئة التدريب (training prefix) تمثل فترة الاختبار.
النتائج الرئيسية
التباين التأكيدي (المتوازن مقابل المتوسط):
أداء التكيف المتوازن الآليات يتفوق على التكيف القائم على متوسط المخاطر.
بالنسبة لـ TimesFM 2.5، كان التحسن ذا دلالة إحصائية (Holm-adjusted p=0.0020، التأثير $-2.41$).
بالنسبة لـ Chronos-T5-small، كان التحسن اتجاهيًا ولكنه ليس ذا دلالة إحصائية عند المعدل الأساسي (p=0.065، التأثير $-0.74$).
هذه النتيجة تظل قائمة عبر عائلات الأقنعة المعلوماتية المحجوزة (الدورية والمتوافقة مع الأحداث).
مرساة "عدم التكيف" (النتيجة الحاسمة):
عند المقارنة بـ النموذج الأساسي المجمد (بدون محول)، أدت جميع طرق التكيف السبعة المتعلمة أداءً أسوأ في 11 من أصل 12 مجموعة بيانات لكلا النموذجين.
طريقة "التوازن"، رغم كونها "الأفضل" بين المحولات، إلا أنها لا تزال ضارة مقارنةً بعدم القيام بأي شيء.
أهمية المرساة: إن العائلة التأكيدية (التي تقارن بين استراتيجيتين للتكيف) لا يمكنها هيكليًا اكتشاف أن عائلة التدخلات بأكملها ضارة. تكشف الدراسة أن "المنهج الفائز" هو مجرد العضو الأقل ضررًا ضمن مجموعة من التدخلات الضارة.
صحة المعايرة والحساسية:
إحدى مجموعات البيانات، covid_deaths (وفيات كوفيد)، تنتهك فرضية المعايرة: حيث أن فترة الاختبار (ذروة الوباء) ذات حجم أكبر بحوالي 250 ضعفًا من بادئة التدريب (ما قبل الجائحة).
في المتوسط غير الموزون عبر 12 مجموعة بيانات، تحمل هذه المجموعة وحدها وزنًا يعادل ~40 ضعف وزن المجموعات الأخرى، مما يؤدي لتضخيم أداء الطرق التي تتعامل مع هذا التحول في النطاق (مثل SAITS imputation) بشكل مصطنع، ويحجب الفشل الحقيقي للمحولات.
استبعاد covid_deaths (رؤية الـ 11 مجموعة بيانات): تصبح الفجوة بين التكيف والنموذج الأساسي المجمد واضحة للغاية وذات دلالة إحصائية عالية (p=0.001). النموذج الأساسي المجمد يتفوق بوضوح على جميع المحولات المتعلمة.
النتائج الثانوية:
الحساسية للمعدل: يتقلص العجز في المحولات بالنسبة للنموذج الأساسي المجمد مع زيادة نسبة الفقد. عند فقد بنسبة 40%، يتفوق محول TimesFM أخيرًا على النموذج الأساسي المجمد، مما يشير إلى أن المحولات تساعد فقط عندما يتدهور السياق بشدة.
الدقة (Calibration): الفترات الخام تغطي أقل من المطلوب بشكل كبير (النسبة الاسمية 80% مقابل ~60% ملاحظة). المعايرة التصالحية (conformal calibration) القائمة على التحقق فقط تصلح التغطية ولكنها لا تغير بشكل كبير درجة الفترة للمناهج المستهدفة، وإن كانت تعاقب بشدة النماذج المتدهورة (مثل mask/age-only).
الأهمية والادعاءات تتمثل المساهمة المنهجية الأساسية للورقة في: أن المقارنات المسجلة مسبقًا بين متغيرات تدخل واحد (مثل المتوازن مقابل المتوسط) هي مقارنات غير معلوماتية حول ما إذا كان التدخل نفسه مفيدًا أم لا.
متطلب "المرساة" (The Anchor Requirement): يجب أن يتضمن أي تدقيق صالح "مرساة عدم التدخل" (النموذج الأساسي المجمد) ضمن العائلة المبلغ عنها. بدون ذلك، يمكن لنتيجة ذات دلالة إحصائية بين استراتيجيتين للتكيف أن توحي مضللة بأن التدخل مفيد بينما هو في الواقع ضار.
الاستدلال على مستوى العنقود: مع وجود عدد صغير من الوحدات العليا (12 مجموعة بيانات)، يمكن أن تهيمن مجموعة غير متجانسة واحدة على الاختبارات القائمة على المتوسط. تدعو الدراسة إلى الجمع بين الاختبارات القائمة على المتوسط وعدّ الاتجاهات على مستوى العنقود لضمان المتانة.
تدقيق المعايرة: ثوابت المعايرة لكل سلسلة هي افتراضات نمذجة يجب تدقيقها ضد صحة البيانات المدخلة. الفشل في القيام بذلك يمكن أن يقلب ترتيب المراجع (baselines) تمامًا.
الخلاصة تخلص الدراسة إلى أنه بالنسبة للوحة والقياسات المختبرة، فإن التكيف المتوازن الآليات ليس تحسنًا مقارنة بترك النموذج التأسيسي مجمدًا؛ بل هو أقل التدخلات ضررًا من بين مجموعة من التدخلات الضارة. الورقة لا تدعي أن المحولات خفيفة الوزن لا يمكن أن تساعد أبدًا، بل تشير إلى أن هذه المحولات العالمية المحددة، التي تم ضبطها بهذا النطاق، لا تعوض تكلفتها في ظل الظروف المختبرة. وتعمم هذه النتائج على ممارسات تقييم النماذج التأسيسية للسلالات الزمنية، وتحث الباحثين على تقديم خطوط الأساس لعدم التدخل وتدقيق افتراضات المعايرة بصرامة.