TEMPO: Scaling Test-time Training for Large Reasoning Models
تقترح الورقة البحثية TEMPO، وهو إطار عمل للتدريب في وقت الاختبار يدمج بين تحسين السياسة على البيانات غير المصنفة وإعادة معايرة الناقد بشكل دوري على البيانات المصنفة للتغلب على استقرار الأداء وانهيار التنوع في نماذج الاستدلال الكبيرة، محققاً مكاسب كبيرة في دقة معايير الاستدلال الرياضي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك طالب عبقري يستعد لأصعب مسابقة رياضيات في العالم (مثل AIME). لقد درست بجد، ولكن بمجرد بدء الامتحان، لا يمكنك البحث عن الإجابات أو طلب المساعدة من معلمك. عليك الاعتماد فقط على ما تعرفه.
المشكلة في الذكاء الاصطناعي الحالي:
معظم نماذج الذكاء الاصطناعي المتقدمة (التي تسمى نماذج الاستدلال الضخمة) تشبه الطلاب الذين يتوقفون عن التعلم بمجرد بدء الامتحان. إنهم يستخدمون الكثير من طاقة الدماغ للتفكير في مشكلة ما، لكنهم لا يغيرون عقولهم فعلياً بناءً على ما يتعلمونه أثناء الاختبار.
تحاول بعض الطرق الأحدث إصلاح ذلك من خلال السماح للذكاء الاصطناعي بـ "تقييم نفسه" أثناء خوض الاختبار. يفكر قائلاً: "همم، هذه الإجابة تبدو صحيحة،" ويقوم بتحديث عقله.
- العيب: هذا يشبه طالباً سيئاً في الرياضيات يحاول تقييم واجباته المنزلية بنفسه. في البداية، قد يصيب في بعض الأشياء، لكن سرعان ما يبدأ في الثقة بإجاباته الخاطئة. يقنع نفسه قائلاً: "أنا متأكد من أن هذا صحيح!" ويتوقف عن استكشاف الاحتمالات الأخرى. يقع في حلقة مفرغة من الثقة المفرطة، ويصل أداؤه إلى سقف معين، ثم يتوقف عن التحسن. كما يتوقف عن محاولة إيجاد حلول إبداعية، ويكتفي بتكرار نفس الأنماوهات القليلة التي يعتقد أنها تعمل.
الحل: TEMPO
تقدم الورقة البحثية TEMPO (تحسين سياسة توقع التوقع في وقت الاختبار). فكر في TEMPO ليس كطالب يقيم نفسه، بل كطالب لديه مدرس خصوصي ذكي ومتنقل.
إليك كيف يعمل TEMPO، باستخدام تشبيه بسيط:
الرقصة ذات الخطوتين: "المدرس" و"الطالب"
يقسم TEMPO المهمة إلى دورين يتبادلان الأدوار:
- الطالب (السياسة - The Policy): هذا هو الذكاء الاصطناعي الذي يحاول حل المشكلات الصعبة غير المصنفة (أسئلة الاختبار). إنه يولد الإجابات ويحاول التعلم منها.
- المدرس (الناقد - The Critic): هذا نموذج ذكاء اصطناعي منفصل مهمته الوحيدة هي تصحيح (تقييم) إجابات الطالب.
السر الكامن: استراحة "إعادة المعايرة"
معظم الطرق الأخرى تسمح للطالب بتقييم نفسه للأبد. أما TEMPO فيفعل شيئاً مختلفاً. فهو يتبع جدولاً زمنياً صارماً:
- الخطوة 1: الطالب يحل (خطوة M). يقوم الطالب بمعالجة مجموعة من المشكلات الصعبة وغير المحلولة. يستخدم مهارات التصحيح الحالية للمدرس للتعلم والتحسن.
- الخطوة 2: المدرس يخضع لـ "اختبار واقع" (خطوة E). هذا هو الجزء السحري. قبل أن يصبح الطالب واثقاً جداً من نفسه، يتوقف المدرس عن تقييم عمل الطالب. بدلاً من ذلك، يعود المدرس إلى كتاب مدرسي يحتوي على الإجابات الصحيحة (مجموعة بيانات مصنفة) ويعيد تعلم كيفية التصحيح بشكل صحيح. هذا يضمن عدم انحراف معايير التصحيح لديه.
لماذا ينجح هذا؟
- يمنع تأثير "المصحح المخمور": إذا قام المدرس بتقييم عمل الطالب فقط، فسينتهي به الأمر بالاتفاق مع أخطاء الطالب (لأن الطالب هو الوحيد الذي يولد الإجابات). من خلال إجبار المدرس على النظر إلى "الكتاب المدرسي" (الإجابات الصحيحة) بين الحين والآخر، يحافظ TEMPO على نزاهة عملية التصحيح.
- يبقي الإبداع حياً: لأن المدرس صادق، فإنه لا يكافئ فقط "الإجابة الأكثر شيوعاً"، بل يكافئ الإجابات "الجيدة"، حتى لو كانت فريدة. هذا يمنع الذكاء الاصطناعي من الانهيار في حلقة مكررة ومملة.
النتائج: ماذا حدث؟
اختبر الباحثون هذا على أصعب المسائل الرياضية المتاحة (مثل AIME 2024 و2025).
- الطريقة القديمة: كان الذكاء الاصطناعي يتحسن قليلاً، ثم يصطدم بحائط ويتوقف عن التحسن. كما كان يبدأ في تقديم نفس الإجابة مراراً وتكراراً.
- طريقة TEMPO: استمر الذكاء الاصطناعي في أن يصبح أكثر ذكاءً وذكاءً كلما مارس التدريب لفترة أطول.
- أحد النماذج (OLMO3-7B) قفز من 33% دقة إلى 51%.
- نموذج آخر (Qwen3-14B) قفز من 42% إلى 65%.
والأمر الأكثر إثارة للإعجاب هو أنه بينما بدأت الطرق الأخرى في تقديم نفس الإجابة 16 مرة متتالية (انهيار التنوع)، استمر TEMPO في توليد 16 حلاً مختلفاً وعالي الجودة.
الصورة الكبيرة
فكر في TEMPO كفرق بين التدرب وحيداً في غرفة مظلمة (حيث قد تعزز عاداتك السيئة) مقابل التدرب مع مدرب يراجع كتاب القواعد بين الحين والآخر ليتأكد من أنك لا تتعلم حركات خاطئة.
من خلال التناوب بين "القيام بالعمل" و"التحقق من القواعد"، يسمح TEMPO للذكاء الاصطناعي بالاستمرار في التعلم والتحسن حتى بعد انتهاء تدريبه الرسمي، محولاً "وقت الاختبار" إلى عصر جديد من التعلم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.