Scaling Probabilistic Transformer via Efficient Cross-Scale Hyperparameter Transfer
تقدم هذه الورقة طريقة فعالة لنقل المعلمات الفائقة عبر المقاييس بناءً على معلمات التحديث الأقصى (muP)، والتي تُمكّن المحول الاحتمالي (Probabilistic Transformer) من التوسع حتى 0.4 مليار معلمة مع التفوق باستمرار على المحولات القياسية في مهام نمذجة اللغة المقنعة تحت نفس ميزانية المعلمات.