How Do Transformers Learn to Associate Tokens: Gradient Leading Terms Bring Mechanistic Interpretability
تقدم هذه الورقة تفسيراً آلياً لكيفية تعلم نماذج المحولات (transformers) للارتباطات الدلالية عبر اشتقاق تعبيرات ذات صيغة مغلقة للأوزان في المراحل المبكرة، باعتبارها تركيبات من خرائط الثنائيات (bigram)، وقابلية تبادل الرموز، والسياق بناءً على ديناميكيات تدرج التدريب.