How Large Language Models Get Stuck: Early structure with persistent errors
تتقصى هذه الورقة كيف أن النماذج اللغوية الكبيرة المدربة على مجموعة بيانات BabyLM غالباً ما تفشل في تعلم قواعد نحوية محددة لأن الانحيازات الخاطئة المبكرة، والمدفوعة بإحصاءات ثنائية الكلمات (bigram) مضللة، تصبح متجذرة وتستمر طوال عملية التدريب، مما يعيق التعلم الفعال.