Learning Dynamics of Zeroth-Order Optimization: A Kernel Perspective
تحل هذه الورقة البحثية مفارقة نجاح التحسين من الدرجة الصفرية في الضبط الدقيق للنماذج اللغوية الكبيرة من خلال إثبات أن ديناميكيات التعلم الخاصة بها محكومة بنواة مماس عصبية تجريبية يعتمد خطأ تقريبها على حجم مخرجات النموذج بدلاً من البعد الهائل للمعلمات، مما يفسر قابليتها للتوسع.