On the Convergence Rate of LoRA Gradient Descent
تقدم هذه الورقة أول تحليل تقارب غير تقاربي لخوارزمية هبوط التدرج الأصلية لـ LoRA دون الاعتماد على فرضيات النعومة الليبشيتزية أو المحدودية القوية، مما يثبت تقاربها إلى نقطة ثابتة بمعدل .
23700 ورقة بحثية
تقدم هذه الورقة أول تحليل تقارب غير تقاربي لخوارزمية هبوط التدرج الأصلية لـ LoRA دون الاعتماد على فرضيات النعومة الليبشيتزية أو المحدودية القوية، مما يثبت تقاربها إلى نقطة ثابتة بمعدل .
تقدم الورقة البحثية DUALFloodGNN، وهي شبكة عصبية رسومية مبتكرة مستوحاة من الفيزياء تدمج القيود الفيزيائية على المستويين العالمي والمحلي للتنبؤ بسرعة ودقة بمتغيرات هيدرولوجية متعددة للنمذجة التشغيلية للفيضانات، متفوقة بذلك على مناهج الشبكات العصبية الرسومية الحالية مع الحفاظ على كفاءة حوسبية عالية.
تقترح الورقة البحثية "نقل المهارة البارامتري" (PaST)، وهو إطار عمل يعالج أوجه القصور في الضبط الدقيق الخاضع للإشراف في تكييف النماذج اللغوية الكبيرة من خلال الحقن الخطي لمتجهات مهارات غير مرتبطة بنطاق محدد مستمدة من التعلم التعزيزي، مما يتيح تكيفاً مستمراً فعالاً ومؤثراً لدمج المعرفة والاستخدام الوكيل للأدوات.
تقدم الورقة البحثية RLSEdit، وهو إطار عمل يعتمد على المربعات الصغرى المتكررة لتحرير النماذج اللغوية الكبيرة مدى الحياة، والذي يصيغ التحديثات كتحسين تربيعي عبر الإنترنت مع قيود ناعمة لموازنة معضلة المرونة والاستقرار بفعالية، مما يتيح تحريراً متسلسلاً مستقراً لما يصل إلى 10,000 حقيقة مع الحفاظ على القدرات العامة.
تقترح هذه الورقة مشفرًا تلقائيًا تباينيًا (VAE) يستخدم الإحداثيات الكروية الفائقة لضغط المتجهات الكامنة نحو اتجاه محدد، مما يخفف من مشكلة تمدد الحجم الفائق في الفضاءات عالية الأبعاد ويحسن بشكل كبير أداء كشف الشذوذ غير المشروط والمشروط على مجموعات البيانات المعقدة والبيانات المرجعية في العالم الحقيقي.
يُعد المستنتج الهندسي (TGR) إطار عمل لا يتطلب تدريباً، يعمل على تعزيز الاستنتاج طويل السياق تحت قيود صارمة للذاكرة من خلال إجراء بحث استشرافي كامن مستنير بالمتشعبات مع إعادة ضبط ذاكرة التخزين المؤقت لـ (KV) على مستوى الأجزاء، محققاً تحسينات كبيرة في تغطية المسارات في اختبارات الرياضيات والبرمجة مع تكلفة حسابية ضئيلة.
تقدم هذه الورقة تقنيات بسيطة وقابلة للتوسع لإثبات أن التخطيط الضمني —وهو آلية تقوم من خلالها النماذج اللغوية بتوجيه الرموز الوسيطة نحو أهداف مستقبلية مثل القوافي أو الإجابات— هو قدرة عالمية موجودة حتى في النماذج الصغيرة التي يصل حجمها إلى مليار معلمة، مما يقدم رؤى جديدة للسلامة والتحكم في الذكاء الاصطناعي.
تقترح الورقة البحثية طريقة الاستعلام النشط المُحلل إلى عوامل (FAQ)، وهي طريقة تستفيد من البيانات التاريخية وأخذ العينات التكيفي لتقليل عدد الاستعلامات اللازمة لتقييم النماذج اللغوية الكبيرة بشكل كبير مع الحفاظ على فترات ثقة صالحة إحصائياً.
تعيد هذه الورقة صياغة تصنيف الشبكات العصبية كـسلسلة من اختبارات الفرضيات الثنائية، مُثبتةً تجريبياً أن النماذج ذات القدرة العالية على التعميم تتقارب نحو قواعد قرار مثالية وفق معيار "نيمان-بيرسون" من خلال النمو الرتيب لتباعد "كولباك-ليبلر" المستبقى، مع تقديم "مستوى الدليل-الخطأ" لتقييم التقارب بشكل منهجي عبر البنى الهيكلية المختلفة.
تضع هذه الورقة إطاراً نظرياً لتكييف نماذج الانتشار ذات الأبعاد اللانهائية بناءً على ملاحظات مشوشة عبر امتداد لتحويل دووب ، وتُقدم طريقة "تدريب التوجيه الخاضع للإشراف" الخالية من المحاكاة لضبط هذه النماذج بكفاءة من أجل أخذ عينات لاحقة دقيقة في المسائل العكسية البايزية.