Post-Training Local LLM Agents for Linux Privilege Escalation with Verifiable Rewards
تقدم هذه الورقة البحثية نموذج PrivEsc-LLM، وهو نموذج محلي بحجم 4 مليارات معلمة تم تدريبه عبر مسار مكون من مرحلتين يتضمن الضبط الدقيق الخاضع للإشراف والتعلم التعزيزي باستخدام مكافآت قابلة للتحقق، والذي حقق نسبة نجاح بلغت 95.8% في مهام تصعيد الامتيازات في نظام لينكس — وهو ما يقارب أداء النماذج المغلقة رفيعة المستوى — مع تقليل تكاليف الاستدلال بأكثر من 100 مرة.