LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning
تقترح هذه الورقة البحثية LiteGUI، وهو نموذج تدريب جديد خالٍ من الضبط الدقيق الموجه (SFT-free) يجمع بين التقطير الموجّه القائم على السياسة (Guided On-policy Distillation) وإطار عمل GRPO ثنائي المستوى متعدد الحلول، لتعزيز أداء وكلاء واجهة المستخدم الرسومية (GUI) خفيفة الوزن والمخصصة للأجهزة، مما يمكّن النماذج بمقياس 2B/3B من تحقيق نتائج رائدة تضاهي النماذج الأكبر حجمًا بكثير.