LiteGUI: Distilling Compact GUI Agents with Reinforcement Learning
यह शोध पत्र LiteGUI का प्रस्ताव करता है, जो एक नवीन SFT-मुक्त प्रशिक्षण प्रतिमान है जो गाइडेड ऑन-पॉलिसी डिस्टिलेशन और एक मल्टी-सॉल्यूशन ड्यूल-लेवल GRPO फ्रेमवर्क को जोड़ता है ताकि हल्के, ऑन-डिवाइस GUI एजेंटों के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके, जिससे 2B/3B स्केल के मॉडल बहुत बड़े मॉडलों के बराबर अत्याधुनिक परिणाम प्राप्त करने में सक्षम हो सकें।