Reinforcement Learning for Computer-Use Agents with Autonomous Evaluation
यह शोध पत्र कंप्यूटर-उपयोग एजेंटों के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचे का प्रस्ताव करता है जो शोर वाले रिवॉर्ड सिग्नल्स (noisy reward signals) उत्पन्न करने के लिए स्वायत्त विजन-लैंग्वेज मॉडल्स का लाभ उठाता है, जिन्हें फिर एक नॉइज़-अवेयर एस्टीमेटर के माध्यम से सुधारा जाता है ताकि विविध डेस्कटॉप वातावरणों में कार्य सफलता दरों को महत्वपूर्ण रूप से सुधारा जा सके।