VSearcher: Long-Horizon Multimodal Search Agent via Reinforcement Learning
تقدم هذه الورقة البحثية VSearcher، وهو وكيل بحث متعدد الوسائط يعتمد على التعلم التعزيزي يحول النماذج الساكنة إلى متصفحات ويب قادرة على تنفيذ مهام طويلة المدى من خلال خط إنتاج تكراري لتخليق البيانات واستراتيجية تدريب تعتمد على الضبط الدقيق الموجه (SFT) ثم التعلم التعزيزي (RL)، محققاً أداءً فائقاً في معيار MM-SearchExam المقترح.