Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning
यह शोध पत्र फ्रेशनेस-अवेयर प्रायोरिटाइज्ड एक्सपीरियंस रिप्ले (Freshness-Aware Prioritized Experience Replay) को प्रस्तुत करता है, जो एक नवीन विधि है जो एक एक्सपोनेंशियल एज डिके फैक्टर (exponential age decay factor) को शामिल करके बड़े भाषा और विजन-लैंग्वेज मॉडलों में प्रायोरिटी स्टेलेनेस (priority staleness) को कम करती है, जिससे पारंपरिक ऑन-पॉलिसी दृष्टिकोणों की तुलना में जटिल एजेंटिक और रीजनिंग कार्यों पर सैंपल दक्षता और प्रदर्शन में उल्लेखनीय सुधार होता है।