When Does Non-Uniform Replay Matter in Reinforcement Learning?
تحدد هذه الورقة حجم إعادة التشغيل، والحداثة المتوقعة، وإنتروبيا أخذ العينات كعوامل رئيسية تحكم فعالية إعادة التشغيل غير المنتظم في التعلم المعزز خارج السياسة، مما يثبت أن استراتيجية "التقليم الهندسي" (Truncated Geometric) البسيطة تحسن كفاءة العينة بشكل كبير في أنظمة الحجم المنخفض بينما تظل تنافسية في أنظمة الحجم المرتفع.