TimeRewarder: Learning Dense Reward from Passive Videos via Frame-wise Temporal Distance
تُعد TimeRewarder طريقة قابلة للتوسع تتعلم إشارات المكافأة الكثيفة من مقاطع الفيديو السلبية عبر نمذجة المسافات الزمنية بين الإطارات، مما يمكّن وكلاء التعلم المعزز من تحقيق نجاح شبه مثالي في المهام الروبوتية ذات المكافآت المتفرقة بكفاءة عالية في العينات ودون الحاجة إلى هندسة مكافآت يدوية.