Automatic Generation of High-Performance RL Environments
تقدم هذه الورقة منهجية ذات حلقة مغلقة تولد تلقائياً بيئات تعلم تعزيزي عالية الأداء بتكلفة حوسبة ضئيلة عبر استخدام مطالبات عامة، وتحقق هرمي، وإصلاح تكراري لضمان التكافؤ عبر تدفقات عمل متنوعة، بما في ذلك الترجمة المباشرة، والتحقق من تكافؤ الأداء، وإنشاء بيئات جديدة.