Language Models as Efficient Reward Function Searchers for Custom-Environment Multi-Objective Reinforcement
تقترح هذه الورقة إطار عمل ERFSL، وهو إطار عمل فعال يستفيد من النماذج اللغوية الكبيرة كباحثين بنظام الصندوق الأبيض لتوليد وتحسين دوال المكافأة متعددة الأهداف بشكل تكراري في البيئات المخصصة المعقدة من خلال الفهم الدلالي، ومنتقد مكافأة لتصحيح الكود، واستراتيجيات ضبط الأوزان الشبيهة بالخوارزميات الجينية، مما يحقق تقارباً سريعاً نحو الحلول المثلى في جبهة باريتو بأقل قدر من التغذية الراجعة البشرية.