Synthetic Data for any Differentiable Target
تقدم هذه الورقة "تدرج سياسة مجموعة البيانات" (DPG)، وهي طريقة للتعلم المعزز تعمل على تحسين مولدات البيانات الاصطناعية باستخدام عزو البيانات الدقيق للتحكم بدقة في خصائص نماذج اللغة المستهدفة وتشكيلها عبر الضبط الدقيق الخاضع للإشراف، حتى بالنسبة للأهداف غير الموجودة صراحةً في مطالبات المولد.