Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling
تقدم هذه الورقة DuST، وهو إطار عمل للتدريب الذاتي يستفيد من أخذ العينات في وقت الاختبار لإنشاء "فضاء حكم مزدوج" حيث تتعلم النماذج ترتيب البرامج المرشحة عبر التعلم المعزز في السياسة (on-policy reinforcement learning)، مما يحسن قدرتها على الحكم على صحة الكود وتوليد حلول عالية الجودة دون مكافآت مباشرة للتوليد الصحيح.