🤖 machine learning
Near-Policy: Accelerating On-Policy Distillation via Asynchronous Generation and Selective Packing
تقترح الورقة البحثية تقنية تقطير السياسة القريبة (NPD)، وهي إطار عمل غير متزامن يعمل على تسريع تقطير المعرفة القائم على السياسة من خلال فصل عملية التوليد عن التدريب واستخدام تصفية Δ-IFD للتخفيف من تأخيرات السياسة، مما يحقق تسريعاً بمقدار 8.1 ضعفاً وأداءً فائقاً مقارنة بالضبط الدقيق للتعلم الخاضع للإشراف (SFT) القياسي والنماذج الأكبر حجماً.
Miao Rang, Zhenni Bi, Hang Zhou, Kai Han, Xuechun Wang, An Xiao, Xinghao Chen, Yunhe Wang, Hanting Chen2026-05-08