You Can Learn Tokenization End-to-End with Reinforcement Learning
تقترح هذه الورقة تعلم التجزئة (tokenization) من البداية إلى النهاية باستخدام التعلم التعزيزي مع تقديرات دالة الدرجة (score function) وخصم الوقت لتقليل التباين، مما يثبت أن هذا النهج يتفوق على طرق التمرير المباشر (straight-through methods) السابقة عند مقياس 100 مليون معلمة.