Beyond Two Bytes per Letter: Tokenization Overhead in Cyrillic AI Systems
تُحدد هذه الورقة البحثية كمياً العبء الإضافي الكبير في عملية التجزئة (tokenization) الذي تواجهه اللغة الأوكرانية وغيرها من اللغات السيريلية في أنظمة الذكاء الاصطناعي الحديثة مقارنة باللغة الإنجليزية، موضحةً أن هذا التفاوت ينبع من تخصيص بيانات التدريب، ولكن يمكن التخفيف من حدته بفعالية من خلال تقنيات الضغط أثناء الاستنتاج أو عبر تدريب أجهزة تجزئة "BPE" متوازنة على مستوى البايت.