Compute Optimal Tokenization
تُظهر هذه الورقة أنه في تكوينات النماذج اللغوية المثلى من حيث الحوسبة، تتناسب أعداد المعلمات طردياً مع حجم البيانات مقاساً بالبايتات بدلاً من الرموز (tokens)، مما يكشف أن معدل ضغط الرموز الأمثل يختلف عن خوارزمية BPE القياسية ويتناقص مع زيادة الحوسبة.
المؤلفون الأصليون: Tomasz Limisiewicz, Artidoro Pagnoni, Srini Iyer, Mike Lewis, Sachin Mehta, Alisa Liu, Margaret Li, Gargi Ghosh, Luke Zettlemoyer
المؤلفون الأصليون: Tomasz Limisiewicz, Artidoro Pagnoni, Srini Iyer, Mike Lewis, Sachin Mehta, Alisa Liu, Margaret Li, Gargi Ghosh, Luke Zettlemoyer
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
ملخص تقني: التجزئة المثلى للحوسبة
بيان المشكلة
لطالما وجهت قوانين القياس (Scaling laws) التصميم الفعال للنماذج اللغوية الكبيرة (LLMs) من خلال تحديد التوازن الأمثل بين حجم النموذج وحجم بيانات التدريب. ومع ذلك، فإن النهج القياسية تعبر عن حجم البيانات بـ الرموز (Tokens)، وهي وحدة تعتمد بطبيعتها على طريقة التجزئة (Tokenizer) المحددة ومعدل ضغطها (متوسط عدد البايتات لكل رمز). هذا الاعتماد يتجاهل كثافة المعلومات في وحدة البيانات نفسها. ونتيجة لذلك، تظل نتائج القياس الحالية مرتبطة بمخططات تجزئة محددة (مثل BPE)، مما قد يحجب العلاقة الحقيقية بين الحوسبة، والبيانات، ومعاملات النموذج (Parameters). تعالج الورقة الفجوة في فهم كيفية تأثير معدل الضغط (T) على اتجاهات القياس المثلى للحوسبة، وما إذا كان ينبغي التعبير عن النسبة المثلى بين البيانات والمعاملات بالرموز أم بالبايتات.
المنهجية
للتحقيق بشكل منهجي في دور معدل الضغط دون متغيرات مربكة مثل حجم المفردات، استخدم المؤلفون بنية محول الكمون البايتي (Byte Latent Transformer - BLT). يسمح نظام BLT بالتحكم الدقيق في معدل الضغط عن طريق تقسيم المدخلات على مستوى البايت إلى رموز كامنة بناءً على عتبة الإنتروبيا، مما يتيح تدريب نماذج بمعدلات T متفاوتة مع الحفاظ على حجم المفردات (وبالتالي عدد المعاملات) ثابتًا.
الإعداد التجريبي:
- النماذج: درست الدراسة 988 نموذجاً مجزأً بالرموز الكامنة (BLT) و 320 نموذجاً مجزأً بالكلمات الفرعية (Subword) (باستخدام متغيرات Character، وBPE، وSuperBPE، وBPE المقنع).
- النطاق: تراوحت النماذج من 50 مليون إلى 7 مليارات معامل.
- ميزانيات الحوسبة: امتدت التجارب عبر ميزانيات من 5×1018 إلى 2×1021 عملية حسابية (FLOPs).
- معدلات الضغط (T):
- النماذج الكامنة: T∈{1,2,4,6,8,12} بايت/رمز.
- نماذج الكلمات الفرعية: T∈{1.01,3.71,4.16,4.57,6.16} بايت/رمز.
- البيانات: أُجري التدريب بشكل أساسي على مجموعة بيانات DCLM (الإنجليزية العادية)، مع التوسع لتشمل خمس لغات أخرى (الفرنسية، الفيتنامية، الروسية، العربية، الهندية) ومجموعة بيانات إنجليزية مضخمة اصطناعياً.
- التقييم: تم تقييم النماذج باستخدام البت لكل بايت (Bits-Per-Byte - BPB) على تقسيم التحقق C4، مما يضمن قياس طول السياق بالبايتات (على سبيل المثال، 8192 بايت) بدلاً من الرموز للحفاظ على الاتساق عبر معدلات الضغط المختلفة.
نهج التحليل:
قام المؤلفون بملاءمة قوانين القوة (Power laws) على مرحلتين:
- قانون القياس الأول: تحديد حجم بيانات التدريب الأمثل (B⋆) وحجم النموذج الأمثل (N⋆) لميزانية حوسبة معينة (C) ومعدل ضغط (T) من خلال إيجاد الحد الأدنى لمنحنيات IsoFLOP (الخسارة مقابل البيانات/المعاملات).
- قانون القياس الثاني: نمذجة ديناميكيات الخسارة المثلى (L⋆) كدالة لـ C و T، مع التحقيق بشكل خاص في وجود معدل ضغط أمثل.
المساهمات والنتائج الرئيسية
1. قانون القياس الأول: البايتات مقابل الرموز
تثبت الدراسة أنه في تكوينات الحوسبة المثلى، تظل النسبة المثلى بين بايتات بيانات التدريب و معاملات النموذج ثابتة تقريباً، بغض النظر عن معدل الضغط.
- النتيجة: نسبة البايتات لكل معامل المثلى (ρ⋆) قريبة من 60 بايت لكل معامل للبيانات الإنجليزية.
- الدلالة: إن "قاعدة تشينتشيلا" (Chinchilla rule) الشائعة التي تبلغ حوالي 20 رمزاً لكل معامل هي نتاج لمعدل الضغط المحدد لمجزئات BPE (T≈4.57). عند تعميم وصفات القياس عبر مجزئات مختلفة، يجب على المطورين مطابقة نسبة بايتات التدريب إلى المعاملات، وليس الرموز إلى المعاملات.
- الصيغة الرياضية: B⋆(C,T)≈B0CαTβ و N⋆(C,T)≈N0C1−αT1−β، حيث α≈0.465 و β≈0.471. وبما أن α و β قريبتان من 0.5، فإن النسبة ρ⋆=B⋆/N⋆ تظل ثابتة تقريباً عبر قيم C و T المتغيرة.
2. قانون القياس الثاني: معدل الضغط الأمثل
تكتشف الورقة أنه يوجد معدل ضغط أمثل محدد (T⋆) يقلل الخسارة لميزانية حوسبة ثابتة.
- عدم الرتابة (Non-Monotonicity): الخسارة غير رتيبة بالنسبة للضغط؛ فالابتعاد عن T⋆ في أي من الاتجاهين (ضغط منخفض جداً أو عالٍ جداً) يؤدي إلى زيادة الخسارة.
- الاعتماد على الحوسبة: ينخفض معدل الضغط الأمثل مع زيادة ميزانية الحوسبة. على سبيل المثال، عند C=1020 FLOPs، يكون T⋆≈3.69، بينما عند C=2×1021 FLOPs، يكون T⋆≈3.33.
- التحقق من الكلمات الفرعية: هذا الاتجاه ينطبق أيضاً على نماذج الكلمات الفرعية. ومن المثير للدهشة أن النماذج التي تم حجب 90% من مفردات BPI الخاصة بها (ضغط فعال أقل) تفوقت على نماذج BPE القياسية عند المقاييس الكبيرة، مما يشير إلى أن الضغط الأقل قد يكون مفيداً للنماذج الكبيرة جداً.
3. التعميم متعدد اللغات
تمتد النتائج إلى لغات تتجاوز الإنجليزية، حيث ترتبط القيم المثلى بـ التكافؤ عبر اللغات (نسبة طول البايت المطلوبة للتعبير عن نفس المعلومات بلغات مختلفة).
- خصوصية اللغة: اللغات ذات التكافؤ العالي (كثافة معلومات أقل لكل بايت، مثل الهندية والروسية) تتطلب معدل ضغط أمثل أعلى ونسبة بايتات لكل معامل أعلى.
- المجزئات الحالية: تميل المجزئات متعددة اللغات الشائعة (مثل Llama 3 و Qwen 3) إلى الإفراط في الضغط للغات عالية الموارد (مثل الإنجليزية) و نقص الضغط للغات منخفضة الموارد (مثل الهندية)، مما يبعدها عن T⋆ الأمثل المحسوب.
4. مقايضات الاستدلال (Inference Trade-offs)
بينما يؤدي الضغط الأقل (الأقرب إلى T⋆ الأمثل للتدريب) إلى أداء أفضل، فإنه يزيد من تكلفة حوسبة الاستدلال لكل بايت. تشير الورقة إلى وجود مقايضة: الضغط الأعلى يقلل تكاليف الاستدلال ولكنه قد يضعف الأداء إذا انحرف بشكل كبير عن المعدل الأمثل للتدريب.
الأهمية والادعاءات
تدعي الورقة أنها تقدم أول دراسة شاملة لتأثير معدل الضغط على كفاءة الحوسبة للنماذج اللغوية. وتكمن أهميتها الأساسية في:
- تعميم قوانين القياس: إنها تفصل قوانين القياس عن مجزئات محددة من خلال اعتماد البايتات كوحدة أساسية لتقييس البيانات، بدلاً من الرموز.
- استراتيجية التجزئة المثلى: توضح أن معدل الضغط "الأمثل" ليس ثابتاً بل يعتمد على ميزانية حوسبة التدريب والمجال اللغوي المحدد.
- توجيه المطورين: تنصح المطورين باختيار مخططات التجزئة التي تتوافق مع نسبة البايتات إلى المعاملات المثلى للحوسبة، وتأخذ في الاعتبار معدلات الضغط الخاصة بكل لغة، لا سيما للنماذج متعددة اللغات حيث غالباً ما تفشل مجزئات الكلمات الفرعية القياسية في تحقيق الضغط الأمثل.
يخلص المؤلفون إلى أنه بينما يوفر التجزئة الكامنة (BLT) تحكماً دقيقاً لاكتشاف هذه الاتجاهات، فإن قوانين القياس المستمدة تنطبق باستمرار على نماذج الكلمات الفرعية، مما يوفر إرشادات عملية لاختيار مخططات التجزئة لتعظيم كفاءة الحوسبة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.
تصلك أفضل أبحاث NLP كل أسبوع.
يحظى بثقة باحثين في ستانفورد وكامبريدج والأكاديمية الفرنسية للعلوم.
تفقّد بريدك لتأكيد الاشتراك.
حدث خطأ ما. تعيد المحاولة؟
لا رسائل مزعجة، ويمكنك إلغاء الاشتراك متى شئت.