ملخص تقني: هل يمكن لمفردات نماذج اللغات الكبيرة (LLM) المنشورة دعم التقدير على مستوى الرمز (Token) للمتون الخفية؟
1. صياغة المشكلة
تعد تكوين المتون المستخدمة في التدريب المسبق أمراً جوهرياً لفهم قدرات نماذج اللغات الكبيرة (LLM)، ومع ذلك تظل هذه المعلومات غالباً غامضة حتى عند إصدار أوزان النموذج. وبينما تكون مفردات الـ tokenizer المنشورة (التي يتم تدريبها عادةً باستخدام ترميز بايت-أزواج BPE) عامة ومتاحة، إلا أنها نادراً ما تكون مصحوبة بإحصائيات بيانات التدريب الدقيقة.
المشكلة الجوهرية التي يتناولها البحث هي تقدير نسبة المتون على مستوى الرمز (token-level corpus ratio estimation). بالنظر إلى مفردات الـ tokenizer المستهدفة المنشورة V∗ والتي تم تدريبها على متن خفي C∗، فإن الهدف هو تقدير نسبة المتون ri∗ لكل رمز vi في المفردات. وخلافاً للأعمال السابقة التي تستنتج مزيج الفئات خشن الحبيبات (مثل نسب اللغات أو المجالات) أو تتبع مجموعات رموز محددة، يهدف هذا البحث إلى تقدير النسبة لأي رمز فردي.
يفترض المؤلفون إمكانية الوصول إلى متن واحد أو أكثر من المتون المعروفة D ذات نسب الرموز الملحوظة. ويكمن التحدي في تعلم مُقدِّر f^ يربط بين معرفات الرموز (token IDs) والنسب في المتن الخفي عبر الاستفادة من العلاقة بين معرفات الرموز والنسب الملحوظة في المتون المعروفة.
2. الملاحظة الرئيسية: قابلية انتقال توزيعات المعرف-النسبة (ID-Ratio)
قبل اقتراح الحل، استقصى المؤلفون ما إذا كانت العلاقة بين معرفات الرموز ونسب المتون قابلة للانتقال عبر متون مختلفة.
- المنهجية: قاموا بتدريب مُرمِّزات BPE على لغات متنوعة (الإنجليزية، الفرنسية، اليابانية، الصينية) ومجالات مختلفة (الويب، ويكيبيديا، البرمجة، الرياضيات) ورسموا توزيعات معرفات الرموز مقابل نسب المتون في فضاء لوغاريتمي-لوغاريتمي (log-log space).
- النتيجة: على الرغم من الاختلافات الكبيرة في بنية اللغة أو محتوى المجال، إلا أن توزيعات (معرف الرمز-النسبة) تشترك في شكل عالمي مستقر.
- القياس الكمي: باستخدام درجة تشابه انتقال اتجاهي تعتمد على تباعد كولباك-ليبلر (KL divergence)، أثبتوا أن هذه التوزيعات قابلة للانتقال بشكل واسع. فعلى سبيل المثال، تظهر الإنجليزية والفرنسية تقارباً يكاد يكون متبادلاً، بينما تحتفظ الأزواج المتباينة بنيوياً مثل "البرمجة" و"ويكيبيديا" بتشابه جوهري.
- الاستنتاج: هذا الاستقرار يحفز عملية نقل البنية التوزيعية من المتون المعروفة إلى الـ tokenizer المستهدف المدرب على بيانات خفية.
3. المنهجية: تقدير الكثافة الموجه بالكميات (QGDE)
لاستغلال قابلية الانتقال هذه، يقترح المؤلفون منهجية تقدير الك كثافة الموجه بالكميات (Quantile-Guided Density Estimation - QGDE). تتكون الطريقة من ثلاث مراحل رئيسية:
أ. ملاءمة اتجاهات (المعرف-النسبة) باستخدام الكميات (Quantiles)
بدلاً من ملاءمة منحنى وسيط واحد (كما في عمل PoCTrace السابق)، تقوم QGDE بنمذجة علاقة (المعرف-النسبة) المشتركة باستخدام عائلة من اتجاهات الكميات.
- التحويل اللوغاريتمي-اللوغاريتمي: اتباعاً لقانون زيبف (Zipf's law)، يتم نمذجة معرفات الرموز (t) والنسب (r) في فضاء لوغاريتمي-لوغاريتمي، حيث تقترب العلاقة من اتجاه خطي.
- انحدار الكميات (Quantile Regression): لمجموعة من مستويات الكميات τ، تقوم الطريقة بملاءمة منحنيات خطية لوغاريتمية qτ(x)=aτ+bτx. وهذا لا يلتقط الميل المركزي فحسب، بل يلتقط أيضاً الانتشار الرأسي الكامل للنسب المحتملة لمعرف رمز معين.
- توليد المرشحين: بالنسبة لرمز مستهدف بمعرف ti، يوفر كل اتجاه كمي تقديراً مرشحاً للنسبة اللوغاريتمية zi,τ.
ب. اختيار ركائز الكميات (Quantile Anchors)
لتجنب التكرار وضمان التغطية، تختار الطريقة مجموعة صغيرة من ركائز الكميات التمثيلية TK∗.
- التحسين: يتم اختيار الركائز عن طريق تعظيم تغطية ركيزة الكمية (Quantile Anchor Coverage - QAC)، والتي تحصي عدد نقاط (المعرف-النسبة) المعروفة التي تقع ضمن نطاق رأسي للاتجاهات المختارة.
- النتيجة: تفضل هذه العملية الركائز التي تمر اتجاهاتها مجتمعة عبر المناطق المدعومة جيداً في التوزيع، بدلاً من الانتشار بشكل موحد أو التركيز على المناطق الشحيحة. أظهر التحليل التجريبي أن التغطية تصل إلى حالة التشبع مع زيادة عدد الركائز (K) (على سبيل المثال، تناقص العوائد بعد K=14).
ج. التوزين بالكثافة المحلية
تتحول الخطوة الأخيرة من عدة تقديرات مرشحة إلى تقدير نقطي واحد باستخدام التوزين بالكثافة المحلية.
- الآلية: بالنسبة لمعرف الرمز المستهدف، تحدد الطريقة نقاط (المعرف-النسبة) القريبة ضمن نافذة محلية.
- التوزين: تقوم بتعيين أوزان ناعمة لكل تقدير مرشح بناءً على مدى دعم النقاط المحيطة لذلك الاتجاه الكمي المحدد، باستخدام تقدير كثافة النواة الغاوسية (Gaussian kernel density estimation).
- التقدير النهائي: التقدير المقدر هو المتوسط الموزون بالكثافة للتقديرات المرشحة. هذا يحول إشارة "النطاق" (range-style) من الأعمال السابقة إلى تقدير نقطي دقيق على مستوى الرمز.
4. النتائج التجريبية
قيم المؤلفون منهجية QGDE في كل من الإعدادات المحكومة (باستخدام mC4، OSCAR، FineWeb، إلخ) وفي إعداد واقعي (باستخدام tokenizer الخاص بـ SmolLM).
الإعدادات المحكومة
- التقدير على مستوى الرمز: تفوقت QGDE بشكل كبير على نموذجين مرجعيين: نقل (المعرف-النسبة) المباشر (نسخ نسب المصدر حسب الموقع) وPoCTrace (اتجاه وسيط واحد).
- الأداء: حققت QGH متوسط خطأ نسبي (MRE) منخفض يصل إلى 3.00% للتقدير على مستوى الرمز في حالات المزيج المصدري المختلط.
- الدراسة الاستقصائية (Ablation): أدت زيادة عدد ركائز الكميات (K) من 3 إلى 14 إلى تقليل الأخطاء بشكل حاد، خاصة في إعدادات المجالات، قبل أن تصل المكاسب إلى مرحلة التشبع.
- مزيج المصادر: أدى استخدام متون معروفة مختلطة عموماً إلى نتائج أفضل من إعدادات المصدر الواحد، وإن كان وزن المزيج الدقيق أقل أهمية من تنوع المكونات المغطاة.
التجميع إلى مستوى الفئة
- تقدير المزيج: تم تجميع التقديرات على مستوى الرمز لتقدير نسب اللغات أو المجالات.
- المقارنة: تفوقت QGDE بشكل كبير على نموذج DMI المرجعي.
- تقليل الخطأ: في إعدادات اللغة، انخفض MRE من حوالي 9.09% (DMI) إلى 3.08% (QGHE). وفي إعدادات المجالات، انخفض من حوالي 15.14% إلى ~5.3%.
- الملاحظة: بينما أدت زيادة K إلى تحسين الدقة على مستوى الرمز، كانت المكاسب على مستوى الفئة أقل وضوحاً بسبب تأثير التنعيم الناتج عن التجميع.
الإعداد الواقعي (SmolLM)
- التحقق: تم اختبار الطريقة على tokenizer الخاص بـ SmolLM، حيث كانت نسب بيانات التدريب الحقيقية متاحة (FineWeb-edu, Cosmopedia, Python-edu).
- النتائج: حققت QGHE أدنى خطأ لكل من التقدير على مستوى الرمز (5.72–5.78% MRE) والتقدير على مستوى الفئة (5.93% MRE)، متفوقة على كل من النقل المباشر وPoCTrace. أكد هذا فعالية الطريقة حتى عندما لا يمكن استخدام المتون المكونة بدقة كمصادر تدريب مباشرة.
5. المساهمات والأهمية
يقدم البحث ثلاث مساهمات رئيسية:
- اكتشاف قابلية الانتقال: يثبت أن توزيعات (المعرف-النسبة) قابلة للانتقال عبر مفردات BPE المدربة على لغات ومجالات مختلفة، مما يوفر إشارة قابلة للاستخدام لتقدير نسب المتون الخفية.
- الابتكار المنهجي: يقدم QGHE، وهو مُقدِّر عام على مستوى الرمز يستخدم اتجاهات كميات متعددة وتوزين الكثافة المحلية لتقريب التوزيع القابل للانتقال، متجاوزاً بذلك استنتاج المزيج خشن الحبيبات أو تتبع رموز محددة.
- التحقق التجريبي: يظهر أن QGHE تحقق دقة عالية (تصل إلى 3.00% MRE) في كل من الإعدادات المحكومة والواقعية، متفوقة على النماذج المرجعية الحالية.
الأهمية:
يجادل المؤلفون بأن مفردات الـ tokenizer المنشورة توفر إشارة مفيدة للتقدير الدقيق للمتون. هذه القدرة تتجاوز استنتاج التركيبة الخشنة الممكنة بالأساليب الحالية، مما يوفر مساراً لتدقيق وفحص مصادر بيانات نماذج اللغات الكبيرة المنشورة حتى عندما تظل متون التدريب خفية. يشير العمل إلى أن "بصمة" تكوين المتون مشفرة في بنية مفردات الـ tokenizer بطريقة يمكن فك شفرتها باستخدام النمذجة الإحصائية الكافية.
القيود:
يشير المؤلفون إلى أن ندرة البيانات الحقيقية (Ground Truth) للنماذج المنشورة (مثل ChatGPT، Qwen، DeepSeek) تحد من التقييم المباشر لهذه النماذج. يعتمد التحقق حالياً على التجارب المحكومة وحالة SmolLM النادرة حيث تكون بيانات التدريب عامة. يبقى التحقق الأوسع رهن صدور المزيد من متون التدريب.