The Tokenizer Tax Across 25 European Languages: Domain Invariance, Cross-Lingual Few-Shot Effects, and the Ukrainian Penalty
تُحدد هذه الورقة البحثية "ضريبة الرموز" (tokenizer tax) عبر 25 لغة أوروبية، كاشفةً أن اللغات غير الإنجليزية، ولا سيما الأوكرانية وتلك ذات الصرف المعقد، تعاني من نسب أعلى بكثير من الرموز إلى الكلمات بسبب نقص تمثيلها في بيانات ما قبل التدريب، مع إثبات أن تصنيفات الخصوبة هذه تظل ثابتة عبر المجالات وأن تأثيرات التعلم بلقطات قليلة (few-shot effects) هي سمة متأصلة في النموذج وليست مرتبطة باللغة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تدفع ثمن رحلة تاكسي. باللغة الإنجليزية، يحاسبك التاكسي بـ "الوقفة" (كلمة). أما في اللغة الأوكرانية، فيصر سائق التاكسي على محاسبتك بـ "الخطوة" (قطعة صغيرة من الكلمة). ولأن الكلمات الأوكرانية غالبًا ما تكون أطول وأكثر تعقيدًا، يتخذ السائق خطوات أكثر بكثير للوصول إلى نفس الوجهة. ينتهي بك الأمر بدفع ضعف المبلغ لنفس الرحلة تمامًا، رغم أن المسافة لم تتغير.
هذه الورقة البحثية، التي كتبها فولوديمير أوفتشاروف، تدور حول هذه "الضريبة" الخفية على اللغات غير الإنجليزية عند استخدام الذكاء الاصطناعي. إليك تفصيل لما وجدوه، باستخدام تشبيهات بسيطة:
1. ضريبة "الخطوة" (خصوبة الرمز - Tokenizer Fertility)
نماذج الذكاء الاصطناعي لا تقرأ كلمات كاملة مثل البشر. بل تقطع النص إلى قطع صغيرة تسمى رموزًا (tokens).
- التشبيه: فكر في الكلمة كرغيف خبز.
- الإنجليزية: يقطع الذكاء الاصطناعي الرغيف إلى شرائح كبيرة وسميكة. تحتاج فقط إلى 1.2 شريحة لتمثيل كلمة واحدة.
- الأوكرانية: يستخدم الذكاء الاصطناعي سكينًا ثلمًا ويقطع نفس الرغيف إلى قطع صغيرة متفتتة. يتطلب الأمر 2.7 شريحة لتمثيل كلمة واحدة.
- التكلفة: بما أن شركات الذكاء الاصطناعي تحاسبك لكل "شريحة" (رمز)، فإن التحدث بالأوكرانية يكلفك حوالي 2.2 مرة أكثر من التحدث بالإنجليزية لنفس كمية النص.
- التسلسل الهرمي: قاست الورقة 25 لغة أوروبية.
- المجموعة الرخيصة: الإنجليزية، الإسبانية، والفرنسية (1.2 إلى 1.7 شريحة لكل كلمة).
- المجموعة المتوسطة: الألمانية والهولندية (1.7 إلى 1.9 شريحة).
- المجموعة الغالية: اللغات السلافية مثل البولندية والتشيكية (2.2 إلى 2.5 شريحة).
- الأغلى ثمنًا: الأوكرانية، اليونانية، والمالطية (حوالي 3.1 شريحة).
2. "عقوبة الأوكرانية"
وجد الباحثون شيئًا مفاجئًا بشأن اللغة الأوكرانية. على الرغم من أن الأوكرانية والبولندية والتشيكية جميعها لغات سلافية شقيقة ذات هياكل كلمات متشابهة، إلا أن معالجة الأوكرانية أغلى بكما بشكل ملحوظ.
- التشبيه: تخيل مصنعين متطابقين. أحدهما (البولندي) لديه إمدادات وفيرة من الطوب المقطر مسبقًا لأنه يبني منذ فترة طويلة. والآخر (الأوكراني) يضطر لقطع كل طوبة من الحجر الخام لأنه تم تجاهله في الماضي.
- السبب: توضح الورقة أن الأوكرانية تمتلك بيانات تدريب أقل بـ 2 إلى 6 مرات في "مكتبة" الذكاء الاصطناعي مقارنة بالبولندية أو التشيكية. ولأن الذكاء الاصطناعي لم يرَ الكلمات الأوكرانية كثيرًا، فإنه لا يعرف كيفية تجميعها بكفاءة. يستمر في تقطيعها إلى قطع صغيرة غير فعالة.
3. "السكين الموحد"
اختبرت الورقة ما إذا كانت هذه "الضريبة" تتغير بناءً على موضوع الحديث (مثل العقود القانونية مقابل الأخبار أو ويكيبيديا).
- النتيجة: لا يهم. الترتيب الذي يحدد أي ذكاء اصطناعي هو "رخيص" وأيها "غالٍ" يظل كما هو تمامًا سواء كنت تتحدث عن كرة القدم، أو القانون، أو التاريخ.
- الخلاصة: إذا اختبرت ذكاءً اصطناعيًا على نوع واحد من النصوص، فستعرف بالضبط كم سيكلفك لأي نوع آخر من النصوص. لست بحاجة لإعادة الاختبار في كل مرة.
4. "الخدعة السحرية" (التعلم من أمثلة قليلة - Few-Shot Learning)
يمكن للذكاء الاصطناعي أحيانًا تعلم مهمة جديدة بمجرد رؤية أمثلة قليلة (مثل إظهار نموذج لسؤال وإجابة). اختبر الباحثون ما إذا كانت هذه "الخدعة السحرية" تعمل بشكل مختلف للغات المختلفة.
- النتيجة: الخدعة لا تتعلق باللغة؛ بل تتعلق بـ "شخصية" الذكاء الاصطناعي (تصميمه).
- بعض نماذج الذكاء الاصطناعي (مثل "Nemotron") تصبح أكثر ذكاءً عند عرض أمثلة عليها، بغض النظر عما إذا كان النص أوكرانيًا أو بولنديًا أو روسيًا.
- نماذج أخرى (مثل "Maverick") تصبح في الواقع "أغبى" عند عرض أمثلة عليها، وهذا يحدث أيضًا بغض النظر عن اللغة.
- الدرس: لا تلم اللغة على ارتباك الذكاء الاصطناعي. بل لُم تصميم الذكاء الاصطناعي. إذا فشل الذكاء الاصطناعي في التعامل مع الأمثلة بالإنجليزية، فمن المرجح أن يفشل مع الأمثلة بالأوكرانية أيضًا.
5. لماذا بعض نماذج الذكاء الاصطناعي أفضل في التقطيع
نظر الباحثون "تحت الغطاء" ليروا كيف تقوم نماذج الذكما الاصطناعي المختلفة بتقطيع الكلمات.
- المقطعون الجيدون: بعض النماذج (مثل Gemma 2) تقطع الكلمات الأوكرانية عند حدود "المورفيمات" الطبيعية (الأجزاء ذات المعنى في الكلمة، مثل الجذور والنهايات). هذا فعال.
- المقطعون السيئون: نماذج أخرى (مثل Qwen3) تقطع الكلمات في أماكن عشوائية، وتقسم أحيانًا جزءًا واحدًا ذا معنى إلى نصفين. يشبه الأمر قطع شطيرة في منتصف قطعة المخلل بدلًا من بين شرائح الخبز.
- المفاجأة: امتلاك قاموس أكبر (مفردات) لا يضمن تقطيعًا أفضل. بعض النماذج ذات القواميس الضخمة لا تزال تقطع الكلمات الأوكرانية إلى قطع صغيرة وغير فعالة لأنها ببساال لم تملك ما يكفي من الأمثلة الأوكرانية في بيانات التدريب الخاصة بها لتعلم التقطيع الصحيح.
ملخص التوصيات
تقترح الورقة ثلاث قواعد بسيطة لأي شخص يستخدم الذكاء الاصطناعي مع اللغة الأوكرانية أو اللغات المشابهة:
- توقع الضريبة: ضع في اعتبارك أن الأوكرانية ستكلفك ضعف تكلفة الإنجليزية تقريبًا.
- اختبر مرة واحدة: تحتاج فقط لقياس "الضريبة" مرة واحدة؛ فهي تنطبق على جميع المواضيع.
- كن حذرًا مع الأمثلة: لا تفترض أن إظهار أمثلة للذكاء الاصطناعي سيساعد. بالنسبة لبعض النماذج، قد يضر ذلك الأداء، وهذا يحدث في كل لغة.
الخلاصة: عالم الذكاء الاصطناعي مبني حاليًا بانحياز للغة الإنجليزية. وإلى أن يتم موازنة "المكتبات" الخاصة ببيانات التدريب، ستدفع لغات مثل الأوكرانية "ضريبة خطوة" خفية لمجرد أن تُفهم.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.