← أحدث الأبحاث
🤖 machine learning

BrahmicTokenizer-131K: An Indic-Capable Drop-In Replacement for o200k_base

تقدم الورقة البحثية BrahmicTokenizer-131K، وهو بديل جاهز للاستخدام لـ o200k_base الخاص بـ OpenAI، والذي يحقق ضغطاً فائقاً للغات الهندية من خلال عملية تعديل جراحية للمفردات مع الحفاظ على أداء تنافسي في مهام اللغة الإنجليزية والبرمجة والرياضيات.

المؤلفون الأصليون: Rohan Shravan

نُشر 2026-05-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Rohan Shravan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول حزم حقيبة سفر لرحلة تتضمن مدناً ناطقة بالإنجليزية وتسعة أقاليم مختلفة في الهند، لكل منها أبجدية فريدة (مثل ديفاناغاري، أو تاميل، أو أوديا).

المشكلة: الحقيبة "التي تناسب الجميع"
حالياً، تستخدم معظم نماذج الذكاء الاصطناعي "حقيبة" (مُجزئ - Tokenizer) قياسية مصممة أساساً للغة الإنجليزية وبعض اللغات الأوروبية. وعندما تحاول حزم لغات هندية في هذه الحقيبة، فإنها لا تتناسب معها جيداً.

  • التشبيه: تخيل أنك تحاول حزم ساري هندي رقيق ومعقد في حقيبة مصممة للقمصان (T-shirts). الحقيبة لا تحتوي على المقصورات الصحيحة، لذا فهي تضطر لطي الساري إلى قطع صغيرة وفوضوية.
  • النتيجة: قد يتم تقطيع كلمة واحدة في لغة هندية مثل "أوديا" إلى ثلاث قطع منفصلة فقط لتناسب الحقيبة. في المقابل، قد تتسع كلمة إنجليزية في قطعة واحدة. هذا يجعل "الحقيبة" (البيانات التي يعالجها الذكاء الاصطناعي) أثقل وأغلى تكلفة في الحمل، رغم أن كمية المعلومات الفعلية هي نفسها.

الحل: BrahmicTokenizer-131K
قام مؤلفو هذه الورقة البحثية بابتكار حقيبة جديدة وأكثر ذكاءً تسمى BrahmicTokenizer-131K. هم لم يصنعوا حقيبة من الصفر؛ بل أخذوا حقيبة عالية الجودة وشائعة جداً (o200k_base من OpenAI) وأجروا عليها "عملية جراحية" لجعلها مثالية للغات الهندية دون إفساد قدرتها على حمل الإنجليزية أو البرمجة.

إليكم كيف فعلوا ذلك، باستخدام خطوات بسيطة:

1. "إزالة الفوضى" (المرحلة الأولى)

كانت الحقيبة الأصلية تحتوي على 200,000 مقصورة. الكثير من هذه المقصورات كانت مليئة بأشياء للغات لا يحتاجونها لهذه الرحلة تحديداً (مثل الكورية، اليابانية، العربية، أو الروسية).

  • الإجراء: قاموا بالتخلص من 38,000 من تلك المقصورات غير المستخدمة.
  • النتيجة: أصبح لديهم الآن حقيبة أنظف وأصغر تحتوي على 131,072 مقصورة بالضبط، جاهزة لإعادة الترتيب.

2. "التعديل الجراحي" (المرحلة الثانية)

الآن أصبح لديهم مساحات فارغة في الحقيبة. وبدلاً من تركها فارغة، ملؤوها بعناية بكلمات وحروف هندية عالية التكرار.

  • الاستراتيجية: استخدموا صيغة رياضية (البرمجة الخطية) لتحديد الكلمات الهندية التي تستحق مكاناً. لقد أعطوا الأولوية للغات التي تم تجاهلها سابقاً، مثل "أوديا".
  • السحر: أضافوا 725 مقصورة محددة خصيصاً لحروف "أوديا". قبل ذلك، كانت الحقيبة تحتوي على صفر مكان لـ "أوديا"، مما كان يجبر كل حرف "أوديا" على التفكك إلى قطع صغيرة وغير فعالة. أما الآن، فيمكنهم استيعاب كلمات "أوديا" كاملة أو أجزاء كبيرة منها.

3. ميزة "التركيب المباشر"

أفضل ما في الأمر هو أن هذه الحقيبة الجديدة تبدو تماماً مثل القديمة من الخارج.

  • التشبيه: يشبه الأمر استبدال محرك سيارة قياسي بمحرك عالي الأداء يناسب تماماً نفس تجويف المحرك. ليس عليك إعادة بناء السيارة، أو تغيير الإطارات، أو إعادة كتابة دليل الاستخدام.
  • الادعاء: أي مسار تدريب للذكاء الاصطناناعي كان يستخدم الحقيبة القديمة يمكنه ببساطة استبدالها بهذه الحقيبة الجديدة، وسيعمل فوراً.

النتائج: ماذا تغير؟

اختبرت الورقة البحثية هذه الحقيبة الجديدة على مجموعة ضخمة تضم 27 مليون وثيقة هندية. وإليكم ما وجدوه:

  • توفير هائل: بالنسبة للغات الهندية، أنتجت هذه الحقيبة الجديدة قطعاً (Tokens) أقل بنسبة 26.7% من أفضل المنافسين الحاليين (Tekken/Sarvam-m).
    • مثال: بالنسبة للغة "أوديا"، كان التحسن ضخماً. كانت الحقيبة القديمة تحتاج إلى 4.3 ضعف عدد القطع لحمل نفس النص. أما الحقيبة الجديدة فتحمله بكفاءة.
  • لا توجد مقايضات: عادةً، عندما تجعل حقيبة أفضل لشيء ما، تصبح أسوأ لشيء آخر. لكن هذه الحقيبة الجديدة هي "رابح عام".
    • هي جيدة جداً في حزم الكلمات الإنجليزية مثل الأصلية تماماً.
    • وهي في الواقع أفضل في حزم أكواد الكمبيوتر والمسائل الرياضية من المنافسين.
  • مقايضة "المتخصص" مقابل "العام":
    • هناك حقائب أخرى مصممة فقط للغات الهندية (متخصصة). هي تحزم الكلمات الهندية بشكل أفضل قليلاً (بنسبة 12-18% تقريباً).
    • ومع ذلك، فإن تلك الحقائب المتخصصة سيئة جداً في حزم الإنجليزية أو البرمجة.
    • BrahmicTokenizer-131K هو الوحيد الذي يتفوق في كل شيء (اللغات الهندية، الإنجليزية، البرمجة، والرياضيات) جميعاً في آن واحد، ضمن نفس حدود الحجم.

الملخص

تقدم الورقة البحثية أداة تعالج عدم الكفاءة الهيكلية في كيفية تعامل الذكاء الاصطناعي مع اللغات الهندية. فمن خلال إزالة خانات اللغات غير المستخدمة جراحياً واستبدالها بخانات مختارة بعناية للغات الهندية، ابتكروا مُجزئاً يوفر كميات هائلة من قدرة الحوسبة للغات الهندية مع الحفاظ على الأداء العالي للإنجليزية والبرمجة التي تعتمد عليها نماذج الذكاء الاصطناعي الحديثة. إنها ترقية "تركيب مباشر" تجعل تدريب الذكاء الاصطناعي أرخص وأسرع على البيانات الهندية دون التضحية بقدرته على التحدث بالإنجليزية أو كتابة الأكواد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →