← أحدث الأبحاث
💬 NLP

LiteToken: Removing Intermediate Merge Residues From BPE Tokenizers

تقدم هذه الورقة LiteToken، وهي طريقة تحدد وتزيل الرموز "المتبقية" غير المتكررة من مفردات BPE لتقليل معلمات النموذج وتحسين المتانة ضد المدخلات الضوضائية، وغالبًا دون الحاجة إلى ضبط إضافي للنماذج سابقة التدريب.

المؤلفون الأصليون: Yike Sun, Haotong Yang, Zhouchen Lin, Muhan Zhang

نُشر 2026-02-05
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yike Sun, Haotong Yang, Zhouchen Lin, Muhan Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تعلم روبوتًا كيفية قراءة وكتابة لغة البشر. للقيال بذلك، عليك أولاً تقسيم الجمل إلى قطع صغيرة تسمى "الرموز" (tokens) (مثل الكلمات أو أجزاء من الكلمات) التي يمكن للروبوت فهمها. الطريقة الأكثر شيوعًا للقيام بذلك هي طريقة تسمى BPE (ترميز زوج البايت).

فكر في عملية BPE كأنها طاقم بناء يبني مفردات من الصفر. يبدأون بالحروف الفردية. ثم ينظرون إلى مكتبة ضخمة من الكتب ويقولون: "مهلاً، الحرفان 't' و 'h' يظهران معًا طوال الوقت. لنلصقهما في كتلة جديدة تسمى 'th'". لاحقًا، يرون أن 'th' و 'e' يجتمعان كثيرًا، فيقومون بلصقهما لصنع 'the'. يستمرون في فعل ذلك، ويبنون كتلًا أكبر فأكبر.

المشكلة: "السقالات" المتروكة خلفهم

تحدد الورقة البحثية أثرًا جانبيًا فوضويًا لعملية البناء هذه. أحيانًا، يبني الطاقم كتلة مؤقتة (مثل "includ") لأنها كانت شائعة جدًا في تلك اللحظة من مرحلة البناء. ولكن لاحقًا، يبنون كتلة أكبر ("include" أو "including").

في العالم المثالي، سيقوم الطاقم بهدم كتلة "includ" المؤقتة ويرميها. لكن في طريقة BPE الحالية، يتركونها قائمة في قائمة المفردات على أي حال.

يطلق المؤلفون على هذه الكتل المتبقية اسم "بقايا الدمج الوسيطة" (Intermediate Merge Residues).

  • التشبيه: تخيل أنك تبني منزلًا. تستخدم سقالات مؤقتة للوصول إلى الطابق الثاني. بمجرد وضع السقف، تقوم بإزالة السقالات. ولكن في هذا السيناريو، نسي طاقم البناء إزالة السقالات. الآن، منزلك مليء بالأعمدة الخشبية غير المفيدة التي تشغل مساحة، وتبدو قبيحة، وتسبب الارتباك لأي شخص يحاول السير عبر الغرف.

هذه "رموز السقالات" (مثل "includ"، "delet"، "framewor") نادرًا ما تُستخدم في الحياة الواقعية لأن الكلمات الكاملة ("include"، "delete"، "framework") هي المفضلة. ومع ذلك، فهي لا تزال تجلس في قاموس الروبوت، وتستهلك الذاكرة وقوة المعالجة. والأسوأ من ذلك، نظرًا لأن الروبوت نادراً ما يراها، فإنه يصاب بالارتباك عندما يواجهها بالفعل (مثلما يحدث عند كتابة كلمة بشكل خاطئ أو عندما يحاول مخترق خداع النظام).

الحل: LiteToken

ابتكر المؤلفون أداة تسمى LiteToken لتنظيف هذه الفوضى. إنها تشبه خدمة "التنظيف الربيعي" لقاموس الروبوت.

إليك كيف تعمل، خطوة بخ بخطوة:

  1. العمل الاستقصائي: تقوم الأداة بمسح القاموس والبحث عن تلك الرموز "السقالات". وهي تطرح سؤالين:
    • هل هذا الرمز نادر الاستخدام بمفرده؟ (تردد منخفض).
    • هل يظهر هذا الرمز فقط في مواقف محددة للغاية ويمكن التنبؤ بها؟ (إنتروبيا منخفضة أو تنوع منخفض).
    • مثال: إذا كان الرمز "includ" يظهر دائمًا فقط قبل "e" أو "ing"، فمن المحتمل أنه مجرد قطعة متبقية. ولكن إذا كان الرمز مثل "re" يظهر في "rewrite" و "recover" و "refund"، فهو لب بناء مفيد، لذا يبقى.
  2. الإزالة: بمجرد تحديدها، يتم تحديد هذه الرموز غير المفيدة للإزالة.
  3. إعادة التجميع: إذا واجه الروبوت كلمة كانت في السابق مقسمة بواسطة هذه الرموز غير المفيدة، تقوم الأداة بتفكيك الكلمة إلى حروفها الأساسية ثم تعيد بناءها باستخدام الكتل الجيدة والمفيدة فقط. إنه يشبه تفكيك السقالات واستبدالها بجدار صلب ونظيف.

النتائج: روبوت أخف وأقوى

اختبر المؤلفون هذا على عدة نماذج ذكاء اصطناعي شهيرة (مثل Qwen و Llama و GPT). وإليكم ما وجدوه:

  • إنه "جاهز للتشغيل": لا تحتاج إلى إعادة تدريب الروبوت أو تعليمه أي شيء جديد. يمكنك ببساطة استبدال القاموس القديم بالجديد المنظف، وسيعمل الروبوت بنفس الكفاءة.
  • يوفر المساحة: من خلال إزالة حوالي 5% إلى 10% من الرموز غير المفيدة، يحتاج الروبوت إلى ذاكرة أقل ويجري الحسابات بشكل أسرع. إنه يشبه إزالة الطوب الثقيل وغير المفيد من حقيبة الظهر لتتمكن من الجري بشكل أسرع.
  • أفضل في التعامل مع الأخطاء: عندما يرتكب الناس أخطاءً مطبعية أو يحاولون خداع الروبوت بمدخلات غريبة، غالبًا ما يرتبك الروبوت القديم لأنه يحاول إجبار رموز "السقالات" على صنع معنى. الروبوت الجديد "Lite" يتعامل مع هذه الأخطاء بشكل أفضل بكثير لأنه لا يعتمد على تلك الكتل الهشة وشبه المكتملة.
  • لا فقدان في الذكاء: على الرغم من إزالة هذه الرموز، لم تتراجع قدرة الروبوت على الإجابة على الأسئلة أو كتابة القصص. لقد ظل بنفس مستوى الذكاء.

الملخص

باختًا، تجادل الورقة البحثية بأن العديد من نماذج الذكاء الاصطناعي تحمل معها الكثير من "النفايات الرقمية" — أجزاء كلمات غير مكتملة وغير مفيدة تركت من مرحلة تدريبها. LiteToken هو أداة بسيطة تكنس هذه النفايات بعيدًا، مما يجعل نماذج الذكاء الاصطناعي أخف وزنًا، وأسرع، وأكثر قوة ضد الأخطاء، كل ذلك دون الحاجة إلى إعادة تدريبها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →