FLEXITOKENS: Flexible Tokenization for Evolving Language Models
تقدم الورقة البحثية FLEXITOKENS، وهي طريقة ترميز مرنة لنماذج اللغة على مستوى البايت تستخدم متنبئ حدود قابل للتعلم مع هدف تدريب مبسط للتغلب على جمود أجهزة الترميز الثابتة، مما يقلل من التجزئة المفرطة ويحقق تحسينات في الأداء تصل إلى 10% عبر لغات ومهام متنوعة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تحاول تعليم روبوت كيف يقرأ ويفهم العالم. للقيام بذلك، يحتاج الروبوت إلى تقسيم الجمل إلى قطع أصغر وأسهل في الإدارة تسمى "الرموز" (tokens). فكر في الرموز كأنها الطوب الذي يستخدمه البنّاء لبناء جدار.
لفترة طويلة، استخدمت الروبوتات مجموعة ثابتة للغاية من الطوب. كانت هذه الطوبات مقطوعة مسبقاً إلى أشكال محددة (مثل "un-"، "do"، "able") بناءً على كتاب قواعد ثابت. هذا يعمل بشكل رائع مع اللغات والمواضيع التي تدرب عليها الروبوت في الأصل. ولكن، بمجرد أن يحاول الروبوت قراءة شيء جديد — مثل مجلة طبية، أو دليل برمجي، أو لغة لم يرها من قبل — تسبب هذه القواعد الثابتة مشاكل.
المشكلة: "الطوبة الواحدة التي تناسب الجميع"
تسمي الورقة البحثية هذه المشكلة التجزئة المفرطة (over-fragmentation).
تخيل أنك تحاول بناء جدار من شريط طويل ومستمر من النص. إذا كان كتاب القواعد الخاص بك يقول: "في كل مرة ترى فيها شرطة (-)، اقطع الشريط"، فقد ينتهي بك الأمر بتقطيع كلمة واحدة مثل "hypertrophic" (مصطلح طبي) إلى قطع صغيرة عديمة الفائدة: "hyper"، "tro"، "phic".
- النتيجة: يتعين على الروبوت حمل الكثير من الطوب الصغير جداً لبناء الجدار. وهذا يجعل عملية البناء بطيئة، ومكلفة (من حيث قدرة الكمبيوتر)، ومربكة. يفقد الروبوت معنى الكلمة بأكملها لأنه مشغول جداً بالنظر إلى القطع الصغيرة المكسورة.
- الطريقة القديمة: الطرق التقليدية (مثل BPE) تشبه مصنعاً يقطع جميع الطوب مسبقاً قبل أن يبدأ الروبوت في البناء حتى. وبمجرد قطع الطوب، لا يمكن تغييره، حتى لو كان الروبوت يبني نوعاً مختلفاً من المنازل لاحقاً.
الحل: FLEXITOKENS
يقترح مؤلفو هذه الورقة البحثية، FLEXITOKENS، طريقة أكثر ذكاءً ومرونة. بدلاً من استخدام طوب مقطوع مسبقاً، هم يعطون الروبوت قاطعاً ذكياً ومرناً يتعلم كيفية تقطيع الشريط أثناء بنائه.
إليك كيف فعلوا ذلك، باستخدام تشبيه بسيط:
القاعدة القديمة (فخ "الضغط الثابت"):
حاولت المحاولات السابقة لجعل الروبوتات تقطع طوبها الخاص استخدام قاعدة صارمة: "يجب عليك تقطيع الشريط بحيث ينتهي بك الأمر بـ 3 طوبات لكل 10 بوصات من النص".- العيب: إذا كان النص بلغة تكون فيها الكلمات طويلة بطبيعتها (مثل التركية)، فإن فرض قاعدة الـ 3 طوبات قد يؤدي إلى تقطيع كلمة واحدة إلى قطع صغيرة عديمة المعنى. وإذا كان النص بلغة تكون فيها الكلمات قصيرة (مثل الصينية)، فإن نفس القاعدة قد تلصق كلمتين مختلفتين معاً لتصبحا كتلة واحدة مربكة. كانت القاعدة جامدة للغاية بحيث لا تستطيع التكيف مع "شكل" النص المحدد.
القاعدة الجديدة (FLEXITOKENS):
تغير FLEXITOKENS القاعدة إلى نطاق مرن. بدلاً من قول: "يجب أن يكون لديك 3 طوبات بالضبط"، تقول: "يمكنك الحصول على أي عدد يتراوح بين 2 و 4 طوبات، اعتماداً على ما يبدو منطقياً لهذه الجملة المحددة".- خسارة "المفصل" (Hinge Loss): تقدم الورقة البحثية طريقة تدريب خاصة (خسارة تشبه المفصل) تعمل كمنطقة أمان. إذا قطع الروبوت النص إلى عدد من القطع يقع ضمن النطاق الآمن، يحصل الروبوت على "إعفاء" — لا توجد عقوبة. هذا يسمح للروبوت بأن يكون مرناً. يمكنه تقطيع مصطلح طبي طويل إلى طوبة واحدة كبيرة وذات معنى، أو تقطيع جملة قصيرة إلى العديد من الطوبات الصغيرة، أيهما يساعده على فهم المعنى بشكل أفضل.
ماذا حدث عندما جربوا ذلك؟
اختبر الباحثون هذا القاطع المرن الجديد على العديد من اللغات المختلفة (بما في ذلك الإنجليزية والإسبانية والروسية والهندية والتيلوجو) ومواضيع مختلفة (مثل الطب والبرمجة).
- فوضى أقل: توقف الروبوت عن تقطيع الكلمات دون داعٍ. على سبيل المثال، في نص طبي، تعلم كيفية إبقاء "hypertrophic" كوحدة واحدة متماسكة بدلاً من تفكيكها إلى قطع حطام.
- أسرع وأذكى: نظرًا لأن الروبوت لم يعد مضطراً لحمل الكثير من الطوب الصغير المكسور، فقد عالج المعلومات بشكل أسرع واستخدم ذاكرة كمبيوتر أقل.
- أداء أفضل: في مهام مثل الترجمة وفهم الجمل، كان أداء الروبوت المزود بالقاطع المرن أفضل من الروبوتات التي تستخدم الطرق القديمة الجامدة. حتى أنه تعامل مع لغات لم يسبق له رؤيتها (مثل الأردية) بشكل أفضل بكثير، دون تفكيكها إلى قطع صغيرة ومربكة.
الخلاصة
فكر في FLEXITOKENS كترقية للروبوت من استخدام مجموعة ألعاب بلاستيكية ذات طوب مقطع مسبقاً إلى استخدام طابعة ثلاثية الأبعاد ذكية يمكنها طباعة طوب بالحجم والشكل المثاليين لأي شيء تبنيه في تلك اللحظة.
من خلال السماح للروبوت بتقرير كيفية تفكيك الكلمات بناءً على السياق (بدلاً من إجباره على قاعدة ثابتة)، تظهر الورقة البحثية أن نماذج اللغة يمكن أن تصبح أكثر كفاءة، وتتعامل مع لغات جديدة بشكل أفضل، وتفهم مواضيع معقدة مثل الطب دون الارتباك بسبب النص "المقطع بشكل مفرط".
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.