← أحدث الأبحاث
💬 NLP

MoBiQuant: Mixture-of-Bits Quantization for Token-Adaptive Elastic LLMs

تقدم هذه الورقة MoBiQuant، وهو إطار عمل جديد للكمّ من نوع "خليط البتات" (Mixture-of-Bits) يعالج تحديات النشر المرن للنماذج اللغوية الكبيرة (LLMs) عبر ضبط دقة الأوزان ديناميكيًا بناءً على الحساسية على مستوى الرمز (token-level sensitivity) وموجه مدرك للرموز (token-aware router)، مما يتيح تبديل الدقة بسلاسة أثناء وقت التشغيل دون الحاجة إلى معايرة متكررة مع مطابقة أداء الكمّ بعد التدريب الخاص بكل دقة بت محددة.

المؤلفون الأصليون: Dongwei Wang, Jinhee Kim, Seokho Han, Denis Gudovskiy, Yohei Nakata, Tomoyuki Okuno, KhayTze Peong, Kang Eun Jeon, Jong Hwan Ko, Yiran Chen, Huanrui Yang

نُشر 2026-02-25
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Dongwei Wang, Jinhee Kim, Seokho Han, Denis Gudovskiy, Yohei Nakata, Tomoyuki Okuno, KhayTze Peong, Kang Eun Jeon, Jong Hwan Ko, Yiran Chen, Huanrui Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة وذكية للغاية (نموذج لغوي كبير، أو LLM) يمكنها الإجابة على أي سؤال، أو كتابة كود برمجي، أو سرد القصص. لكن هناك عقبة: هذه المكتبة ضخمة جدًا لدرجة أنها تشغل مستودعًا بأكمله لتخزينها، وقراءة كتاب واحد تتطلب شاحنة ضخمة ومكلفة لتوصيله.

تخيل الآن أنك تريد أخذ هذه المكتبة معك. أحيانًا تكون في مكتب كبير مع شاحنة قوية (خادم سحابي). وأحيانًا أخرى تكون في حافلة صغيرة (هاتف أو كمبيوتر محمول) بمساحة ووقود محدودين.

المشكلة: البدلة "التي تناسب الجميع"
في الوقت الحالي، لجعل هذه المكتبات الضخمة تتناسب مع الأجهزة الأصغر، نستخدم تقنية تسمى التكميم (Quantization). فكر في هذا كعملية تصغير للكتب. بدلًا من طباعة كل كلمة بدقة عالية (32-bit floating point)، نقوم بطباعتها باللون الأبيض والأسود، أو حتى برسومات بسيطة (3-bit أو 4-bit integers). هذا يجعل الكتب صغيرة وسهلة الحمل.

ومع ذلك، هناك عيب رئيسي في الطريقة التي نتبعها اليوم:

  • البدلة الصلبة: إذا صغرت المكتبة لتناسب بدلة "4-bit"، فستكون مثالية. ولكن إذا احتجت فجأة إلى التبديل إلى بدلة "3-bit" لأن حافلتك أصبحت أصغر، فإن البدلة "4-bit" لن تتقلص فحسب؛ بل ستنهار. ستصبح الكلمات مشوهة، ويضيع المعنى.
  • مشكلة "القيم المتطرفة" (Outliers): في هذه المكتبات الضخمة، هناك بعض الكلمات النادرة والمهمة (مثل "quantum" أو "neutrino"). عندما نصغر الكتب، غالبًا ما تتعرض هذه الكلمات النادرة للتشويه بشكل أكبر. اكتشفت الورقة البحثية شيئًا مفاجئًا: مدى تشوه الكلمات يعتمد كليًا على مدى تصغيرك للكتاب. الكلمة التي قد تبدو جيدة في كتاب "4-bit" قد تصبح فوضى في كتاب "3-bit"، بينما الكلمة التي كانت جيدة في "3-bit" قد تتعطل في "4-bit". وهذا ما يسمى بـ "هجرة القيم المتطرفة" (Outlier Migration).

بسبب هذا، يتعين عليك عادةً إعادة تدريب أو إعادة معايرة المكتبة في كل مرة تريد فيها تغيير حجم البدلة. لا يمكنك التبديل بين الأحجام أثناء التشغيل.

الحل: MoBiQuant (خزانة الملابس "المتنوعة")
ابتكر مؤلفو هذه الورقة البحثية، MoBiQuant، طريقة جديدة ومذهلة لتعبئة هذه المكتبات. بدلًا من إجبار المكتبة بأكملها على الحجم في مقاس واحد، أنشأوا نظام "مزيج من البتات" (Mixture-of-Bits).

إليك كيف يعمل، باستخدام تشبيه بسيط:

1. أوزان "دمى الماتريوشكا" (MoBiSlice)

تخيل أن كل وزن في الذكاء الاصطناعي ليس مجرد رقم واحد، بل هو مجموعة من دمى الماتريوشكا (الدمى الروسية المتداخلة).

  • الدمية الأكبر هي القاعدة (Base) (الجزء الأكثر أهمًا، مثل الفكرة الرئيسية للجملة).
  • داخلها توجد دمية المتبقي (Residual) (تفصيل إضافي صغير).
  • داخل تلك، توجد دمية متبقي أخرى (تفصيل أدق).

في الطريقة القديمة، كان عليك رمي الدمى الداخلية لجعل الكتاب أصغر. في MoBiQuant، أنت تحتفظ بجميع الدمى في نفس الصندوق.

  • إذا كان لديك شاحنة كبيرة (قدرة عالية)، تفتح الصندوق وتستخدم جميع الدمى (دقة عالية).
  • إذا كان لديك حقيبة ظهر صغيرة (قدرة منخفضة)، تأخذ فقط الدمى العلوية وتترك الباقي خلفك (دقة منخفضة).
  • السحر: نظرًا لأن الدمى متداخلة بشكل مثالي، يمكنك التبديل بين 2 أو 3 أو 4 أو 6 بت فورًا دون أن تنهار المكتبة. لا حاجة لإعادة المعايرة!

2. "الأمين الذكي للمكتبة" (MoBiRoute)

الآن، إليك الجزء العبقري حقًا. أدركت الورقة البحثية أن ليست كل الكلمات في الجملة تحتاج إلى نفس القدر من التفاصيل.

  • الكلمات الشائعة مثل "the" أو "is" أو "and" بسيطة، ولا تحتاج إلى الدمى الداخلية. هي تكتفي بالقاعدة فقط.
  • الكلمات النادرة والمعقدة مثل "photosynthesis" أو "algorithm" صعبة، وهي تحتاج إلى جميع الدمى الداخلية ليتم فهمها بشكل صحيح.

يقدم MoBiQuant أمين مكتبة ذكيًا (موجه/Router) ينظر إلى كل كلمة (Token) أثناء معالجتها.

  • يسأل أمين المكتبة: "هل هذه الكلمة صعبة؟"
  • إذا كانت الإجابة نعم: "افتح الصندوق واستخدم 4 أو 6 بت لهذه الكلمة!"
  • إذا كانت الإجابة لا: "استخدم فقط الطبقة الأساسية (2 بت) لهذه الكلمة."

يحدث هذا ديناميكيًا لكل كلمة في الجملة. بعض الكلمات تحصل على "معاملة كبار الشخصيات" (VIP treatment) (دقة عالية)، بينما تحصل كلمات أخرى على "معاملة الاقتصاد" (low precision). تظل الدقة المتوسطة منخفضة بما يكفي لتناسب هاتفك، لكن الأجزاء المهمة تظل حادة وواضحة.

لماذا يعد هذا تغييرًا لقواعد اللعبة؟

  • المرونة (Elasticity): يمكنك تشغيل نفس نموذج الذكاء الاصطناعي على كمبيوتر خارق اليوم وعلى ساعة ذكية غدًا. النموذج ببساطة "يقلص" نفسه أثناء التشغيل عبر تحديد عدد الدمى التي سيفتحها لكل كلمة.
  • لا إعادة تدريب: لست بحاجة لإعادة تعليم الذكاء الاصطناك كيفية التحدث في كل مرة تغير فيها الجهاز. إنه يتكيف فورًا.
  • السرعة: نظرًا لأن النظام مصمم لجلب "الدمى" التي يحتاجها بالفعل فقط، فإنه يعمل بشكل أسرع ويستهلك ذاكرة أقل. أظهر المؤلفون أنه يمكن أن يكون أسرع بمقدار 2.7 مرة على وحدات معالجة الرسومات (GPUs) الحديثة.

الخلا الخلاصة

MoBiQuant يشبه منح مكتبة ضخمة وثقيلة خزانة ملابس سحرية. بدلًا من الاضطرار لشراء مكتبة أصغر لكل سيارة تقودها، أنت فقط تجهز الملابس المناسبة للرحلة. إذا كان الطريق وعرًا (طاقة منخفضة)، فستحمل أمتعة خفيفة. وإذا كان الطريق سلسًا (طاقة عالية)، فستحمل الزي الكامل. والأفضل من ذلك؟ الملابس مصممة بحيث تتناسب مع بعضها البعض تمامًا مهما كان العدد الذي تأخذه.

هذا يجعل الذكاء الاصطناعي القوي متاحًا للجميع، في كل مكان، بغضًا عن قيود أجهزتهم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →