← أحدث الأبحاث
💻 computer science

A Survey of Token Compression for Efficient Multimodal Large Language Models

تقدم هذه الورقة أول مسح منهجي لتقنيات ضغط الرموز (token compression) من أجل نماذج اللغات الكبيرة متعددة الوسائط الفعالة، حيث تصنف الأساليب الحالية بناءً على وسائطها المستهدفة (الصورة، والفيديو، والصوت) وآلياتها الأساسية لتوحيد التقدم الحالي وتوجيه الأبحاث المستقبلية.

المؤلفون الأصليون: Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

نُشر 2026-02-03
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً فائق الذكاء (نموذج لغوي كبير متعدد الوسائط، أو MLLM)، يمكنه قراءة النصوص، والنظر إلى الصور، ومشاهدة الفيديوهات، والاستماع إلى الصوت. هذا المساعد موهوب للغاية، لكن لديه مشكلة رئيسية: يشعر بالارتباك والإنهاك عندما تعطيه الكثير من المعلومات دفعة واحدة.

فكر في المعلومات التي يتلقاها المساعد كتدفق من "الرموز" (Tokens) (وهي قطع صغيرة من البيانات).

  • النص (Text): يشبه رسالة قصيرة.
  • الصورة عالية الدقة (High-resolution photo): تشبه رسالة تم تكبيرها لتصبح جدارية ضخمة ومفصلة.
  • الفيديو (Video): يشبه مكتبة تضم آلاف من تلك الجداريات، تتغير كل ثانية.
  • الصوت (Audio): يشبه تدفقاً مستمراً وعالي السرعة من الموجات الصوتية.

عندما تغذي هذا المساعد بفيلم مدته 90 دقيقة، فهو لا يرى "فيلماً واحداً" فحسب؛ بل يرى 54 مليون رمز. هذا يشبه محاولة قراءة مكتبة من الكتب في نفس واحد. إن "آلية الانتباه الذاتي" (Self-attention mechanism) في عقل المساعد يجب أن تقارن كل رمز بكل الرموز الأخرى. الرياضيات لهذا الأمر تصبح ثقيلة جداً وبسرعة هائلة، مما يؤدي إلى نفاد ذاكرة الكمبيوتر أو استغراق وقت طويل جداً للإجابة.

الحل: ضغط الرموز (Token Compression)
هذه الورقة البحثية هي بمثابة دليل شامل (مسح شامل) حول كيفية تعليم هذا المساعد أن يكون أكثر كفاءة دون أن يفقد ذكاءه. يطلق المؤلفون على هذا الأمر اسم "ضغط الرموز".

فكر في ضغط الرموز كعملية تعبئة حقيبة سفر لرحلة ما.

  • المشكلة: لديك حقيبة مليئة بالملابس، لكن 80% منها مكررة (مثل 50 قميصاً أبيض متطابقاً) أو أشياء لا تحتاجها (مثل معطف شتوي ثقيل لرحلة إلى الشاطئ).
  • الهدف: تريد وضع كل الأشياء المهمة في حقيبة أصغر حتى تسافر بشكل أسرع، دون أن تترك خلفك الأشياء التي تحتاجها بالفعل.

تنظم الورقة جميع الطرق الحالية لـ "تعبئة" هذه البيانات بطريقتين للنظر إلى المشكلة: ما هو نوع البيانات؟ و كيف نقوم بالتعبئة؟

1. التعبئة حسب نوع البيانات (الـ "ماذا")

تختلف أنواع البيانات المختلفة في أنواع "الزحام" (التكرار) التي تحتوي عليها.

  • الصور (الصورة الثابتة):
    • الزحام: صورة لسماء زرقاء تحتوي على ملايين البكسلات الزرقاء التي هي جميعاً متطابقة تماماً.
    • الحل: بدلاً من إرسال كل بكسل أزرق، يقوم الكمبيوتر بتجميعها معاً. يقول: "هذه المنطقة بأكملها هي مجرد سماء زرقاء"، ويرسل رمزاً واحداً لتمثيل تلك المنطقة بالكامل.
  • الفيديو (الصورة المتحركة):
    • الزحام: في فيديو لشخص يتحدث، تظل الخلفية (جدار أو شجرة) ثابتة تماماً لمدة 10 ثوانٍ بينما يتحرك الشخص قليلاً.
    • الحل: يدرك الكمبيوتر: "لسنا بحاجة لإرسال الخلفية 30 مرة في الثانية". فهو يحتفظ بالخلفية مرة واحدة ويرسل فقط التحديثات للأجزاء المتحركة. الأمر يشبه إرسة "سجل تغييرات" بدلاً من إعادة إرسال المشهد بأكمله في كل إطار.
  • الصوت (الموجة الصوتية):
    • الزحام: غالباً ما يحتوي تسجيل لصوت ما على فترات صمت طويلة، أو صمت، أو طنين خلفي لا يضيف معنى.
    • الحل: يقوم الكمبيوتر بقص الصمت ودمج الأصوات المتشابهة، محتفظاً فقط بالأجزاء التي يتحدث فيها الصوت فعلياً أو حيث تتغير الموسيقى.

2. التعبئة حسب الطريقة (الـ "كيف")

تصنف الورقة التقنيات المستخدمة للقيام بعملية التعبئة هذه إلى أربع استراتيجيات رئيسية:

  • "أداة التصغير" (القائمة على التحويل - Transformation-based):
    تخيل أنك تأخذ صورة عالية الدقة وتقوم ببساطة بتصغير حجمها. ستفقد بعض التفاصيل، لكنك ستحافظ على الشكل العام والألوان. يتم ذلك عن طريق ضغط البيانات رياضياً (مثل التجميع أو المتوسط الحسابي) لجعل قائمة الرموز أقصر.
  • "لعبة التجميع" (القائمة على التشابه - Similarity-based):
    تخيل أن لديك كومة من 1,000 قطعة ليغو حمراء. بدلاً من سرد الـ 1,000 قطعة جميعها، تقول: "هنا توجد قطعة ليغو حمراء واحدة، وهناك 999 قطعة أخرى مثلها تماماً". يقوم الكمبيوتر بإيجاد الرموز التي تبدو أو تبدو متشابهة جداً ويدمجها في رمز "تمثيلي" واحد.
  • "تسليط الضوء" (القائمة على الانتباه - Attention-based):
    تخيل معلماً ينظر إلى فصل دراسي. المعلم يهتم فقط بالطلاب الذين يرفعون أيديهم (الرموز المهمة) ويتجاهل أولئك النائمين في الخلف. يقوم الكمبيوتر بالنظر إلى "درجات الانتباه" الخاصة به (مدى اهتمامه بكل قطعة من البيانات) ويتخلص من الرموز التي يتجاهلها على أي حال.
  • "دليل الأسئلة" (القائمة على الاستعلام - Query-based):
    تخيل أنك تبحث عن إبرة محددة في كومة قش. بدلاً من البحث في كل قطعة قش، تسأل: "أين الإبرة؟". يستخدم الكمبيوتر سؤالك (الاستعلام) لتصفية كل شيء لا يتطابق مع ما تسأل عنه، محتفظاً فقط بالرموز ذات الصلة.

لماذا هذا مهم؟

يوضح المؤلفون أن هذا ليس مجرد جعل الحواسيب تعمل بشكل أسرع، بل يتعلق بجعلها قابلة للاستخدام.

  • بدون ضغط الرموز، يكون من المستحيل على النماذج الحالية معالجة فيلم مدته 90 دقيقة في الوقت الفعلي.
  • مع ضغط الرموز، يمكن للنموذج "مشاهدة" الفيلم، وفهم الحبكة، والإجابة على الأسئلة حوله، كل ذلك مع استخدام جزء بسيط من الذاكرة.

العقبة (التحديات)

تحذر الورقة أيضاً من أن هذا ليس سحراً. إذا ضغطت الحقيبة بقوة شديدة:

  • قد تفقد التفاصيل: إذا ضغطت صورة بشكل مبالغ فيه، فقد تفقد علامة صغيرة ولكنها مهمة في الخلفية.
  • إنه يقطع التدفق: في الفيديو، إذا دمجت الكثير من الإطارات، فقد تبدو الحركة متقطعة أو مربكة.
  • من الصعب الملاءمة: بعض حيل "التعبئة" هذه يصعب استخدامها مع أسرع شرائح الكمبيوتر المتاحة اليوم لأنها تتطلب من الكمبيوتر التوقف وحساب الأشياء بشكل مختلف.

باختصار:
هذه الورقة هي خريطة للباحثين. تقول: "لدينا مشكلة: الذكاء الاصطناعي الخاص بنا يغرق في الكثير من البيانات. إليكم جميع الطرق المختلفة التي نحاول من خلالها تعليمه كيفية تصفية وتجميع وتقليص تلك البيانات لكي يتمكن من العمل فعلياً في العالم الحقيقي". إنها تنظم هذه الأساليب بناءً على ما إذا كانت تنظر إلى الصور أو الفيديوهات أو الأصوات، وبناءً على الحيل الرياضية المحددة المستخدمة للقيام بالمهمة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →