OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models
يُعد OmniPack إطار عمل لا يتطلب تدريباً يعمل على تعزيز كفاءة النماذج اللغوية الكبيرة متعددة الوسائط من خلال الجمع بين إزالة الفائض الهيكلي قبل مرحلة النموذج اللغوي الكبير وبين الصقل الدلالي بعد التفاعل، محققاً بذلك توازنات فائقة بين الأداء والكفاءة عبر معايير متعددة مع تقليل التكاليف الحسابية بشكل كبير.
المؤلفون الأصليون:Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding
تخيل أنك تحاول تعليم روبوت فائق الذكاء كيف يفهم العالم. أنت لا تكتفي بإعطائه كتاباً ليقرأه فحسب؛ بل تعرض له فيلماً وتشغل موسيقى تصويرية في الوقت ذاته. هذا هو عالم "الذكاء الاصطناعي متعدد الوسائط" (Omni-modal) المثير، حيث تتعلم الحواسيب كيف ترى وتسمع وتقرأ جميعاً في آن واحد. ولكن هنا تكمن المشكلة: الأفلام والموسيقى التصويرية ضخمة جداً. فثانية واحدة من الفيديو أو الصوت يمكن تقسيمها إلى آلاف "اللبنات" الرقمية الصغيرة التي تسمى "التوكنز" (tokens). إذا حاولت تغذية الروبوت بفيلم كامل، فسيصاب بالارتباك، تماماً مثل طالب يحاول قراءة مكتبة بأكملة في دقيقة واحدة. إن الأمر يستغرق وقتاً طويلاً للمعالجة، ويكلف ثروة من الكهرباء، وغالباً ما يتسبب في تشوشه بسبب الحجم الهائل للمعلومات. لقد حاول العلماء حل هذه المشكلة عبر التخلص من اللبنات "المملة" قبل أن يبدأ الروبوت في القراءة حتى، آملين في الاحتفاظ فقط باللبنات المهمة. ومع ذلك، كانت الطرق القديمة في التخلص من الأشياء خرقاء بعض الشيء؛ فقد كانت أحياناً تلقي بالخيوط الجوهرية بعيداً لمجرد أنها بدت مختلفة عن جيرانها، أو كانت تحاول تخمين ما هو مهم قبل أن تتاح للروبوت الفرصة فعلياً لفهم القصة.
إليك OmniPack، وهي استراتيجية ذكية وجديدة صُممت لمساعدة هذه الروبوتات التي ترى وتسمع كل شيء لتعمل بشكل أسرع دون أن تفقد عقلها. فكر في OmniPack كعملية تحرير مكونة من خطوتين لسيناريو فيلم فوضوي. أولاً، قبل أن يبدأ الروبوت في قراءة السيناريو، يعمل OmniPack كمحرر صارم يمسح اللقطات الخام. هو لا يكتفي بحذف الأجزاء الهادئة فحسب؛ بل يبحث أيضاً عن اللحظات "الصاخبة" (مثل تحطم مفاجئ أو وميض ساطع) ويحرص أيضاً على عدم تخطي المناظر الخلفية الهادئة والمهمة التي تحدث في أماكن بعيدة زمنياً. يقوم بتجميع اللبنات المتشابهة معاً حتى لا تستهلك مساحة إضافية، مما يخلق "شريط مقتطفات مميزة" يحافظ على هيكل القصة سليماً.
لكن السحر الحقيقي يحدث في الخطوة الثانية. فبمجرد أن يبدأ الروبوت في قراءة السيناريو والتحدث مع نفسه، يتدخل OmniPack مرة أخرى. هذه المرة، يستمع إلى أسئلة الروبوت. إذا كان الروبوت يسأل: "ما كان لون السيارة؟"، فإن OmniPack يعرف أنه يجب عليه الاحتفاظ باللبنات المتعلقة بالسيارة واللون، حتى لو كانت هادئة أو صغيرة. إنه يستخدم فضول الروبوت نفسه لتنقية المعلومات ودمج التفاصيل الأكثر فائدة معاً. والنتيجة هي تقليل هائل في العمل الذي يتعين على الروبوت القيام به. وفي نموذج محدد يسمى Qwen2.5-Omni-7B، تمكن OmniPack من تقليص العمل المطلوب إلى 16.7% فقط من الكمية الأصلية مع الحفاظ على 98.0% من ذكاء الروبوت الأصلي. وحتى عندما دفعوا بالقدرات إلى أقصى الحدود وقللوا العمل إلى نسبة ضئيلة بلغت 6.8%، ظل الروبوت يتذكر 92.9% مما كان من المفترض أن يعرفه. إنه يشبه تقليص موسوعة ضخمة لتصبح مجرد كتيب صغير، ولكن بطريقة ما، لا يزال الكتيب يحتوي على جميع الإجابات التي تحتاجها.
وجد الباحثون أن الطرق القديمة غالباً ما فشلت لأنها حاولت ضغط كل شيء في وقت مبكر جداً أو بطريقة بسيطة للغاية. وجادلوا بأن التخلص من الـ "توكنز" بناءً على مدى كونها "صاخبة" أو "متشابهة" فقط غالباً ما يؤدي إلى فقدان خيوط مهمة ومبعثرة. كما أظهروا أن محاولة استخدام الصوت لضغط الفيديو (أو العكس) قبل أن تتاح للروبوت الفرصة لدمج الحاستين معاً لم يكن فعالاً. بدلاً من ذلك، يقترح OmniPack نهجاً "متخصصاً حسب المرحلة": أولاً، تنظيف الهيكل بناءً على نوع الوسائط المحدد (فيديو أو صوت)، ثم بعد أن تتاح للروبوت الفرصة لدمجهما معاً، يتم استخدام المهمة أو السؤال المحدد لإجراء الضغط الذكي النهائي.
وفي اختباراتهم عبر خمس مجموعات تحدي مختلفة، تفوق OmniPack باستمرار على كل طريقة أخرى قارنها بها. وسواء كانوا يختبرونه على مقاطع قصيرة أو فيديوهات طويلة، فقد قدمت الطريقة الجديدة دائماً أفضل توازن بين السرعة والذكاء. ويرى المؤلفون أنه من خلال تنسيق هاتين المرحلتين — التنظيف الهيكلي أولاً، ثم التنقية الذكية المرتبطة بالسؤال — يمكنهم جعل نماذج الذكاء الاصطناعي القوية هذه أكثر كفاءة دون الحاجة إلى إعادة تدريبها من الصفر. إنها طريقة تجعل الروبوتات فائقة الذكاء أسرع وأرخص في التشغيل، مع الحفاظ على حدتها حتى عندما تتدفق المعلومات بغزارة.
ملخص تقني: OmniPack
بيان المشكلة حققت النماذج اللغوية الكبيرة متعددة الأنماط (Omni-LLMs) نجاحاً كبيراً في الفهم الموحد للصوت والصورة من خلال النمذجة المشتركة للنصوص، والصور، والفيديوهات، والصوت. ومع ذلك، فإن عملية التجزئة (tokenization) الكثيفة المطلوبة للمدخلات البصرية والصوتية تؤدي إلى تسلسلات أطول بكثير من النصوص، مما يخلق عبئاً حوسبياً وذاكرة باهظ الثمن أثناء الاستدلال. وبينما يعد ضغط الرموز (tokens) ضرورياً للنشر الفعال، تواجه الطرق الحالية قيوداً حرجة تحت ميزانيات الرموز الصارمة:
النمذجة الهيكلية غير الكافية: غالباً ما تعتمد طرق الضغط قبل النموذج اللغوي الكبير (Pre-LLM) على الأهمية المحلية أو التشابه، مما يؤدي إلى الفشل في التقاط الهياكل الزمانية-المكانية طويلة المدى. يؤدي هذا إلى فقدان الأدلة الموزعة عالمياً، مثل الأحداث المتفرقة في الفيديوهات الطويلة أو الإشارات الصوتية العابرة.
التعاون بين الأنماط غير الكافي: إما أن الطرق الحالية تضغط البيانات قبل النموذج اللغوي الكبير (حيث يكون التفاعل الدلالي بين التمثيلات الصوتية والبصرية محدوداً)، أو تضغطها داخل النموذج اللغوي الكبير (بالاعتماد أساساً على التوجيه النصي دون نمذجة صريحة للتعاون الصوتي-البصري). وبناءً على ذلك، تفشل هذه الطرق في استغلال الأدلة المشتركة بين الأنماط ذات الصلة بالمهام بشكل كامل.
المنهجية: OmniPack يقترح المؤلفون OmniPack، وهو إطار عمل تقدمي مكون من مرحلتين وخالٍ من التدريب، مصمم لتنسيق الضغط الهيكلي قبل النموذج اللغوي الكبير مع الصقل الدلالي داخل النموذج اللغوي الكبير.
1. الضغط الخاص بالنمط قبل النموذج اللغوي الكبير (Pre-LLM) يعمل هذا الإجراء قبل النموذج اللغوي الكبير، حيث يزيل الحشو الهيكلي مع الحفاظ على الأدلة البارزة والتغطية العالمية. وهو يستخدم ثلاث آليات متميزة:
اختيار الأهمية (Importance Selection): يحدد الرموز المهيمنة باستخدام إحصائيات انتباه المشفر (encoder attention) والإشارات الهيكلية الخاصة بكل نمط. بالنسبة للفيديو، يشمل ذلك التباين بين الإط frames المتجاورة والتميز المكاني؛ وبالنسبة للصوت، يشمل ذلك تباين الرموز المتجاورة للكشف عن الحدود الصوتية.
اختيار التغطية (Coverage Selection): لمنع التركيز المفرط على المناطق البارزة، تختار هذه الخطوة رموزاً تمثيلية إضافية باستخدام مقياس مسافة مشترك يجمع بين تشابه الميزات والمسافة الزمانية/الزمانية-المكانية المعيرة. وهي تستخدم تقنية DPC-KNN لضمان تغطية زمانية-مكانية واسعة.
دمج الرموز المدرك للتشابه (Similarity-Aware Token Merging): بدلاً من التخلص من الرموز غير المختارة، يتم تجميع معلوماتها في ممثلين مستبقين. يتم تعيين الرموز غير المختارة إلى الرمز المستبقى الأكثر تشابهاً بناءً على تشابه الميزات، والتقارب الموضعي، وأهمية الرمز المستهدف، مما ينقل المعلومات الزائدة بفعالية إلى المجموعة المحتفظ بها.
2. الضغط داخل النموذج اللغوي الكبير المعتمد على الاستعلام (Query-Conditioned Inner-LLM Compression) بعد حدوث تفاعل متعدد الأنماط كافٍ داخل أول ℓ من كتل المحول (Transformer blocks)، تقوم مرحلة ضغط ثانية بصقل التمثيلات المستبقاة. وتستفيد هذه المرحلة من:
التوجيه النصي: يوجه تمثيل استعلام عالمي مشتق من الحالات الخفية للنص اختيار الرموز ذات الصلة بالمهمة.
التعاون الصوتي-البصري: يتم حساب درجة صلة الرمز من خلال النظر في تشابهه مع استعلام النص، وتشابهه مع النموذج الأولي (prototype) للنمط الآخر (على سبيل المثال، الرموز البصرية التي تأخذ السياق الصوتي في الاعتبار)، وتميزه داخل نمطه الخاص.
الاختيار المدرك للتنوع: يتم اختيار الرموز بشكل تكراري لموازنة الصلة مع التنوع الدلالي، مما يضمن أن المجموعة المستبقاة تغطي طيف المعلومات اللازم.
الدمج المعدل بالصلة: يتم دمج الحالات الخفية غير المختارة في الممثلين المستبقين عبر متوسط مرجح بالتشابه، والمعدل بواسطة درجات الصلة.
المساهمات الرئيسية
تحديد أوجه القصور: يسلط البحث الضوء على أن ضغط نماذج Omni-LLM الحالية يفشل تحت الميزانيات الصارمة بسبب عدم كفاية نمذجة الهيكل طويل المدى وعدم كفاية استغلال الأدلة المشتركة بين الأنماط المشروطة بالاستعلام.
إطار عمل موحد: يقدم OmniPack استراتيجية تقدمية خالية من التدريب تجمع بين الضغط الخاص بالنمط قبل النموذج اللغوي الكبير (الهيكلي) والضغط داخل النموذج اللغوي الكبير المعتمد على الاستعلام (الدلالي)، مع دمج المعلومات المزالة في الممثلين المستبقين لتقليل فقدان المعلومات.
الموازنة بين الأداء والكفاءة: تم تصميم إطار العمل لتمكين الضغط الشديد للرموز مع الحفاظ على أداء الفهم متعدد الأنماط العالي.
النتائج التجريبية أُجريت تجارب مكثفة على خمسة معايير (AVUT, WorldSense, DailyOmni, VideoMME, LVOmniBench) باستخدام ثلاثة نماذج خلفية لـ Omni-LLM وهي (Qwen2.5-Omni-3B/7B و MiniCPM-o-2.6).
الأداء: في نموذج Qwen2.5-Omni-7B، يحافظ OmniPack على 98.0% من الأداء الأصلي مع تقليل العمليات الحسابية (FLOPs) إلى 16.7%. وتحت الضغط الشديد (الاحتفاظ بـ 6.8% فقط من العمليات الحسابية الأصلية)، فإنه يحتفظ بـ 92.9% من الأداء الأصلي.
المقارنة: يتفوق OmniPack باستمرار على النماذج المرجعية (baselines) الحالة للفن الخالية من التدريب (بما في ذلك متغيرات FastV-om، و VisionZip-om، و OmniZip، و OmniSIFT، و SEATS) عبر مختلف نسب الاحتفاظ.
الكفاءة: عند نسبة احتفاظ 15%/7.5% (قبل النموذج/النهائي)، يحقق OmniPack تقليلاً بمقدار 10.0 أضعاف في العمليات الحسابية (FLOPs) وتسريعاً في مرحلة التعبئة المسبقة (prefill) بمقدار 4.5 ضعفاً مع الحفاظ على 95.6% من الأداء الأصلي.
الدراسة الاستقصائية (Ablation): تؤكد الدراسات أن الجمع بين اختيار الأهمية، واختيار التغطية، ودمج الرموز يعطي أفضل النتائج قبل النموذج اللغوي الكبير. علاوة على ذلك، يستفيد الضغط داخل النموذج اللغوي الكبير بشكل كبير من التعاون الصوتي-البصري والتوجيه المدرك للنص مقارنة بالاستراتيجيات المستقلة أو العامة.
الأهمية يدعي البحث أن OmniPack يعالج الاختناق الحرج المتمثل في العبء الحوسبي في نماذج Omni-LLMs دون الحاجة إلى إعادة تدريب النموذج. ومن خلال نقل الضغط من مجرد الإشارات الهيكلية إلى الدلالات المشروطة بالمهمة عبر عملية مكونة من مرحلتين منسقتين، يتيح إطار العمل النشر العملي لنماذج Omni-LLMs على الأجهزة ذات الموارد المحدودة. وتظهر النتائج أن الضغط الشديد للرموز يمكن تحقيقه دون التضحية بقدرة النموذج على فهم السيناريوهات الواقعية المعقدة والديناميكية والمتطورة زمنياً، مما يضع معياراً جديداً للأداء والكفاءة في هذا المجال.