Accelerating Streaming Video Large Language Models via Hierarchical Token Compression
تقترح الورقة البحثية **ضغط الرموز المتدفق (STC)**، وهو إطار عمل هرمي جاهز للاستخدام يعمل على تسريع نماذج الفيديو اللغوية الكبيرة (VideoLLMs) المتدفقة عبر استخدام آلية تخزين مؤقت لتقليل عبء ترميز محول الرؤية (Vision Transformer)، وآلية تقليم لضغط تسلسلات الرموز البصرية قبل مرحلة التعبئة المسبقة للنموذج اللغوي الكبير (LLM).
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تشاهد مباراة كرة قدم حية وعالية السرعة من خلال نافذة صغيرة، ولديك مساعد شخصي مكلف بإخبارك بكل شيء مهم يحدث.
المشكلة هي أن مباراة كرة القدم تتحرك بسرعة كبيرة لدرجة أن مساعدك يشعر بالإرهاق؛ فهو يحاول تدوين كل نصل عشب، وكل حركة في الجمهور، وكل تشنج بسيط في عضلة اللاعب. ولأنه يدون كل شيء، فإنه يتأخر عن الركب. وبحلول الوقت الذي ينتهي فيه من وصف هدف سُجل قبل دقيقتين، تكون المباراة قد انتقلت بالفعل إلى مرحلة أخرى.
هذه الورقة البحثية، "تسريع النماذج اللغوية الكبيرة للفيديو المتدفق عبر ضغط الرموز الهرمي" (Accelerating Streaming Video Large Language Models via Hierarchical Token Compression)، تشبه منح ذلك المساعد قوة خارقة: القدرة على تجاهل الأشياء المملة والتركيز فقط على الأحداث المثيرة.
إليك كيف يعمل حله المكون من جزأين (STC) باستخدام تشبيهات من الحياة اليومية:
1. STC-Cacher: "المصور الذكي"
المشكلة: في الفيديو، تكون معظم الإطارات متطابقة تقريبًا. إذا كنت تصور شخصًا يتحدث أمام جدار من الطوب، فإن الجدار لا يتغير من ثانية إلى أخرى. الذكاء الاصطناعي التقليدي "يعيد تصوير" المشهد بأكمله (الشخص والجدار) في كل ميلي ثانية، وهو ما يعد هدرًا هائلًا للطاقة.
الحل: فكر في STC-Cacher كمصور يستخدم تقنية "الاستنسل" (النموذج):
- بدلًا من التقاط صورة جديدة تمامًا كل ثانية، يلتقط صورة واحدة "مرجعية" مثالية للمشهد.
- في الثواني القليلة التالية، لا يعيد تصوير الخلفية، بل ينظر فقط إلى الصورة القديمة، ويحدد ما الذي تحرك (مثل لاعب يركل الكرة)، ثم يقوم فقط بـ "تلوين" تلك الأجزاء الجديدة المتحركة.
- النتيجة: يوفر قدرًا هائلًا من الوقت لأنه لا يعيد رسم أجزاء العالم التي تظل ثابتة باستمرار.
2. STC-Pruner: "المحرر البارع"
المشكلة: حتى بعد التقاط الصور، أصبح لدى المساعد الآن كومة ضخمة من الملاحظات. إذا حاول قراءة كل ملاحظة للمدير، فسوف ينام المدير قبل أن يصل إلى الأجزاء المهمة. هذه "الكومة من الملاحظات" هي ما يسميه العلماء "تسلسلات الرموز" (token sequences)، وهي تصبح ثقيلة جدًا على عقل الذكاء الاصطناعي (LLM) بحيث يصعب معالجتها بسرعة.
الحل: يعمل STC-Pruner كمحرر أخبار عالي السرعة. قبل تسليم الملاحظات إلى المدير، ينظر المحرر إلى شيئين:
- مرساة "الماضي": "هل أخبرت المدير بالفعل عن هذه الخلفية؟" (إذا كانت الإجابة نعم، تخلص منها).
- مرساة "الحاضر": "هل هذا التفصيل المحدد مختلف حقًا عن بقية هذا الإطار؟" (إذا كان مجرد تكرار لما هو موجود، تخلص منه).
المحرر يحتفظ فقط بالملاحظات "المثيرة" — تلك التي تعد جديدة تمامًا ومختلفة عن كل من التاريخ والمحيط الحالي.
- النتيجة: يتلقى الذكاء الاصطعي "ملخص لأهم اللقطات" بدلاً من "فيض من اللقطات الخام"، مما يسمح له بالاستجابة لأسئلتك بشكل فوري تقريبًا.
الخلاصة
من خلال الجمع بين هذين الاثنين — المصور الذكي (الذي يتوقف عن إعادة رسم الخلفية) والمحرر البارع (الذي يحتفظ فقط بالملاحظات الأكثر إثارة) — ابتكر الباحثون طريقة تجعل الذكاء الاصطناعي "يشاهد" الفيديو المباشر في الوقت الفعلي.
هذا يجعل الذكاء الاصطناعي أسرع بكثير (مقللًا من عبء العمل الشاق بنسبة تصل إلى 45%) دون أن يجعله أقل ذكاءً بكثير (فهو يحافظ على 99% من دقته). إنه الفرق بين مساعد غارق في الأوراق ومساعد يقدم لك تعليقًا مباشرًا ومثاليًا على مجريات اللعب.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.