← أحدث الأبحاث
🤖 AI

TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation

يعالج TokenTrim الانزياح الزمني في توليد الفيديو الطويل ذاتي الانحدار من خلال تقديم طريقة أثناء الاستنتاج تحدد وتقلم الرموز الكامنة غير المستقرة قبل إعادة استخدامها كشرط، مما يحسن الاتساق طويل الأمد دون تعديل بنية النموذج أو عملية التدريب.

المؤلفون الأصليون: Ariel Shaulov, Eitan Shaar, Amit Edenzon, Lior Wolf

نُشر 2026-02-03
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ariel Shaulov, Eitan Shaar, Amit Edenzon, Lior Wolf

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول سرد قصة طويلة جداً لصديق، لكن لا يمكنك التحدث إلا بجملة واحدة في كل مرة. وللحفاظ على استمرارية القصة، عليك تذكر كل ما قلته للتو لتجعل الجملة التالية منطقية.

المشكلة: تأثير "الذاكرة السيئة"
في عالم توليد الفيديو بالذكاء الاصطناعي، يقوم الكمبيوتر بشيء مشابه. فهو ينشئ فيديو عبر مقاطع قصيرة (مثل الجمل)، ثم يستخدم ما صنعه للتو لإنشاء المقطع التالي. يُسمى هذا "التوليد التكراري" (Autoregressive generation).

تحدد الورقة البحثية خللاً رئيسياً في هذه العملية يسمى الانحراف الزمني (Temporal Drift). تخيل أنك تحكي قصة عن شاحنة بيضاء:

  1. تقول: "شاحنة بيضاء تسير".
  2. يرتكب الذكاء الاصطناعي خطأً طفيفاً في المقطع الثاني، ربما تبدو الشاحنة رمادية قليلاً.
  3. في المقطع الثالث، يستخدم الذكاء الاصطناعي تلك "الشاحنة الرمادية" كمرجع، لذا يجعلها أكثر قتامة.
  4. بحلول المقطع العاشر، تصبح الشاحنة سوداء. وبحلول المقطع العشرين، قد تتحول إلى بقرة.

الذكاء الاصطناعي لا يعاني من نقص في القدرات الذهنية؛ هو فقط يعيد استخدام أخطائه. ففي كل مرة يولد فيها مقطعاً جديداً، فإنه ينظر إلى المقاطع السابقة للحصول على السياق. وإذا كانت تلك المقاطع السابقة تحتوي على معلومات "فاسدة" (مثل الشاحنة الرمادية)، فإن الذكاء الاصطناعي يعامل هذا الفساد كأنه حقيقة ويمررها للمرحلة التالية، مما يجعل الخطأ يزداد سوءاً حتى ينهار الفيديو.

الحل: TokenTrim (المحرر)
يقترح المؤلفون طريقة جديدة تسمى TokenTrim. تخيل بيانات الفيديو التي يستخدمها الذكاء الاصطناعي كمجموعة من الملاحظات اللاصقة (تسمى "tokens"). بعض الملاحظات تحتوي على معلومات جيدة، وبعضها يحتوي على معلومات "فاسدة" أو غير مستقرة.

يعمل TokenTrim كمحرر ذكي يتحقق من الملاحظات اللاصقة قبل أن يستخدمها الذكاء الاصطناعي للخطوة التالية. وإليك كيف يعمل بتبسيط شديد:

  1. الفحص: قبل أن يبدأ الذكاء الاصطناعي في صنع المقطع التالي، يقوم TokenTrim بمقارنة "ملخص" المقطع الجديد الذي يريد صنعه مع ملخص المقطع الذي انتهى من صنعه للتو.
  2. الإنذار: إذا بدا جزء معين من الفيديو (ملاحظة أو "token" محدد) مختلفاً تماماً أو غير مستقر مقارنة بما سبقه، يقوم النظام بوضع علامة عليه. الأمر يشبه ملاحظة أن ملاحظة "الشاحنة البيضاء" أصبحت فجأة تقول "فيل أرجواني".
  3. التقليم (Pruning): بدلاً من استخدام تلك الملاحظة السيئة، يقوم TokenTrim برميها (تقليمها). إنه يزيل المعلومات الفاسدة من ذاكرة الذكاء الاصطناعي.
  4. إعادة المحاولة: يتم إجبار الذكاء الاصطناعي بعد ذلك على توليد المقطع الجديد بدون تلك الملاحظة السيئة. يجب عليه الاعتماد على الملاحظات المتبقية والمستقرة لمعرفة ما يجب فعله تالياً.

النتيجة
من خلال حذف "الذكريات السيئة" (الـ tokens غير المستقرة) بنشاط قبل أن تسمم الخطوة التالية، يظل الفيديو متسقاً. تظل الشاحنة بيضاء، ولا يذوب وجه الشخص، ولا يتشوه الخلفية، حتى بعد تشغيل الفيديو لفترة طويلة.

النقاط الرئيسية من الورقة البحثية:

  • لا حاجة لإعادة التدريب: هذا ليس بخصوص تعليم الذكاء الاصطناعي طريقة جديدة للتعلم. إنه أداة "جاهزة للتشغيل" (plug-and-play) تعمل بينما يعمل الذكاء الاصطناعي بالفعل. لا تحتاج إلى إعادة تدريب النموذج أو تغيير الكود الخاص به.
  • إنه سريع: العملية لا تضيف أي وقت إضافي تقريباً لصنع الفيديو. إنه فحص سريع وحذف سريع.
  • يعمل مع التقنيات الحالية: اختبر المؤلفون هذه الطريقة على طريقتين شائعتين لتوليد الفيديو (Rolling Forcing و Self Forcing)، وأظهروا أن إضافة TokenTrim تجعل الفيديوهات تبدو أفضل بكثير وتستمر لفترة أطول دون أن تنهار.
  • خدعة "المقطع الأول": وجد المؤلفون أيضاً أن استخدام تقنية خاصة للمقطع الأول فقط يساعد في وضع أساس مستقر، مما يجعل العملية برمتها أكثر سلاسة.

باخت-اختصار
غالباً ما يفشل توليد الفيديوهات الطويلة لأن الذكاء الاصطناعي يستمر في إعادة تدوير أخطائه. يقوم TokenTrim بإصلاح ذلك من خلال العمل كمرشح لمراقبة الجودة: فهو يرصد الأخطاء في ذاكرة الذكاء الاصطناعي، ويحذفها، ويجبر الذكاء الاصطناعي على البدء من جديد ببيانات نظيفة. هذا يوقف "تأثير كرة الثلج" للأخطاء ويحافظ على مظهر الفيديو واقعياً ومتسقاً لفترة أطول بكثير.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →