WorldKV: Efficient World Memory with World Retrieval and Compression
يُعد WorldKV إطار عمل لا يتطلب تدريباً يُمكّن من توليد فيديو تلقائي الترتيب بشكل متسق وفي الوقت الفعلي عبر الجمع بين الاسترجاع الانتقائي لقطع ذاكرة التخزين المؤقت (KV-cache) المُطرودة مع ضغط الرموز للحفاظ على ذاكرة العالم طويلة المدى، مع مضاعفة معدل الإنتاجية مقارنة بنهج الـ KV الكامل.
المؤلفون الأصليون:Jung Yi, Minjae Kim, Paul Hyunbin Cho, Wooseok Jang, Sangdoo Yun, Seungryong Kim
تخيل أنك تلعب لعبة فيديو حيث يتم إنشاء العالم في الوقت الفعلي بواسطة ذكاء اصطناعي ذكي جداً. يمكنك التجول، والالتفاف حول الزوايا، والاستكشاف. الهدف هو أن يشعر العالم بأنه "حقيقي" ومتسق: إذا خرجت من غرفة وعدت إليها بعد خمس دقائق، يجب أن تبدو الغرفة تماماً كما كانت، وليس كغرفة مختلفة أو كتلة مشوشة.
تتناول ورقة بحثية بعنوان WorldKV مشكلة محددة في كيفية عمل نماذج الذكاء الاصطناعي الحالية. إليك شرح مبسط باستخدام تشبيهات من الحياة اليومية:
المشكلة: "الذاكرة القصيرة" مقابل "حقيبة الظهر الضخمة"
تمتلك نماذج الفيديو الحالية طريقتين رئيسيتين للتعامل مع الذاكرة، وكلتاهما تعاني من عيوب:
"النافذة المنزلقة" (الذاكرة القصيرة): تخيل أن الذكاء الاصطناعي يرتدي عصابة على عينيه لا تسمح له إلا برؤية الثواني القليلة الأخيرة مما ولّده للتو. إذا ابتعدت وعدت، سيكون الذكاء الاصطناعي قد "نسي" الغرفة التي غادرتها. سيحاول التخمين عما يوجد هناك، مما يؤدي إلى "الهلوسة" (اختلاق) أثاث جديد أو تغيير الجدران. هذه الطريقة سريعة، لكن العالم غير متسق.
"التاريخ الكامل" (حقيبة الظهر الضخمة): لإصلاح مشكلة النسيان، يمكن للذكاء الاصطناعي الاحتفاظ بكل شيء رآه على الإطلاق في ذاكرته. هذا يشبه حمل حقيبة ظهر تزداد ثقلاً مع كل خطوة تخطوها. في النهاية، ستصبح حقيبة الظهر ثقيلة جداً (بسبب كثرة البيانات) لدرجة أن الذكاء الاصطناعي سيتباطأ حتى يتوقف تماماً، أو تنفد مساحة الكمبيوتر بالكامل. ستحصل على عالم متسق، لكنه سيتوقف عن العمل في الوقت الفعلي.
الحل: WorldKV
يقترح المؤلفون إطار عمل WorldKV، وهو "خالٍ من التدريب" (training-free). هذا يعني أنهم لم يحتاجوا لإعادة تعليم الذكاء الاصطناعي كيفية التعلم؛ بل قدموا له طريقة أذكى لتنظيم ملاحظاته الموجودة بالفعل. يستخدمون خدعتين رئيسيتين:
1. استرجاع العالم: "أمين المكتبة الذكي"
بدلاً من التخلص من الذكريات القديمة (مثل النافذة المنزلقة) أو الاحتفاظ بكل شيء في مساحة العمل المباشرة (مثل حقيبة الظهر الثقيلة)، يعمل WorldKV مثل أمين مكتبة ذكي.
كيف يعمل: عندما يولد الذكاء الاصطناعي مشهداً، فإنه يحفظ "قطعة" (chunk) من تلك الذاكرة على رف (في ذاكرة الكمبيوتر) ويضع عليها ملصقاً يوضح زاوية الكاميرا أو الحركة المتخذة (مثلاً: "التفاف لليمين").
السحر: عندما تعود إلى تلك الغرفة لاحقاً، لا يبحث الذكاء الاصطناه في كل شيء في المكتبة. بل يتحقق من الملصق الخاص به: "أوه، المستخدم يلتف لليمين مجدداً". يسحب فوراً قطعة الذاكرة المحددة فقط من الرف التي تطابق ذلك المنظر ويعيدها إلى مساحة العمل النشطة الخاصة به.
النتيجة: يتذكر الذكاء الاصطناعي الغرفة تماماً دون الحاجة لحمل وزن التاريخ بأكمله في آن واحد.
2. ضغط العالم: "منظف الملفات المكررة"
حتى مع وجود أمين المكتبة، يمكن أن يصبح رف الذاكرة مزدحماً لأن إطارات الفيديو متشابهة جداً. إذا التقطت 100 صورة لنفس الجدار أثناء المشي ببطء، فإن 99 منها ستبدو متطابقة تقريباً.
كيف يعمل: ينظر WorldKV إلى هذه القطع من الذاكرة ويسأل: "هل هذه معلومة جديدة، أم أنها مجرد نسخة مما لدي بالفعل؟". يستخدم خدعة رياضية للعثور على "الإطارات المرجعية" (الأكثر أهمية) ويحذف الأجزاء المكررة وغير الضرورية من الإطارات الأخرى.
النتيجة: يقلص حجم كل قطعة ذاكرة بنسبة النصف تقريباً. هذا يشبه ضغط مجلد من الصور المكررة. الآن، يمكن للذكاء الاصطناعي استيعاب ضعف كمية التاريخ على نفس الرف دون نفاذ المساحة.
النتائج: أفضل ما في العالمين
اختبرت الورقة البحثية هذا على نموذجين مختلفين من الذكاء الاصطناعي (واحد صغير وآخر كبير) ووجدت أن WorldKV يحقق منطقة "الوسط المثالي":
الاتساق: يتذكر العالم بشكل جيد تقريباً كما لو كان يحتفظ بـ التاريخ الكامل (Full KV)، وهو أفضل بكثير من طريقة "النافذة المنزلقة" التي تنسى الأشياء.
السرعة: يعمل بسرعة تزيد بمقدار مرتين عن الاحتفاظ بالتاريخ الكامل، مما يحافظ على سرعة الوقت الفعلي.
لا تدريب إضافي: يعمل مع النماذج الموجودة مباشرة دون الحاجة لإعادة تدريبها.
ملخص التشبيه
فكر في الذكاء الاصطناعي كسائح يقوم برحلة طويلة.
النافذة المنزلقة: السائح يتذكر فقط آخر 5 دقائق من الرحلة. سيضيع إذا حاول العودة إلى مكان زاره قبل ساعة.
Full KV: السائط يدون كل تفصيل من كل ثانية في الرحلة في دفتر ملاحظات ضخم. لن يضيع أبداً، لكنه سيكون بطيئاً جداً في المشي لأنه يحمل كتاباً يزن 250 كيلوغراماً.
WorldKV: السائح يحتفظ بدفتر ملاحظات صغير ونشط لآخر 5 دقائق. ولكن، لديه أيضاً خزانة ملفات ذكية حيث يخزن ملخصات مضغوطة لبقية الرحلة. عندما يحتاج لتذكر بقعة معينة، يسحب بسرعة الملخص المناسب من الخزانة ويضيفه إلى دفتر ملاحظاته. لن يضيع أبداً، ويمكنه أيضاً المشي بسرعة طبيعية.
ملخص تقني: WorldKV
بيان المشكلة لقد مكنت نماذج انتشار الفيديو ذات التوليد الذاتي (Autoregressive video diffusion models) من توليد عوالم مرتبطة بالأفعال في الوقت الفعلي، ومع ذلك، لا يزال الحفاظ على عالم مستمر حيث تؤدي العودة إلى وجهة نظر تمت رؤيتها سابقًا إلى محتوى متسق يمثل تحديًا مفتوحًا. وبينما يحافظ انتباه ذاكرة الـ KV الكاملة (full KV-cache attention) على هذا الاتساق، إلا أنه يتسبب في نمو خطي في بصمة الذاكرة وتكلفة الانتباه مع طول التسلسل (rollout)، مما يكسر قيود الوقت الفعلي ويؤدي إلى حالات فشل ناتجة عن نفاد الذاكرة (OOM). ومن ناح অন্যদিকে، فإن الاستدلال بالنافذة المنزلقة (sliding-window inference) يستعيد معدل الإنتاجية ولكنه يضحي بالاتساق طويل الأمد عبر التخلص من السياق القديم، مما يتسبب في حدوث هلوسات لمحتوى جديد أو انحراف في النماذج عند إعادة زيارة المشاهد. ورغم أن الملاحظات الأخيرة تشير إلى أن ذاكرة الـ KV في هذه النماذج تعمل كشكل ناشئ من ذاكرة العالم، فإن الوصول إلى هذه الذاكرة بكفاءة دون التكلفة الحسابية الكاملة للانتباه إلى التاريخ بأكüm يظل أمرًا غير محلول.
المنهجية: WorldKV يقترح المؤلفون WorldKV، وهو إطار عمل لا يتطلب تدريبًا مصمم لتمكين الذاكرة طويلة الأمد في نماذج عالم الفيديو ذات التوليد الذاتي. يعمل الإطار فوق بنيات الاستدلال بالنافذة المنزلقة الحالية ويقدم مكونين متكاملين: استرجاع العالم (World Retrieval) وضغط العالم (World Compression).
استرجاع العالم (World Retrieval):
الآلية: بدلاً من التخلص من أجزاء (chunks) ذاكرة الـ KV المستبعدة، يقوم WorldKV بتخزينها في ذاكرة وحدة معالجة الرسومات (GPU) أو ذاكرة وحدة المعالجة المركزية (CPU). وعندما يعيد النموذج زيارة مشهد ما، فإنه يسترجع بشكل انتقائي الأجزاء ذات الصلة بالمشهد بناءً على توافق الكاميرا أو الفعل، ويعيد إدراجها في نافذة الانتباه الأصلية.
التكامل: يتم إدراج الأجزاء المسترجعة بشكل أصيل دون الحاجة لإعادة ترميز أو تغييرات هيكلية. الإطار مستقل عن خوارزمية الاسترجاع، حيث يدعم استراتيجيات تعتمد على تشابه الكاميرا/الفعل أو الانتباه.
بنية نافذة الانتباه: يتم تقسيم النافذة النشطة إلى أربعة مناطق: ذاكرة الـ sink KV (الإطارات الأولية)، ذاكرة الـ KV المسترجعة (من التاريخ المخزن)، ذاكرة الـ KV الحديثة (الإطارات السابقة مباشرة)، وجزء التوليد الحالي (denoising chunk).
ضغط العالم (World Compression):
الدوافع: تخزين جميع الذافات المستبعدة يستهلك الكثير من الذاكرة. لاحظ المؤلفون أن الإطارات المتجاورة زمنيًا تتشارك محتوى بصريًا كبيرًا، مما ينتج عنه ذاكرات KV شبه متطابقة.
الآلية: ضمن كل جزء مخزن (على سبيل المثال، 3 إطارات)، يتم تحديد الإطار الأول كـ مرجع (anchor). يقوم النظام بحساب تشابه جيب التمام (cosine similarity) بين "المفاتيح" (Keys) للإطارات غير المرجعية وإطار المرجع.
التقليم (Pruning): يتم تقليم الرموز (tokens) ذات التشابه العالي مع المرجع باعتبارها زائدة عن الحاجة، بينما يتم الاحتفاظ بالرموز ذات التشابه المنخفض (التي تمثل مناطق كُشف عنها حديثًا أو محتوى ديناميكيًا).
الكفاءة: تقوم هذه العملية بضغط كل جزء إلى حوالي نصف حجمه الأصلي (على سبيل المثال، الاحتفاظ بالمرجع بالإضافة إلى 25% من رموز الإطارين الآخرين)، مما يسمح باستيعاب ضعف كمية التاريخ تقريبًا ضمن ميزانية ذاكرة ثابتة.
المساهمات الرئيسية
استرجاع العالم (World Retrieval): إطار عمل يقوم بتخزين واسترجاع أجزاء ذاكرة الـ KV المستبعدة باستخدام إشارات الكاميرا/الفعل أو الانتباه، مما يمكن النموذج من الوصول إلى السياق طويل الأمد دون تعديلات هيكلية.
ضغط العالم (World Compression): آلية تقليم قائمة على تشابه المفات، تقلل تخزين كل جزء بنسبة ~50%، مما يتيح تغطية ضعف التاريخ تحت نفس قيود الذاكرة مع الحفاظ على دقة إعادة الزيارة أو تحسينها.
كفاءة لا تتطلب تدريبًا (Training-Free Efficiency): لا يتطلب النهج أي ضبط دقيق (fine-tuning)، أو تقطير (distillation)، أو وحدات ذاكرة مخصصة، بل يعمل بالكامل أثناء الاستدلال على نماذج أساسية مجمدة (frozen backbones).
النتائج التجريبية تم تقييم الإطار على نموذجين لعالم الفيديو ذوي التوليد الذاتي بمقاييس مختلفة: Matrix-Game-2.0 (بـ 1.3 مليار معلمة، مُدرب على تسلسلات قصيرة) و LingBot-World-Fast (بـ 14 مليار معلمة، مُدرب على فيديوهات طويلة).
الإنتاجية مقابل الدقة (Throughput vs. Fidelity): يطابق WorldKV أو يتجاوز دقة الذاكرة الخاصة بانتباه الـ KV الكامل، مع الحفاظ على إنتاجية أعلى بنحو 2×. في نموذج LingBot-World-Fast، يحقق أداءً مشابهًا للـ KV الكامل (وهو الوضع الأصلي) ولكن بمعدل إطارات في الثانية (FPS) أعلى بكثير. وفي Matrix-Game-2.0، يتفوق على كل من أساسات النافذة المنزلقة والـ KV الكامل؛ ومن الجدير بالذكر أن الـ KV الكامل كان أداؤه ضعيفًا هنا بسبب الأخطاء المتراكمة الناتجة عن الانتباه إلى الذاكات المتراكمة خارج التوزيع (out-of-distribution)، بينما يخفف WorldKV من ذلك عبر الاسترجاع الانتقائي.
المقارنة مع أحدث التقنيات (SOTA): يتفوق WorldKV على النماذج المعتمدة على التدريب للذاكرة (مثل WorldPlay و Yume-1.5) في مقاييس مثل LPIPS و PSNR و FID دون أي تدريب خاص بالذاكرة.
دراسات الاستئصال (Ablation Studies):
الضغط داخل الجزء الواحد (Intra-chunk compression): يحقق الضغط المتوسط (الاحتفاظ بالمرجع + 50% من الرموز الأخرى) الأداء الأمثل؛ حيث يؤدي الاحتفاظ بالمرجع فقط إلى تدهور الدقة، بينما يوفر الاحتفاظ بجميع الرموز عوائد متناقصة.
تغطية ما بين الأجزاء (Inter-chunk coverage): ضغط المزيد من الأجزاء لتناسب ميزانية ثابتة (على سبيل المثال، 6 أجزاء ← ميزانية 3 أجزاء) يحسن الدقة مقارنة باسترجاع عدد أقل من الأجزاء بدقة كاملة، مما يسلط الضوء على قيمة التغطية الأوسع للتاريخ.
الأهمية والادعاءات يزعم البحث أن World-KV يثبت أن ذاكرة الـ KV نفسها هي شكل أساسي وناشئ من ذاكرة العالم، حتى في النماذج التي لم تُدرب صراحةً على تسلسلات طويلة. ومن خلال إدارة هذا المورد الموجود بكفاءة عبر الاسترجاع والضغط، يحقق WorldKV نموذج عالم مستمر يحافظ على اتساق زيارات المشاهد مع الالتزام بقيود الاستدلال في الوقت الفعلي. ويؤكد المؤلفون أن هذا يتم دون زمن انتقال (latency) إعادة البناء ثلاثي الأبعاد أو عبء التدريب لوحدات الذاكرة المخصصة.
القيود يشير المؤلفون إلى أن WorldKV هو طريقة إدارة أثناء الاستدلال؛ وبالتالي، فإن الدقة البصرية مقيدة بجودة التوليد للنموذج المدرب مسبقًا. في عمليات التوليد الطويلة للغاية، قد يظل تراكم الأخطاء واردًا. بالإضافة إلى ذلك، بينما يمكن لتقنية (CPU offloading) تقليل استخدام ذاكرة الـ VRAM بشكل أكبر، فإن تأخيرات نقل البيانات بين المضيف والجهاز حاليًا تمنع التوليد في الوقت الفعلي في هذا التكوين المحدد، وهو ما يُترك كعمل مستقبلي.