← أحدث الأبحاث
🤖 machine learning

DeltaLog: Deferred Materialization of Recurrent States for Linear Attention Decoding

يُعد DeltaLog مخطط فك تشفير يعتمد على الحالة المتكررة يعمل على تسريع نماذج الانتباه الخطي من خلال تأجيل التجسيد الكامل للحالة لصالح إلحاق تحديثات مدمجة بسجل لوغاريتمي محدود ودمجها دورياً، مما يقلل بشكل كبير من حركة مرور الذاكرة ويحسن سرعة الخدمة من البداية إلى النهاية.

المؤلفون الأصليون: Junqing Lin, Jingwei Sun, Guangzhong Sun

نُشر 2026-08-18
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Junqing Lin, Jingwei Sun, Guangzhong Sun

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تعتمد أنظمة الذكاء الاصطنا-عي الحديثة التي تولد النصوص، من برامج الدردشة الآلية إلى مساعدي الكتابة الإبداعية، على عملية أساسية تسمى "فك التشفير ذاتي الانحدار" (autoregressive decoding). في هذه العملية، يتنبأ الكمبيوتر بالكلمة التالية في الجملة واحدة تلو الأخرى، مستخدماً الكلمات التي ولدها بالفعل لتوجيه تخمينه التالي. لسنوات، استخدمت أقوى النماذجه آلية تُعرف باسم "الانتباه" (attention) لتقرير أي الكلمات السابقة هي الأكثر أهمية للتنبؤ الحالي. وبينما يعد هذا النهج فعالاً للغاية، إلا أنه يخلق عنق زجاجة متزايداً: فكلما طال الحوار، يجب على النظام تخزين واسترجاع قائمة متوسعة باستمرار لكل كلمة شوهدت حتى الآن، مما يستهلك كميات هائلة من ذاكرة الكمبيوتر ويبطئ وقت الاستجابة. ولحل هذه المشكلة، طور الباحثون فئة جديدة من النماذج التي تستبدل القائمة المتوسعة بملخص ثابت الحجم، أو "حالة" (state)، يتم تحديثها مع كل كلمة جديدة. هذا التغيير يلغي الحاجة إلى تذكر كل رمز (token) سابق، ولكنه يقدم مشكلة مختلفة: لا يزال يتعين على النظام إعادة كتابة هذا الملخص بأكمله باستمرار في كل مرة تُضاف فيها كلمة جديدة، مما يخلق ازدحاماً مرورياً ثقيلاً في ذاكرة الكمبيوتر.

لقد حدد فريق من الباحثين في جامعة العلوم والتكنولوجيا في الصين هذا التحديث المستمر كعدم كفاءة رئيسية، وابتكروا حلاً أطلقوا عليه اسم "دلتا لوج" (DeltaLog). فبدلاً من إجبار الكمبيوتر على إعادة كتابة الملخص الكامل للمحادثة بعد كل كلمة واحدة، يسمح "دلتا لوج" للنظام بالاحتفاظ بنسخة مستقرة وكاملة من الملخص، ومن ثم مجرد إرفاق ملاحظة صغيرة وموجزة تصف التغيير الأخير. يقوم النظام بإعادة كتابة الملخص الكامل فقط بشكل دوري، بعد أن تتراكم مجموعة معينة من هذه الملاحظات الصغيرة. هذا النهج يشبه الاحتفاظ بسجل رئيسي وحزمة من الملاحظات اللاصقة؛ فبدلاً من إعادة كتابة السجل بأكمله في كل مرة تحدث فيها عملية تجارية جديدة، تقوم فقط بإضافة العملية إلى الحزمة وتحديث السجل فقط عندما تصبح الحزمة مرتفعة جداً. ومن خلال القيام بذلك، وجد الباحثون أنهم استطاعوا تقليل كمية البيانات التي يحتاج الكمبيوتر لنقلها بشكل كبير، وهي العملية التي غالباً ما تكون الجزء الأبطأ في هذه العملية.

اختبر الباحثون هذه الطريقة على أنواع مختلفة من نماذج اللغة الحديثة، بما في ذلك (Gated DeltaNet) و(Kimi Delta Attention) و(RWKV6). وفي تجاربهم، قاموا بقياس الوقت الذي يستغرقه الكمبيوتر لتوليد كلمة واحدة وكمية حركة المرور في الذاكرة المتضمنة. واكتشفوا أنه من خلال تأجيل إعادة الكتابة الكاملة للملخص، تمكنوا من تسريع الحساب الأساسي الذي يحدث ذاكرة النموذج بمقدار يصل إلى 1.86 مرة على بطاقات الرسوميات عالية الأداء. والأهم من ذلك، لاحظوا أن كمية البيانات المكتوبة في ذاكرة الكمبيوتر عالية السرعة انخفضت بمقدار يصل إلى 7.83 مرة. هذا الانخفاض في حركة المرور أمر بالغ الأهمية لأن السرعة في هذه الأنواع من النماذج لا تقتصر غالباً على مدى سرعة قدرة الكمبيوتر على الحساب، بل على مدى سرعة نقل البيانات من وإلى ذاكرته.

وعندما دمج الباحثون هذه الطريقة في نظام كامل مصمم لخدمة العديد من المستخدمين في آن واحد، تُرجمت الفوائد إلى أوقات استجابة أسرع للمستخدم النهائي. ففي الاختبارات التي أجريت على نماذج ضخمة تحتوي على عشرات المليارات من المعلمات (parameters)، ولد النظام الكلمات بسرعة أكبر بنسبة تتراوح بين 5% و20% مما كانت عليه من قبل. وكان التحسن أكثر وضوحاً عندما كان النظام يتعامل مع العديد من الطلبات في وقت واحد، وهو سيناريو شائع للتطبيقات الواقعية. وأكد الباحثون أن هذا التسريع لم يأتِ على حساب الدقة؛ حيث ظل النص الذي يولده النظام المعدل مكافئاً رياضياً للنظام الأصلي، مما يعني الحفاظ على جودة المخرجات مع جعل عملية التسليم أكثر كفاءة.

إن الرؤية الجوهرية وراء هذا العمل هي أن الطريقة التي يخزن بها الكمبيوتر المعلومات ويحدثها فيزيائياً لا تحتاج دائماً إلى مطابقة الخطوات المنطقية التي يتخذها النموذج. فبينما يقوم النموذج منطقياً بتحديث حالته مع كل كلمة، لا تحتاج الأجهزة الفيزيائية إلى إعادة كتابة الحالة بأكملها فوراً لتعكس ذلك التغيير. ومن خلال فصل التاريخ المستقر عن التغييرات الأخيرة ودمجهما دورياً فقط، يقلل "دلتا لوج" من "ضريبة تحديث الحالة" (state-update tax)، وهو المصطلح الذي يستخدمه المؤلفون لوصف حركة مرور الذاكرة المفرطة الناتجة عن التحديثات الفورية والمستعجلة. لا يغير هذا الاستراتيجية النموذج الأساسي أو أوزانه؛ بل يغير فقط جدول كيفية تعامل الكمبيوتر مع البيانات. وتشير النتائج إلى أنه بالنسبة لنماذج اللغة واسعة النطاق، فإن تحسين الحركة الفيزيائية للبيانات لا يقل أهمية عن تحسين الخوارزميات الرياضية نفسها، مما يوفر مساراً واضحاً لذكاء اصطناعي أسرع وأكثر كفاءة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →