← أحدث الأبحاث
🤖 machine learning

Tail-Replay: Escaping the Curse of Linear Attention in Prefix Caching for Hybrid LLMs

تُعد تقنية Tail-Replay آلية لتخزين البادئات مؤقتاً (prefix caching) للنماذج اللغوية الكبيرة الهجينة، تتيح إعادة استخدام الرموز (tokens) على مستوى غير مقيد من خلال إعادة بناء حالات الانتباه الخطي عبر إعادة تشغيل لاحقة قصيرة وحديثة للبادئات المتطابقة، مما يلغي الحاجة إلى نقاط فحص الحالة المتكررة (recurrent-state checkpoints) مع تحقيق احتفاظ شبه مثالي بالجودة وتسريع كبير في عملية الاستنتاج.

المؤلفون الأصليون: Yirui Liu, Ruoling Qi, Xuaner Wu, Penghang Liu, Jian Chen

نُشر 2026-09-01✓ Author reviewed
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yirui Liu, Ruoling Qi, Xuaner Wu, Penghang Liu, Jian Chen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

في عالم الذكاء الاصطناعي الحديث، أصبحت النماذج اللغوية الكبيرة هي المحركات وراء كل شيء، من المساعدين في الكتابة إلى تحليل البيانات المعقدة. تعمل هذه الأنظمة عن طريق معالجة كميات هائلة من النصوص، رمزاً تلو الآخر (token by token)، للتنبؤ بما سيأتي لاحقاً. ومع ذلك، عندما تُطالب هذه النماذج بالتعامل مع محادثات أو مستندات أطول فأطول، فإنها تواجه عقبة كبيرة: وهي تكلفة تذكر كل ما قرأته حتى الآن. ولحل هذه المشكلة، طور الباحثون استراتيجيتين رئيسيتين؛ تتضمن إحدى الاستراتيجيات تغيير البنية الداخلية للنموذج لتكون أكثر كفاءة، باستخدام مزيج من طبقات الذاكرة القياسية وطبقات متخصصة ومبسطة تقوم بتلخيص المعلومات بدلاً من تخزين كل تفصيل صغير. أما الاستراتيجية الأخرى فهي حيلة برمجية تسمى "التخزين المؤقت للبوايات" (prefix caching)، والتي تدرك أن مستخدمين مختلفين غالباً ما يبدؤون طلباتهم بنفس الكلمات. فبدلاً من إعادة قراءة تلك الجمل الافتتاحية المتطابقة في كل مرة، يقوم النظام بحفظ نتيجة تلك المرحلة الأولى وإعادة استخدامها. وبينما تعمل هاتان الاستراتيجيتان بشكل جيد بمفردهما، فإن الجمع بينهما أثبت صعوبته لأن طبقات الذاكرة المبسطة لا يمكن إيقافها مؤقتاً واستئنافها بسهولة عند أي نقطة، على عكس نظيراتها القياسية.

لقد خلق هذا عدم التوافق مشكلة محددة للمهندسين الذين يحاولون بناء أنظمة ذكاء اصطناعي أسرع وأكثر كفاءة. فعندما يتم إعادة استخدام طبقة ذاكرة قياسية، يمكن للنظام القفز مباشرة إلى أي نقطة في النص المحفوظ. لكن الطبقات المبسطة، المصممة لضغط المعلومات، تحافظ على حالة مستمرة لا يمكن الرجوع عنها إلى نقطة بداية عشوائية دون فقدان معناها. حاولت الحلول السابقة التحايل على ذلك عبر حفظ لقطات لحالة النظام عند فترات زمنية ثابتة، ولكن هذا كان يعني أن النظام لا يمكنه إعادة استخدام النص إلا إذا انتهى الجزء المشترك بالضبط عند إحدى تلك اللقطات. فإذا انتهت سلسلة طويلة من الكلمات المشتركة بعد لقطة مباشرة، كان على النظام التخلص من التطابق والبدء من جديد، مما يضيع مكاسب الكفاءة.

قام باحثون من معهد الذكاء الاصطناعي التابع لشركة "تشاينا تليكوم" وجامعة شانغهاي جياو تونغ بتطوير طريقة جديدة تسمى "إعادة تشغيل الذيل" (Tail-Replay) لحل هذه المشكلة. تسمح منهجيتهم للنظام بإعادة استخدام النص المشترك عند أي نقطة، بغض النظر عن مكان أخذ اللقطات. وتعتمد الفكرة الجوهرية على خاصية محددة لطبقات الذاكرة المبسطة: وهي أنها مصممة لإعطاء وزن أكبر للمعلومات الحديثة مقارنة بالمعلومات القديمة. فبينما يعالج النظام نصاً طويلاً، يتلاشى تأثير الكلمات الأولى تدريجياً، بينما تهيمن الكلمات الأخيرة على الحالة الحالية. وقد أدرك الباحثون أنه لإعادة إنشاء حالة البواية (prefix) المطابقة، لا يحتاج النظام إلى إعادة تشغيل التاريخ الكامل لهذا النص، بل يحتاج فقط إلى إعادة تشغيل الجزء القصير الأخير من ذلك النص المشترك.

تعمل الطريقة الجديدة عن طريق حفظ الذاكرة التفصيلية الدقيقة للطبقات القياسية لكل كلمة، مع إهمال اللقطات الخاصة بالطبقات المبسطة. وعندما يصل طلب جديد يشترك في بدايات طويلة مع طلب سابق، يسترجع النظام الذاكرة القياسية المحفوظة للجزء المطابق. وبالنسبة للطبقات المبسطة، وبدلاً من محاولة العثور على لقطة مثالية، يأخذ النظام الذاكرة التفصيلية المحفوظة لآخر بضع كلمات من النص المشترك ويقوم بتشغيلها عبر الطبقات المبسطة من البداية. تعيد عملية إعادة التشغيل القصيرة هذه بناء الحالة الضرورية بدقة عالية. ولأن النظام يحتاج فقط إلى إعادة تشغيل "ذيل" صغير من النص، فإن العملية سريعة ولا تتطلب تخزين اللقطات الوسيطة الثقيلة التي كانت تحد من المرونة سابقاً.

اختبر الفريق هذه الطريقة على ثلاثة نماذج لغوية هجينة باستخدام معايير قياسية مصممة لقياس الأداء في المستندات الطويلة ومهام الاستدلال المعقدة. ووجدوا أنه من خلال إعادة تشغيل 5 إلى 10 بالمائة فقط من النص المطابق، حافظ النظام على ما بين 92.8 و99.9 بالمائة من الجودة التي كان سيحققها لو عالج النص بأكمله من البداية. ومن الناحية العملية، يعني هذا أن النظام يمكنه تجاوز العمل الشاق المتمثل في إعادة قراءة آلاف الكلمات دون التضحية بدقة إجاباته. وأظهرت النتائج أن الطريقة تعمل باستمرار عبر أنواع مختلفة من المهام، بدءاً من الإجابة على الأسئلة حول القصص الطويلة وصولاً إلى استرجاع حقائق محددة من مجموعات بيانات ضخمة.

بعيداً عن الدقة، قدمت الط طريقة تحسينات هائلة في السرعة. فعندما طُلب من النظام معالجة طلبات ذات بوايات مشتركة تبلغ 8,000 أو 16,000 أو 32,000 كلمة، انخفض الوقت المستغرق لتوليد الإجابة الأولى بشكل كبير. وكانت سرعة الاستجادة أكبر في النصوص الأطول، مما يثبت أن مكاسب الكفاءة تكون أكثر قيمة عندما يكون السياق أكثر تطلباً. كما طور الباحثون عمليات تحسين لتقليل الوقت المستغرق في نقل البيانات بين الذاكرة والمعالج، مما يضمن ألا تصبح عملية إعادة التشغيل عائقاً جديداً.

يُظهر هذا العمل أن القيود الناتجة عن الجمع بين بنى النماذج الفعالة وأنظمة التخزين المؤقت الذكية يمكن التغلب عليها دون المساس بالأداء. فمن خلال فهم أن تأثير المعلومات القديمة يتلاشى طبيعياً في هذه الطبقات المبسطة، حوّل الباحثون هذا القيد إلى فرصة. تسمح طريقة "إعادة تشغيل الذيل" للأنظمة بإعادة استخدام النص المشترك بحرية، بناءً على الكلمات نفسها وليس بناءً على نقاط تفتيش تعسفية. ويشير هذا التقدم إلى مسار نحو خدمات ذكاء اصطناعي أكثر استجابة وكفاءة يمكنها التعامل مع الطلبات المتزايدة لتطبيقات السياق الطويل دون الحاجة إلى زيادات هائلة في قدرات الحوسبة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →