← أحدث الأبحاث
🤖 machine learning

Unifying Sparse Attention with Hierarchical Memory for Scalable Long-Context LLM Serving

تقدم الورقة البحثية SPIN، وهو إطار عمل استدلال مصمم بشكل مشترك يوحد خوارزميات الانتباه المتناثرة المتنوعة مع إدارة هرمية لذاكرة وحدة معالجة الرسومات ووحدة المعالجة المركزية من خلال تجريد مشترك قائم على الصفحات، وتخزين مؤقت مدرك للمحلية، وتخطيطات بيانات وصفية محسنة، محققاً تحسينات كبيرة في معدل الإنتاجية وزمن الاستجابة مقارنة بتطبيقات vLLM والانتباه المتناثر الحالية.

المؤلفون الأصليون: Zihan Zhao, Baotong Lu, Shengjie Lin, Yizou Chen, Jing Liu, Yanqi Zhang, Ziming Miao, Ming-Chang Yang, Haiying Shen, Qi Chen, Fan Yang

نُشر 2026-04-30
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Zihan Zhao, Baotong Lu, Shengjie Lin, Yizou Chen, Jing Liu, Yanqi Zhang, Ziming Miao, Ming-Chang Yang, Haiying Shen, Qi Chen, Fan Yang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "توحيد الانتباه المتناثر مع الذاكرة الهرمية لخدمة النماذج اللغوية الكبيرة ذات السياق الطويل بكفاءة" باستخدام لغة بسيطة وتشبيهات من الحياة اليومية.

المشكلة الكبرى: "المكتبة اللامتناهية"

تخيل النموذج اللغوي الكبير (LLM) كأنه أمين مكتبة فائق الذكاء يحاول كتابة قصة بناءً على مكتبة ضخمة من الكتب (هذا هو "السياق").

  • الطريقة القديمة (الانتباه الكثيف - Dense Attention): في كل مرة يكتب فيها أمين المكتبة جملة جديدة، يتعين عليه المرور عبر المكتبة بأكملها، وقراءة كل كتاب من البداية إلى النهاية، فقط ليجد الجملة أو الجملتين اللتين لهما علاقة بما يكتبه الآن.
  • عنق الزجاجة: مع نمو المكتبة (من 10,000 كتاب إلى مليون كتاب)، يصاب أمين المكتبة بالإرهاق. ينفد منه المساحة على مكتبه (ذاكرة وحدة معالجة الرسومات - GPU memory) لاستيعاب كل هذه الكتب، ويقضي كل وقته في الذهاب والعودة (نطاق عرض الذاكرة - memory bandwidth) بدلاً من الكتابة.

الحل المقترح: "الانتباه المتناثر" (Sparse Attention)

أدرك الباحثون أن أمين المكتبة لا يحتاج فعلياً لقراءة كل كتاب؛ فغالباً ما تكون بضع صفحات محددة فقط هي المهمة للجملة التالية.

  • الفكرة: بدلاً من قراءة المكتبة بأكملها، يجب على أمين المكتبة التقاط الصفحات الحرجة القليلة التي يحتاجها فقط. وهذا ما يسمى بـ "الانتباه المتناثر" (Sparse Attention).
  • المشكلة الجديدة: رغم أن هذا يوفر وقت القراءة، إلا أنه يخلق فوضى جديدة. "الصفحات الحرجة" مبعثرة في أرجاء المكتبة، مما يضطر أمين المكتبة للركض ذهاباً وإياباً إلى القبو (ذاكرة المعالج المركزي - CPU memory) لجلب هذه الصفحات المبعثرة واحدة تلو الأخرى. هذا الركض ذهاباً وإياباً بطيء وغير فعال لدرجة أنه يلغي الوقت الذي تم توفيره بعدم قراءة المكتبة كاملة.

حل الورقة البحثية: Spin

بنى المؤلفون نظاماً جديداً يسمى Spin. تخيل Spin كأنه مساعد مكتبة منظم للغاية وعالي الكفاءة يدير سير عمل أمين المكتبة. يحل Spin هذه الفوضى بثلاث حيل ذكية:

1. نظام "الصندوق الموحد" (تجريد التقسيم الموحد)

كانت خوارزميات الانتباه المتناثر المختلفة (الطرق المختلفة لإيجاد الصفحات المهمة) تتحدث لغات مختلفة. إحدى الخوارزميات كانت تبحث عن "كتل" من الصفحات، وأخرى عن "تجمعات". هذا يعني أن مساعد المكتبة كان عليه بناء عربة مختلفة لكل خوارزمية.

  • إصلاح Spin: يقدم Spin "صندوقاً" قياسياً (يسمى Partition). بغض النظر عن الطريقة التي تستخدمها الخوارزمية لإيجاد الصفحات المهمة، يقوم Spin بوضعها في هذه الصناديق القياسية. هذا يسمح لمساعد المكتبة باستخدام نفس العربة ونفس نظام التوصيل الفعال لأي خوارزمية، مما يجعل من السهل استبدال الطرق الجديدة دون إعادة بناء المكتبة بالكامل.

2. "الثلاجة الذكية" (إدارة مفاتيح القيم والقيم - KV Management الواعية للموقع)

مكتب أمين المكتبة (ذاكرة GPU) صغيرة، لكن القبو (ذاكرة CPU) ضخم. الهدف هو إبقاء الصفحات الأكثر فائدة على المكتب والذهاب إلى القبو فقط عند الضرورة القصوى.

  • المشكلة: كانت الأنظمة السابقة تعمل بنظام "من يدخل أولاً يخرج أولاً". إذا وضعت كتاباً على المكتب، يظل هناك حتى يمتلئ المكتب، حتى لو لم تنظر إليه منذ ساعات.
  • إصلاح Spin: يستخدم Spin نهج "الثلاجة الذكية". فهو يراقب ما يفعله أمين المكتبة:
    • إذا استمر أمين المكتبة في النظر إلى مجموعة معينة من الصفحات، فإن Spin يبقيها على المكتب.
    • يستخدم سياسة "الـ LRU المعتمدة على السلال" (Bucketed LRU): بدلاً من تتبع كل ثانية تمر، يقوم بتجميع الصفحات في "سلال" بناءً على نشاطها الأخير. إذا كانت الصفحة قد استُخدمت مؤخراً، تبقى على المكتب. إذا كانت قديمة، يتم نقلها إلى القبو.
    • هذا يقلل من الرحلات إلى القبو (عمليات نقل PCIe)، وهي الجزء الأبطأ في العملية.

3. "الفهرس الذكي" (البيانات الوصفية الهرمية)

لمعرفة مكان كل كتاب، يحتاج أمين المكتبة إلى كتالوج (بيانات وصفية - metadata). وفي مكتبة ضخمة، يمكن للكتالوج نفسه أن يصبح ضخماً لدرجة أنه يشغل مساحة أكبر من الكتب نفسها!

  • المشكلة: حاولت الأنظمة القديمة طباعة كتالوج لكل كتاب محتمل قد يوجد مستقبلاً (سيناريو الحالة الأسوأ)، حتى لو كانت المكتبة تحتوي على عدد قليل من الكتب حالياً. هذا أدى لضياع مساحات هائلة من مساحة المكتب.
  • إصلاح Spin: يستخدم Spin فهرساً ذا مستويين، يشبه دليل الهاتف.
    • يحتفظ بـ "جدول محتويات" صغير على المكتب (GPU) يشير إلى فصول محددة.
    • أما القوائم الكاملة والمفصلة فتُحفظ في القبو (CPU) ولا تُحضر إلا عند الحاجة.
    • هذا يعني أن الكتالوج ينمو فقط بحجم الكتب التي تستخدمها بالفعل، مما يوفر مساحات هائلة من مساحة المكتب للكتب الفعلية.

النتائج: لماذا هذا مهم؟

اختبر المؤلفون نظام Spin على أجهزة حقيقية (وحدات معالجة الرسومات NVIDIA A100 و B200) مع نماذج ذكاء اصطناعي مختلفة.

  • السرعة: كان Spin أسرع بـ 1.66 إلى 5.66 مرة في معالجة الطلبات مقارنة بالنظام القياسي الحالي (vLLM).
  • وقت الانتظار: كان الوقت المستغرق لبدء الإجابة على سؤال (Time-to-First-Token) أسرع بـ 7 إلى 9 مرات.
  • الكفاءة: حتى مقارنة بالنسخ الأصلية غير المحسنة من خوارزميات الانتباه المتناثر، جعلها Spin أسرع بمقدار يصل إلى 2.39 مرة فقط من خلال تنظيم حركة البيانات بشكل أفضل.

الخلاصة

Spin لا يخترع طريقة جديدة لإيجاد "الصفحات المهمة" (هذه مهمة الخوارزميات). بدلاً من ذلك، يبني نظاماً لوجستياً أفضل لنقل تلك الصفحات. من خلال تنظيم البيانات في صناديق قياسية، وإبقاء العناصر الأكثر استخداماً قريبة من اليد، واستخدام كتالوج ذكي، يسمح Spin لنماذج الذكاء الاصطناعي بالتعامل مع كميات هائلة من النصوص دون أن تتعثر بسبب حدود الذاكرة أو بطء نقل البيانات.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →