← أحدث الأبحاث
🤖 machine learning

Efficient, VRAM-Constrained xLM Inference on Clients

تقدم هذه الورقة تقنية "التجزئة المتسلسلة" (pipelined sharding)، وهي تقنية جدولة هجينة مبتكرة بين المعالج المركزي ومعالج الرسوميات تعمل على تحسين سرعة الاستدلال وتقليل متطلبات ذاكرة الوصول العشوائي للفيديو (VRAM) لنماذج اللغات الكبيرة والنماذج اللغوية البصرية على أنظمة العملاء بشكل كبير، محققةً مكاسب في الإنتاجية تصل إلى 30 ضعفاً وانخفاضاً في ذاكرة VRAM بمقدار 10 أضعاف مقارنة بالنماذج المرجعية الشرسة.

المؤلفون الأصليون: Aditya Ukarande, Deep Shekhar, Marc Blackstein, Ram Rangan

نُشر 2026-04-30
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Aditya Ukarande, Deep Shekhar, Marc Blackstein, Ram Rangan

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح للورقة البحثية باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة الكبرى: معضلة "الحقيبة الصغيرة"

تخيل أن لديك مكتبة ضخمة وذكية للغاية (نموذج لغوي كبير أو ذكاء اصطناعي) وتريد حملها معك في حقيبة ظهرك. المشكلة هي أن حقيبة ظهرك (ذاكرة الفيديو VRAM في جهاز الكمبيوتر الخاص بك) صغيرة جداً.

إذا حاولت حشر المكتبة بأكملها داخل الحقيبة، فلن تتسع. وإذا حاولت ترك المكتبة في المنزل وإحضار صفحات قليلة فقط، فسيصبح الذكاء الاصطناعي بطيئاً أو غبياً لأنه سيضطر للركض ذهاباً وإياباً إلى المنزل لجلب المزيد من المعلومات.

الحلول الحالية غالباً ما تجبرك على التخلص من أجزاء من المكتبة (مما يجعل الذكاء الاصطناعي أقل دقة) أو تتطلب منك امتلاك حقيبة ظهر ضخمة وباهظة الثمن لا يملكها معظم الناس.

الحل: "التجزئة المتسلسلة" (طاقم النقل الذكي)

ابتكر المؤلفون، الذين يعملون في شركة NVIDIA، نظاماً جديداً يسمى Pipelined Sharding (التجزئة المتسلسلة). فكر في هذا كطاقم نقل منظم للغاية وذكي جداً، يعرف بالضبط كيفية حزم ونقل مكتبتك بين منزلك (المعالج المركزي CPU أو الذاكرة الرئيسية) وحقيبة ظهرك (وحدة معالجة الرسومات GPU أو ذاكرة الفيديو) دون أن تضطر لتحريك إصبع واحد.

إليك كيف يعمل ذلك، مقسماً إلى ثلاث خطوات بسيطة:

1. "تجربة القيادة" (التوصيف - Profiling)

قبل أن يبدأ طاقم النقل عمله، يقومون بـ "تجربة قيادة" سريعة على جهاز الكمبيوتر الخاص بك. إنهم يتحققون من:

  • مدى سرعة المعالج المركزي (CPU) الخاص بك؟
  • مدى عرض الممر بين منزلك وحقيبة ظهرك (اتصال PCIe
  • كم تبلغ المساحة الفعلية في حقيبة ظهرك؟

إنهم لا يخمنون؛ بل يقيسون. وهذا ينشئ "ملف تعريف" لنقاط القوة والضعف الفريدة في جهازك.

2. استراتيجية "الخطط الثلاث" (التخطيط)

بناءً على تجربة القيادة، يجهز النظام ثلاث استراتيجيات نقل مختلفة لكل موقف محتمل:

  • الخطة (أ) (العداء السريع): إذا كان لديك حقيبة ظهر ضخمة وممر سريع، يضع الطاقم كل شيء في حقيبة الظهر وينطلق بسرعة.
  • الخطة (ب) (سباق التتابع): إذا كانت حقيبة الظهر صغيرة ولكن لديك العديد من المساعدين الأقوياء (خيوط المعالجة في الـ CPU)، يقوم الطاقم بتقسيم العمل. بعض الكتب تبقى في المنزل ويقرؤها المساعدون، بينما توجد كتب أخرى في حقيبة الظهر. إنهم ينقلون الكتب ذهاباً وإياباً بكفاءة.
  • الخطة (ج) (التداخل): إذا كان الممر واسعاً، يبدأ الطاقم في حمل الدفعة التالية من الكتب بينما يتم قراءة الدفعة الحالية. هذا يخفي الوقت المستغرق في نقل الأشياء.

النظام لا يختار خطة واحدة للأبد. بل ينظر إلى ما تفعله في اللحظة الحالية. هل تقرأ جملة قصيرة (وضع التفاعل) أم فصلاً كاملاً (وضع الدفعات/Batch mode)؟ إنه يختار الخطة الأفضل لتلك اللحظة تحديداً.

3. تعبئة "الطبقات الفرعية" (التجزئة - Sharding)

بدلاً من نقل فصول كاملة دفعة واحدة، يقوم هذا الطاقم بتفكيك المكتبة إلى أقسام صغيرة (طبقات فرعية).

  • قسم كبار الشخصيات (VIP): الأجزاء الأكثر أهمية (مثل آلية "الانتباه" - Attention، التي تساعد الذكاء الاصطناعي على التركيز على ما يهم) تُحفظ دائماً في حقيبة الظهر لأنها مطلوبة باستمرار.
  • قسم التخزين: الأجزاء الأقل أهمية تبقى في المنزل ولا تُخرج إلا عند الضرورة القصوى.

هذا النهج القائم على "الطبقات الفرعية" يسمح للنظام باستيعاب نماذج ضخمة في حقائب ظهر صغيرة لم يكن بإمكانها استيعابها سابقاً على الإطلاق.

ترقية الرؤية: "VLMOpt" (عدسة الكاميرا)

تتناول الورقة أيضاً نماذج اللغة والرؤية (VLMs)، وهي أنواع من الذكاء الاصطناعي التي يمكنها "رؤية" الصور.

  • المشكلة: الصور عالية الدقة تشبه اللوحات الضخمة والثقيلة. محاولة تحميل صورة بدقة 4K في حقيبة ظهر صغيرة تؤدي إلى تعطل النظام.
  • الحل: أضافوا خدعة خاصة تسمى VLMOpt.
    1. الإخراج (Offloading): يحتفظون بـ "أدوات الرسم" الثقيلة (الأوزان) في المنزل ويجلبون فقط ضربات الفرشاة المحددة المطلوبة للحظة الحالية.
    2. الانتباه الوميضي (Flash Attention): يستخدمون طريقة جديدة للنظر إلى الصورة لا تتطلب تذكر كل بكسل في وقت واحد، مما يوفر مساحة هائلة.
    3. عدم التداخل: يضمنون أن جزء "الرسم" وجزء "القراءة" في الذكاء الاصطناعي لا يحاولان الجلوس في حقيبة الظهر في نفس الوقت. إنهما يتبادلان الأدوار، بحيث لا تمتلئ حقيبة الظهر أبداً بشكل مفرط.

النتائج: ماذا حدث بالفعل؟

اختبرت الورقة هذا النظام على أجهزة كمبيوتر حقيقية (من أجهزة اللابتوب إلى أجهزة سطح المكتب المتطورة) مع نماذج ذكاء اصطناعي متنوعة. إليكم ما وجدوه، مع الالتزام التام بادعاءاتهم:

  • السرعة: بالنسبة للاستخدام التفاعلي (مثل الدردشة مع الذكاء الاصطناعي)، جعل النظام الذكاء الاصطناعي أسرع بـ 6.7 مرة في بدء الكلام وأسرع بـ 30 مرة في توليد الكلمات مقارنة بالطرق السابقة.
  • استيعاب ما لا يمكن استيعابه: تمكنوا من تشغيل نموذج ذكاء اصطناعي ضخم بحجم 77 جيجابايت على جهاز يحتوي على 2 جيجابايت فقط من ذاكرة الفيديو. هذا يشبه وضع مبنى مكون من 77 طابقاً في صندوق أحذية.
  • الدفعات (Batching): عند معالجة العديد من الطلبات في وقت واحد (وضع الدفعات)، كان النظام أسرع بمقدار يصل إلى 8.2 مرة.
  • الألعاب: عند تشغيل ذكاء اصطناعي بجانب لعبة فيديو (مثل Cyberpunk 2077)، وجد النظام "نقطة مثالية" حيث تعمل كل من اللعبة والذكاء الاصطناعي بسلاسة دون أن يتسبب أحدهما في تعطل الآخر.
  • الرؤية: بالنسبة للذكاء الاصطناعي "Cosmos-Reason1" (الذي ينظر إلى الصور)، قللوا من الذاكرة المطلوبة بمقدار 10 مرات، مما سمح بتحليل الصور عالية الدقة على أجهزة لم تكن قادرة على التعامل معها سابقاً.

الخلاصة

تقدم هذه الورقة "مجدولاً ذكياً" يعمل كقائد أوركسترا بارع لموارد جهاز الكمبيوتر الخاص بك. هو لا يجعل الذكاء الاصطناعي أقل دقة (إنه "بدون فقدان للمعلومات" - lossless)؛ بل يكتشف الطريقة الأكثر كفاءة لنقل البيانات بين ذاكرتك الرئيسية وذاكرة الفيديو الخاصة بك.

من خلال القيام بذلك، فإنه يسمح للمطورين بتشغيل نماذج ذكاء اصطناعي ضخمة وذكية على أجهزة اللابتوب العادية وأجهزة الكمبيوتر المخصولة للألعاب، حتى لو كانت هذه الأجهزة تمتلك ذاكرة فيديو محدودة للغاية. إنه يحول مشكلة "أكبر من أن تسع" إلى حل "مناسب تماماً" من خلال التكيف المستمر مع الظروف الحالية للجهاز.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →