← أحدث الأبحاث
🤖 machine learning

TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference

يُعد TokenWeave نظاماً مبتكراً يحقق تداخلاً فعالاً بين الحوسبة والاتصال في عمليات الاستنتاج الموزعة للنماذج اللغوية الكبيرة ذات الدفعات الصغيرة، وذلك عبر دمج عملية RMSNorm مع اتصالات AllReduce باستخدام ميزات متخصصة في وحدات معالجة الرسومات، مما يقلل زمن الاستجابة ويزيد من معدل الإنتاجية حتى عندما يكون عدد الرموز لكل تكرار منخفضاً بقدر 1024 رمزاً.

المؤلفون الأصليون: Raja Gond, Nipun Kwatra, Ramachandran Ramjee

نُشر 2026-05-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Raja Gond, Nipun Kwatra, Ramachandran Ramjee

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مصنعاً ضخماً فائق السرعة (نموذج لغوي كبير) يعالج طلبات العملاء. ولجعل هذا المصنع سريعاً بما يكفي، قمت بتعيين فريق من 8 عمال خبراء (وحدات معالجة رسومية - GPUs) للعمل معاً. وهم متصلون بنظام سيور ناقلة فائق السرعة (NVLink) لتمكينهم من مشاركة عملهم فورياً.

ومع ذلك، هناك مشكلة: يقضي العمال وقتاً طويلاً جداً في انتظار التحدث مع بعضهم البعض.

حتى مع وجود السيور الناقلة فائقة السرعة، يضطر العمال إلى التوقف عن البناء الفعلي (الحوسبة) لتبادل الملاحظات (التواصل). وجد المؤلفون أنه بالنسبة للنماذج الكبيرة، يستهلك "وقت التحدث" هذا حوالي 20% من الوقت الإجمالي. الأمر يشبه طباخاً يتوقف ليطلب من الطهاة الآخرين في المطبخ: "هل لديكم ملح؟" قبل أن يتمكن من تقطيع الخضروات التالية.

الطريقة القديمة: تقسيم العمل إلى أجزاء صغيرة

حاولت المحاولات السابقة لإصلاح ذلك تقسيم العمل إلى قطع صغيرة جداً. كانت الفكرة هي: "بينما يقوم العامل (أ) بتمرير ملاحظة إلى العامل (ب)، يمكن للعامل (أ) البدء في تقطيع الخضروات التالية".

لكن المؤلفين وجدوا أن هذا لم يعمل بشكل جيد مع الطلبات الصغيرة (وهو ما يحدث عندما تسأل الذكاء الاصطناعي سؤالاً قصيراً). فتقسيم المهمة الكبيرة إلى قطع صغيرة جعل العمال أبطأ في الواقع لأنهم اضطروا للتوقف والبدء مرات عديدة. إنه مثل محاولة الجري في سباق تتابع حيث تمرر العصا كل 10 أقدام؛ وقت التوقف لتسليم العصا يكون أكثر من وقت الجري نفسه!

الحل الجديد: TokenWeave

بنى المؤلفون نظاماً جديداً يسمى TokenWeave. فكر فيه كمدير ذكي يعيد تنظيم أرضية المصنع للقضاء على وقت الانتظار. إليك كيف فعلوا ذلك، باستخدام ثلاث حيل بسيطة:

1. "التقسيم الذكي" (الطريق السريع ذو المسارين)

بدلاً من محاولة تقسيم العمل إلى مليون قطعة صغيرة، يقوم TokenWeave بتقسيم الطلب إلى كتلتين كبيرتين فقط.

  • الكتلة أ: تبدأ العمل على النصف الأول من المهمة.
  • الكتلة ب: تبدأ العمل على النصف الثاني من المهمة.
  • السحر: بينما تنشغل الكتلة (أ) بالقيام بعملياتها الحسابية، تكون الكتلة (ب) مشغولة بتمرير ملاحظاتها. ثم يتبادلان الأدوار؛ تمرر الكتلة (أ) الملاحظات بينما تقوم الكتلة (ب) بالعمليات الحسابية.
  • لماذا ينجح هذا: اكتشف المؤلفون بالضبط كيفية تقسيم العمل بحيث لا "يعلق" العمال في انتظار السير الناقل. يطلقون على هذا "الوعي بالموجة" (wave-aware)، مما يعني أنهم يتأكدون من أن العمال مشغولون دائماً، تماماً مثل نظام إشارات مرور متقن التوقيت يحافظ على حركة السيارات دون توقف.

2. "النواة المدمجة" (الأداة الشاملة)

في المصنع القديم، كان على العمال القيام بشيئين منفصلين:

  1. تمرير الملاحظات (التواصل).
  2. تطبيع البيانات (خطوة رياضية تسمى RMSNorm).

أدرك المؤلفون أن القيام بهاتين الخطوتين بشكل منفصل هو أمر هدِر للوقت. الأمر يشبه الاضطرار للمشي إلى خزانة المستلอดات لإحضار مطرقة، ثم العودة إلى طاولة العمل لضرب مسمار، ثم العودة إلى الخزانة لإحضار مفك براغي.

  • الإصلاح: قاموا ببناء "أداة فائقة" جديدة (نواة مدمجة/fused kernel) تقوم بتمرير الملاحظات والخطوة الرياضية في نفس الوقت.
  • الميزة الإضافية: هذه الأداة الفائقة فعالة للغاية لدرجة أنها لا تحتاج سوى لجزء ضئيل جداً من طاقة المصنع (2 إلى 8 عمال فقط من أصل 132) لتعمل. وهذا يترك بقية العمال أحراراً للتركيز تماماً على المهام الثقيلة (الحوسبة).

3. "إعادة الترتيب الذكية" (القيام بالأمر بالترتيب الصحيح)

عادةً، يقوم المصنع بتمرير جميع الملاحظات أولاً، ثم يقوم بالعملية الرياضية. لكن المؤلفين أدركوا أنه يمكن إجراء الخطوة الرياضية (RMSNorm) أثناء عملية تمرير الملاحظات إذا أعادوا ترتيب الخطوات.

  • التشبيه: بدلاً من الانتظار حتى وصول الشاحنة بأكملها قبل البدء في التفريغ، تبدأ بتفريغ أول صندوق بمجرد وصول الشاحنة. يعيد TokenWeave ترتيب الخطوات بحيث تحدث الرياضيات أثناء انتقال البيانات، مما يوفر وقتاً هائلاً.

النتائج

اختبر المؤلفون هذا النظام الجديد على أجهزة كمبيوتر قوية (8 وحدات معالجة رسومية من نوع H100) مع نماذج واقعية مثل Llama و Qwen.

  • السرعة: وجدوا أن TokenWeave جعل المصنع أسرع بمقدار 1.28 مرة (زيادة في السرعة بنسبة 28%) مقارم بأفضل الأنظمة الموجودة.
  • الطلبات الصغيرة: حتى بالنسبة للأسئلة القصيرة جداً (1,000 كلمة فقط)، كان أسرع بمقدار 1.2 مرة. الأنظمة السابقة كانت في الواقع تصبح أبطأ مع الطلبات الصغيرة.
  • الإنتاجية: يمكن للمصنع التعامل مع 19% أكثر من العملاء في الساعة.
  • "الادعاء السحري": في بعض الحالات، كان TokenWeve فعالاً للغاية لدرجة أنه تفوق في الأداء على نسخة نظرية من المصنع الذي لا يحتوي على أي تواصل على الإطلاق. وذلك لأن "الأداة الفائقة" الجديدة الخاصة بهم أصلحت الخطوة الرياضية بشكل جيد لدرجة أنها عوضت الوقت المستغرق في التحدث.

الملخص

TokenWeave يشبه قائد أوركسترا بارع. بدلاً من ترك الموسيقيين يتوقفون للتحدث مع بعضهم البعض (مما يبطئ الموسيقى)، فإنه يعلمهم عزف أدوارهم بينما يقوم القائد بتمرير النوتة الموسيقية في الوقت ذاته. ومن خلال تقسيم العمل إلى كتلتين ذكيتين واستخدام أداة "شاملة" جديدة، قضوا على وقت الانتظار، مما جعل استنتاج الذكاء الاصطناعي (AI inference) أسرع وأكثر كفاءة بشكل ملحوظ.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →