← أحدث الأبحاث
💻 computer science

TACO: Efficient Communication Compression of Intermediate Tensors for Scalable Tensor-Parallel LLM Training

يُعد TACO إطار عمل قويًا يعتمد على تنسيق FP8، حيث يستخدم التكميم التكيفي وعامل ضغط مدمج لضغط الموترات الوسيطة بكفاءة في تدريب النماذج اللغوية الكبيرة المتوازية تيسيرياً، محققاً تحسناً في معدل الإنتاجية يصل إلى 1.87 ضعفاً مع الحفاظ على دقة تقارب الدقة الأصلية.

المؤلفون الأصليون: Man Liu, Xingchen Liu, Xingjian Tian, Bing Lu, Shengkay Lyu, Shengquan Yin, Wenjing Huang, Zheng Wei, Hairui Zhao, Guangming Tan, Dingwen Tao

نُشر 2026-04-28
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Man Liu, Xingchen Liu, Xingjian Tian, Bing Lu, Shengkay Lyu, Shengquan Yin, Wenjing Huang, Zheng Wei, Hairui Zhao, Guangming Tan, Dingwen Tao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول تعليم فريق ضخم من الروبوتات (نموذج لغوي كبير) كيفية كتابة قصة. للقيام بذلك، تقوم بتقسيم العمل بين مئات الروبوتات التي تعمل بالتوازي. يُسمى هذا التوازي التنسوري (Tensor Parallelism).

ومع ذلك، هناك مشكلة رئيسية: يحتاج هؤلاء الروبوتات إلى تبادل الهمسات حول تقدمهم باستمرار. إنهم يمررون الملاحظات لبعضهم البعض آلاف المرات في الثانية. المشكلة هي أن هذه الملاحظات ضخمة، والممر الذي يستخدمونه لتمريرها (الشبكة) ضيق وبطيء. يقضي الروبوتات وقتاً في انتظار الملاحظات أكثر مما يقضونه في كتابة القصة فعلياً.

TACO هو نظام جديد مصمم لتقليص حجم هذه الملاحظات حتى يتمكن الروبوتات من التحدث بشكل أسرع دون فقدان معنى القصة.

إليك كيف يعمل TACO، مشروحاً عبر تشبيهات بسيطة:

1. المشكلة: "زحام الصفر" (The Zero Crowd)

الملاحظات التي يمررها الروبوتات (والتي تسمى التنسورات الوسيطة) لها شكل غريب. معظم الأرقام فيها صغيرة جداً، متجمعة حول الصفر مباشرة. هناك قلة من الأرقام كبيرة، لكنها نادرة.

  • الطريقة القديمة (INT8): تخيل أنك تحاول وصف حشد حيث 99% من الناس واقفون بلا حراك في دائرة صغيرة، و1% فقط يركضون بعيداً. إذا استخدمت مسطرة قياسية (INT8) ذات مسافات متساوية لكل بوصة، فلن تتمكن من قياس الدائرة الصغيرة بدقة. سيتم سحق الجميع في تلك الدائرة في نفس المكان، وتضيع المعلومات. سيصاب الروبوتات بالارتباك، وتفشل عملية التدريب.
  • حل TACO (استخدام FP8): يستخدم TACO مسطرة خاصة (FP8) تحتوي على علامات دقيقة وصغيرة جداً بالقرب من الصفر وعلامات أوسع بعيداً عنه. هذا مثالي لـ "زحام الصفر". ولكن حتى هذه المسطرة لها حدود.

2. الخدعة السحرية: "الخلط التكيفي" (Adaptive Shuffle - ASH Transform)

حتى مع وجود مسطرة FP8 الخاصة، لا تزال هذه الملاحظات مزدحمة جداً بالقرب من الصفر. يقوم TACO بخدعة سحرية ذكية تسمى تحويل (Scale–Hadamard) التكيفي.

  • التشبيه: تخيل غرفة مليئة بالناس المتجمعين بإحكام في زاوية واحدة (قيم الصفر). إذا طلبت منهم فقط الوقوف في صف واحد، فسيظلون قريبين جداً من بعضهم البعض بحيث يصعب عدّهم بدقة.
  • ما يفعله TACO: يقوم أولاً بقياس مدى "نشاط" كل مجموعة صغيرة من الناس. ثم يقوم بلطف بدفع المجموعات الهادئة (القيم المنخفضة) بعيداً عن بعضها لتصبح أسهل في الرؤية، بينما يسحب المجموعات الصاخبة (القيم العالية) لتصبح أقرب إلى بعضها حتى لا تخرج عن حدود الغرفة.
  • النتيجة: أصبح الحشد الآن منتشراً بشكل مثالي عبر الغرفة، مما يجعله يتناسب تماماً مع "النقطة المثالية" لمسطرة FP8. هذا يمنع "انهيار الصفر" (Zero-Collapse) حيث تضيع المعلومات.

3. شبكة الأمان: "المقياس المزدوج" (Dual-Scale - DS)

في بعض الأحيان، حتى بعد عملية الخلط، قد تصبح بعض الأرقام كبيرة جداً بالنسبة لمسطرة FP8، أو صغيرة جداً.

  • التشبيه: تخيل أنك تقوم بتعبئة حقيبة سفر. لديك مقياس رئيسي للملابس الثقيلة، ولكنك تحتاج أيضاً إلى مقياس صغير للمجوهرات.
  • ما يفعله TACO: يستخدم مقياسين في آن واحد. المقياس الأول يضبط المجموعة بأكملها لتناسب الحقيبة (لمنع تجاوز السعة)، بينما يضمن المقياس الآخر أن المجوهرات الصغيرة (القيم الصغيرة) لن تُسحق. هذا يحافظ على استقرار التدريب ويمنع الروبوتات من "الانحراف" (الخروج عن المسار).

4. دفعة السرعة: "المطبخ المدمج" (The Fusion Kitchen)

عادةً، لتقليص حجم هذه الملاحظات، يجب على الكمبيوتر القيام بثلاث خطوات منفصلة: قياس الحشد، ثم خلطهم، ثم تعبئتهم. هذا يشبه طباخاً يقطع الطعام، ثم يقلبه، ثم يضعه في الأطباق، ولكنه يضطر للمشي إلى الثلاجة بين كل خطوة وأخرى. هذا بطيء.

  • ابتكار TACO: يبني TACO "مطبخاً مدمجاً". إنه يجمع بين التقطيع، والتقليب، والتجهيز في حركة واحدة فائقة السرعة. يقوم الكمبيوتر بالخطوات الثلاث معاً دون التوقف لكتابة البيانات في الذاكرة. وهذا يجعل العملية سريعة للغاية ويسمح للروبوتات بالتحدث أثناء استمرارهم في التفكير (تداخل التواصل مع الحوسبة).

النتائج

اختبرت الورقة البحثية نظام TACO على نماذج ضخمة (مثل GPT و Qwen) ووجدت:

  • السرعة: جعلت التدريب أسرع بمقدار 1.87 مرة في بعض الحالات.
  • الدقة: رغم تقليص حجم البيانات بهذا القدر، تعلمت الروبوتات بنفس جودة إرسال الملاحظات الكاملة غير المضغوطة. "الخسارة" (الخطأ) كانت شبه منعدمة.
  • القابلية للتوسع: يعمل بشكل رائع حتى عندما يكون لديك 8، 16، أو أكثر من الروبوتات تعمل معاً.

باختصار: TACO هو طريقة ذكية وسريعة لتقليص حركة البيانات الضخمة بين روبوتات تدريب الذكاء الاصطناعي. إنه يستخدم خدعة "إعادة الترتيب" لجعل البيانات تتناسب تماماً مع تنسيق أصغر، مما يضمن تعلم الذكاء الاصطناعي بسرعة دون أن يفقد عقله.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →