← أحدث الأبحاث
💬 NLP

DeInfer: Efficient Parallel Inferencing for Decomposed Large Language Models

تقدم هذه الورقة DeInfer، وهو نظام استدلال عالي الأداء مصمم لمعالجة ضعف قابلية التوسع في الاستدلال المتوازي لنماذج اللغات الكبيرة المفككة من خلال تحسينات متعددة والتوافق مع التقنيات الحديثة.

المؤلفون الأصليون: You-Liang Huang, Xinhao Huang, Chengxi Liao, Zeyi Wen

نُشر 2026-04-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: You-Liang Huang, Xinhao Huang, Chengxi Liao, Zeyi Wen

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة DeInfer البحثية، مترجم إلى لغة بسيطة وعامية مع بعض التشبيهات الإبداعية.

الصورة الكبيرة: مشكلة "الضغط"

تخيل أن لديك مكتبة ضخمة وذكية للغاية (نموذج لغوي كبير أو LLM) تعرف كل شيء. لكن هذه المكتبة ضخمة جدًا لدرجة أنها لا تتسع في منزلك (ذاكرة حاسوبك).

لجعلها تتسع، ابتكر الباحثون حيلة ذكية تسمى تفكيك النموذج (Model Decomposition). فكر في هذا الأمر كأنك تأخذ موسوعة ضخمة وثقيلة وتقوم بتجزئتها إلى مجلدات أصغر وأخف وزنًا. يمكنك الآن حملها في حقيبة ظهر.

العقبة:
بينما يجعل تقسيم الكتاب الشيء أخف وزنًا، فإنه يجعله أيضًا أصعب في القراءة.

  • الطريقة القديمة: تفتح كتابًا واحدًا كبيرًا، تقرأ صفحة، وتنتهي المهمة.
  • الطريقة الجديدة (المفككة): يتعين عليك فتح ثلاثة كتب صغيرة، وقراءة صفحة من كل منها، ثم لصق الصفحات معًا في عقلك لتفهم القصة.

عندما تحاول القيام بذلك بمفردك، فالأمر يسير بشكل جيد. ولكن عندما تحاول القيام بذلك مع فريق من الأشخاص (باستخدام عدة أجهزة كمبيوتر أو وحدات معالجة رسومات GPUs تعمل بالتوازي)، يتعثر الفريق في الجدال حول كيفية لصق الصفحات معًا. هذا العبء في التواصل يبطئ كل شيء ويجعله يسير ببطء شديد.

هنا يأتي دور DeInfer:
قام مؤلفو هذه الورقة ببناء نظام جديد يسمى DeInfer. إنه يشبه توظيف مدير مشروع فائق الكفاءة يعيد تنظيم الفريق حتى لا يضيعوا وقتهم في الجدال. إنهم يكتشفون كيفية تمرير "الصفحات الملصقة" بسرعة أكبر بكثير، مما يجعل الفريق يعمل معًا بسلاسة حتى مع الكتب المفككة.


العقبات الثلاث الكبرى (لماذا كان الأمر بطيئًا)

حددت الورقة ثلاثة أسباب محددة جعلت "الكتب المفككة" تسبب اختناقات مرورية:

1. مشكلة "الاجتماعات الكثيرة جدًا" (التواصل)

  • التشبيه: تخيل فريقًا من الطهاة يحاولون صنع حساء. في الطريقة القديمة، يمررون قدرًا واحدًا كبيرًا مرة واحدة. في الطريقة الجديدة، نظرًا لأن المكونات مقطعة إلى قطع صغيرة، يتعين عليهم تمرير القدر ذهابًا وإيابًا أربع مرات فقط للحصول على نفس النتيجة.
  • الحل: يقوم DeInfer بتغيير الوصفة. بدلًا من تمرير القدر ذهابًا وإيابًا في "المطبخ" (منطقة المعالجة الرئيسية)، يقومون بتمرير المكونات في "زقاق خلفي" (مساحة مضغوطة وذات رتبة أقل) حيث يكون المسار أقصر وأسرع. هذا يقلل الوقت المستغرق في تمرير الأشياء بنسبة 78%.

2. مشكلة "العمل المزدوج" (الحساب المكرر)

  • التشبيه: تخيل خمسة أشخاص في غرفة، كل منهم يحمل قطعة من لغز (Puzzle). في الطريقة القديمة، ينظر الجميع إلى قطعتهم الخاصة ويفهمون كيف تتناسب. في النسخة المفككة، اختلطت التعليمات، فانتهى الأمر بالجميع وهم يحلون اللغز بأكره خمس مرات، رغم أن كل منهم يحتاج فقط لحل قطعته الخاصة.
  • الحل: يعمل DeInfer كأنه مشرف صارم. يقول: "توقفوا! لديكم جميعًا نفس المعلومات الآن. شخص واحد فقط يحتاج للقيام بالتفكير، والآخرون ينتظرون الإجابة فقط". هذا يمنع الفريق من القيام بعمل مكرر وغير مفيد.

3. مشكلة "الهدف المتحرك" (مخطط CUDA)

  • التشبيم: تخيل قطارًا (برنامج الكمبيوتر) يعمل على مسار ثابت (مخطط استاتيكي/ثابت). إنه سريع جدًا لأن المسار موضوع مسبقًا. لكن مع الكتب المفككة، تستمر "عربات القطار" (البيانات) في تغيير حجمها مع طول القصة. لا يستطيع القطار استخدام المسار الثابت بعد الآن؛ بل يجب عليه التوقف ووضع مسارات جديدة في كل مرة يتحرك فيها، وهو أمر بطيء للغاية.
  • الحل: يبني DeInfer "مخزنًا سحريًا" (Magic Buffer). يقوم بجمع جميع عربات القطار المشتتة، ويضعها في خط مرتب ومدمج قبل أن يبدأ القطار في التحرك، ثم يثبتها في مكانها. الآن، يمكن للقطار الركض على المسار الثابت والسريع مرة أخرى، رغم أن البيانات كانت في الأصل غير منظمة.

النتائج: ما مدى سرعة هذا النظام؟

اختبر الباحثون هذا النظام على أجهزة كمبيوتر قوية (مثل فريق من 8 أجهزة كمبيوتر خارقة تعمل معًا).

  • بدون DeInfer: مع إضافة المزيد من أجهزة الكمبيوتر، لم تزد السرعة فعليًا. كان الفريق يقضي كل وقته في التحدث مع بعضهم البعض، وليس في العمل.
  • مع DeInfer:
    • السرعة: شهدوا تسارعًا يصل إلى 8.8 ضعفًا في بعض السيناريوهات.
    • القابلية للتوسع: كلما أضفت المزيد من أجهزة الكمبيوتر، زادت السرعة. لقد عمل النظام بالفعل كما هو مفترض له.
    • زمن الاستجابة (Latency): انخفض الوقت المستغرق للحصول على أول إجابة بنسبة تزيد عن 80%.

الخلاصة

DeInfer هو نظام يعالج "الاختناقات المرورية" الناتجة عن محاولة تشغيل نماذج الذكاء الاصطناعي المضغوطة والمفككة على عدة أجهزة كمبيوتر في وقت واحد.

من خلال إعادة تنظيم كيفية تمرير البيانات، ومنع الناس من القيام بنفس العمليات الحسابية مرتين، وتنظيم البيانات بحيث يمكن للكمبيوتر استخدام أسرع "إعدادات الطرق السريعة" لديه، يجعل DeInfer من الممكن تشغيل نماذج الذكاء الاصطناعي الضخمة والمضغوطة بسرعة وكفاءة. إنه يحول مجموعة فوضوية من الأشخاص يحاولون قراءة كتاب ممزق إلى آلة تعمل بدقة متناهية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →