← أحدث الأبحاث
🤖 AI

Position: LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics

تجادل هذه الورقة الموقفة بأن خدمة استدلال النماذج اللغوية الكبيرة قد تجاوزت الاستدلالات العامة، وتتطلب تطوير نماذج تحسين رياضية وأسس خوارزمية مصممة خصيصاً لخصائصها الفريدة لضمان ضمانات أداء مثبتة عبر مختلف أعباء العمل.

المؤلفون الأصليون: Zijie Zhou

نُشر 2026-05-06
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Zijie Zhou

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مطبخاً ضخماً وعالي السرعة. هذا المطبخ لا يكتفي بطهي البرجر فحسب؛ بل يصنع وجبات معقدة متعددة الأصناف بناءً على طلبات تصل واحداً تلو الآخر. العائق هو أنك لا تعرف كم ستستغرق كل وجبة من وقت للطهي، وكلما طهى الشيف أكثر، استهلكت الوجبة مساحة أكبر من سطح العمل، مما يزاحم الطلبات الأخرى.

هذا هو بالضبط الوضع الذي تعيشه النماذج اللغوية الكبيرة (LLMs) اليوم. هذه "المطابخ" هي التي تشغل محركات البحث، ومساعدي البرمجة، وروبوتات الدردشة.

تجادل الورقة البحثية بأن هذه المطابخ الرقمية تعمل حالياً بناءً على التخمين والقواعد البسيطة (Heuristics). ويرى المؤلف أنه حان الوقت للانتقال إلى الدقة الرياضية والأسس الخوارزمية الراسخة لجعلها أسرع، وأرخص، وأكثر موثوقية.

إليك تفصيل حجة الورقة باستخدام تشبيهات من الحياة اليومية:

1. المشكلة: القواعد "الجيدة بما يكفي" بدأت تفشل

تستخدم الأنظمة الحالية مثل vLLM وSGLang (البرمجيات التي تشغل هذه النماذج) قواعد قديمة مستعارة من الحوسبة العامة.

  • الطابور: إذا كان لديك خط من الزبائن، يقوم المطبخ بخدمتهم حسب ترتيب وصولهم (من يأتي أولاً يُخدم أولاً).
  • التوجيه: إذا كان لديك عدة طهاة، يرسل المطبخ الطلب التالي إلى الطاهي الذي لديه أقصر خط انتظار، أو ببساطة يدير عجلة لاختيار أحدهم.
  • التنظيف: إذا امتلأ سطح العمل، يقوم المطبخ برمي أقدم عنصر موجود على السطو لتوفير مساحة لعنصر جديد.

نقطة الورقة البحثية: هذه القواعد تعمل بشكل جيد في مطعم برجر عادي. لكن النماذج اللغوية الكبيرة (LLMs) غريبة الأطوار.

  • الوجبة "النامية": على عكس البرجر الذي يشغل نفس المساحة من البداية حتى النهاية، فإن "وجبة" النموذج اللغوي الكبير تنمو أثناء طهيها. فكل كلمة يولدها الذكاء الاصطناعي تستهلك المزيد من الذاكرة.
  • الطهي "بمرحلتين": الجزء الأول من الطلب (قراءة النص المدخل/البرومبت) سريع ويتطلب قدرة ذهنية كبيرة (حوسبة). أما الجزء الثاني (توليد الإجابة) فهو بطيء ويتطلب الكثير من عرض نطاق الذاكرة (Memory Bandwidth).
  • المجهول: المطبخ لا يعرف كم ستستغرق الوجبة حتى تنتهي تماماً.

بسبب هذه الخصائص الغريبة، غالباً ما تتسبب قواعد "أقصر خط" أو "أقدم عنصر خارج" في حدوث فوضى، مما يترك بعض الطهاة عاطلين عن العمل بينما يرزح آخرون تحت الضغط، أو يتسبب في نفاد مساحة السطح بشكل غير متوقع.

2. الحل: استدعاء علماء الرياضيات

يقول المؤلف إننا بحاجة للتوقف عن التخمين والبدء في استخدام التحسين الرياضي (Mathematical Optimization). فكر في الأمر كتوظيف مخطط لوجستي بارع يستخدم حاسوباً فائق القدرة لحساب الطريقة المثالية لإدارة المطبخ، بدلاً من مجرد اتباع كتاب قواعد.

تسلط الورقة الضوء على أربعة مجالات محددة يمكن للرياضيات فيها إصلاح المطبخ:

  • موازنة الطهاة (توزيع الأحمال - Load Balancing):

    • الطريقة الحالية: إرسال الطلبات إلى الطاهي الذي لديه أقل عدد من التذاكر.
    • الطريقة الرياضية: حساب بالضبط مقدار "مساحة السطح" و"القدرة الذهنية" التي سيحتاجها كل طلب أثناء نموه، وتوزيعها بحيث لا يظل أي طاهٍ عالقاً في انتظار الأبطأ. وتستشهد الورقة بنظام حقيقي (DeepSeek) يستخدم البرمجة الخطية (نوع من أنواع الرياضيات) للقيام بذلك بشكل مثالي، مما يوفر الوقت والمال.
  • خط الانتظار (الجدولة - Scheduling):

    • الطريقة الحالية: خدمة أول شخص في الطابور.
    • الطريقة الرياضية: النظر إلى الطابور وإدراك أن: "هذا الشخص طلب مقالاً من 10 صفحات، لكن الشخص التالي يريد فقط نكتة من جملة واحدة". اخدم صاحب النكتة أولاً! هذا يخلي السطح بشكل أسرع ويسمح لعدد أكبر من الناس بالأكل. يمكن للرياضيات التنبؤ بالطلبات التي ستنتهي بسرعة للحفاظ على حركة المطبخ.
  • مساحة السطح (التخزين المؤقت - Caching):

    • الطريقة الحالية: رمي أقدم عنصر عندما يمتلئ السطح.
    • الطريقة الرياضية: إدراك أن رمي "فيديو عالي الدقة" لتوفين مساحة لـ "صورة مصغرة صغيرة" هو صفقة سيئة. إعادة صنع الفيديو تستغرق وقتاً طويلاً وتكلف ثروة. يمكن للرياضيات حساب "تكلفة" رمي الأشياء والاحتفاظ بالعناصر المكلفة على السطح.
  • تخطيط الطاقم (تخطيط السعة - Capacity Planning):

    • الطريقة الحالية: إضافة طهاة جدد كلما طال الطابور.
    • الطريقة الرياضية: استخدام المعادلات لمعرفة بالضبط عدد الطهاة الذين تحتاجهم قبل حتى أن تفتح الأبواب، بناءً على عدد الزبائن المتوقعين. هذا يمنع المطبخ من التعرض للضغط الشديد من الأساس.

3. لماذا لا نكتفي بالقواعد فقط؟

تعالج الورقة المتشككين الذين يقولون: "القواعد الحالية تعمل بشكل جيد، لماذا التغيير؟"

  • "إنها تعمل على نطاق واسع": يعترف المؤلف بأن القواعد الحالية تعمل بشكل جيد نوعاً ما، لكنها هشة. إذا أرسل تطبيق واسع الانتشار فجأة نوعاً غريباً من الطلبات، فقد ينهار المطبخ. توفر الرياضيات شبكة أمان (ضمانات) تضمن عدم فشل المطبخ، حتى في أسوأ السيناريوهات.
  • "الأجهزة تتغير بسرعة كبيرة": يجادل المؤلف بأنه بينما تتغير الأجهزة (الأفران)، فإن المنطق الخاص بكيفية تنظيم المطبخ يظل كما هو. الرياضيات تمنحك مخططاً يعمل حتى لو قمت باستبدال الأفران.
  • "هندسة الأنظمة هي الأكثر أهمية": يقول المؤلف إن الرياضيات والهندسة شريكان. يمكنك امتلاك أسرع فرن في العالم، ولكن إذا كانت جدولة العمل لديك سيئة، فسيظل الفرن عاطلاً. الرياضيات تخبرك كيف تبقي الفرن مشغولاً.

4. الصورة الكبيرة

تخلص الورقة إلى أن مجال تقديم خدمات النماذج اللغوية الكبيرة (LLM serving) قد تجاوز مرحلة "الطفولة" القائمة على القواعد البسيطة. لقد نضج ليصبح نظاماً معقداً يتطلب إشرافاً من البالغين من علماء الرياضيات وخبراء الخوارزميات.

من خلال التعامل مع هذه المشكلات كـ ألغاز رياضية بدلاً من مجرد تعديلات هندسية، يمكننا الحصول على:

  1. القدرة على التنبؤ: معرفة سلوك النظام بدقة.
  2. الكفاءة: توفير كميات هائلة من الطاقة والمال.
  3. الموثوقية: ضمان عدم انهيار النظام عندما تصبح الأمور جنونية.

باخت-القول: توقفوا عن التخمين. ابدأوا بالحساب. مستقبل تقديم خدمات الذكاء الاصطناعي ليس فقط في بناء نماذج أكبر؛ بل في بناء طرق أذكى، ومثبتة رياضياً، لتشغيلها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →