← أحدث الأبحاث
🤖 machine learning

ParetoBandit: Budget-Paced Adaptive Routing for Non-Stationary LLM Serving

يُعد ParetoBandit نظام توجيه تكيفي مفتوح المصدر لخدمة النماذج اللغوية الكبيرة غير المستقرة، والذي يستخدم خوارزميات "بانديت" سياقية واعية بالتكلفة مع تنظيم وتيرة ثنائي أولي عبر الإنترنت ونسيان هندسي لفرض ميزانيات مقومة بالدولار ديناميكيًا، مع التكيف السريع مع تغيرات أسعار وجودة النماذج أو دمج نماذج جديدة أثناء وقت التشغيل بأقل زمن انتقال ممكن.

المؤلفون الأصليون: Annette Taberner-Miller

نُشر 2026-04-02
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Annette Taberner-Miller

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مطبخ مطعم مزدحم. لديك ثلاثة طهاة:

  1. الشيف الرخيص: سريع ورخيص، لكنه يرتكب أحياناً أخطاء بسيطة.
  2. الشيف المتوسط: أغلى قليلاً، ولكنه موثوق جداً.
  3. الشيف الفاخر: هو الأغلى، عبقري، لكن تكلفته باهظة.

في عالم الذكاء الاصطناعي، هؤلاء هم "نماذج اللغات الكبيرة" (LLMs). الشركات تريد استخدامهم للإجابة على الأسئلة، لكن لديها ميزانية يومية صارمة. لا يمكنهم توظيف "الشيف الفاخر" لكل طلب، وإلا سيُفلسون. لكن لا يمكنهم أيضاً استخدام "الشيف الرخيص" لكل شيء، وإلا ستكون النتيجة (الإجابات) سيئة.

المشكلة هي أن المطبخ فوضوي. أحياناً يحصل "الشيف الفاخر" على تخفيض في السعر. وأحياناً يبدأ "الشيف الرخيص" فجأة في حرق التوست (تنخفض الجودة) دون إخبار أحد. وأحياناً ينضم شيف جديد إلى الفريق.

ParetoBandit هو "النادل الذكي" الجديد المصمم لحل هذه الفوضى.

المشكلة: خطأ "الضبط والنسيان"

الأنظمة القديمة كانت مثل النادل الذي يحفظ قائمة الطعام مرة واحدة في الشهر ثم لا ينظر إليها أبداً بعد ذلك.

  • إذا خفض "الشيف الفاخر" أسعاره، يستمر النادل القديم في فرض نفس السعر المرتفع.
  • إذا بدأ "الشيف الرخيص" في تقديم توست محروق، يستمر الندو القديم في إرسال الطلبات إليه لأنه يعتقد أنه لا يزال جيداً.
  • إذا انضم شيف جديد، لا يعرف النادل القديم كيف يتعامل معه.

الحل: ParetoBandit (النادل المتكيف)

ParetoBandit هو نادل يتعلم في الوقت الفعلي ولا يتجاوز الميزانية أبداً. إنه يستخدم ثلاث حيل ذكية:

1. "المحفظة الذكية" (موازن الميزانية)

تخيل أن محفظتك تحتوي على إنذار سحري.

  • الطريقة القديمة: تحاول تخمين المبلغ الذي يمكنك إنفاقه طوال اليوم. إذا أنفقت الكثير في الصباح، فقد تصبح مفلساً بحلول الظهر.
  • ParetoBandit: يتحقق من محفظتك بعد كل طلب.
    • إذا أنفقت للتو مبلغاً كبيراً على "الشيف الفاخر"، فإنه يشد الحزام فوراً ويقول: "حسناً، بالنسبة للطلبات القليلة القادمة، لا يمكننا سوى تحمل تكلفة الشيف الرخيص".
    • إذا انخفض سعر "الشيف الفاخر" فجأة، يلاحظ النادل فوراً: "مهلاً، لدينا سيولة إضافية الآن! لنكافئ أنفسنا بالشيف الفاخر لهذا الطلب".
    • السحر: يضمن لك أنه لن تتجاوز أبداً ميزانيتك اليومية، بغض النظر عن تغير الأسعار.

2. "الذاكرة القصيرة" (النسيان الهندسي)

تخيل أنك تحاول تعلم رقصة جديدة.

  • الطريقة القديمة: تتذكر كل خطوة قمت بها، حتى تلك التي فعلتها قبل 10 سنوات. إذا تغيرت الموسيقى، تستمر في محاولة الرقص على الأغنية القديمة لأن ذاكرتك ممتلئة جداً.
  • ParetoBandit: لديه "ذاكرة قصيرة". يتذكر الطلبات القليلة المئات الأخيرة بوضوح شديد، ولكنه ينسى ببطء ما حدث قبل 1,000 طلب.
    • لماذا؟ إذا بدأ "الشيف الرخيص" فجأة في حرق التوست (انخفضت الجودة)، فلن ينتظر النادل شهراً ليدرك ذلك. ولأنه "ينسى" البيانات القديمة الجيدة، فإنه يدرك بسرعة: "مهلاً، الشيف الرخيص سيء الآن"، ويتوقف عن إرسال الطلبات إليه. إنه يتكيف فوراً مع التغييرات.

3. "فترة التجربة" (الاستبدال السريع)

تخيل أن شيفاً جديداً قد دخل المطبخ.

  • الطريقة القديمة: إما تتجاهله أو توظفه فوراً دون اختبار.
  • ParetoBandit: يعطي الشيف الجديد تجربة قصيرة وصارمة. "لديك 20 طلباً. إذا كنت جيداً، فستبقى. إذا كنت سيئاً أو مكلفاً جداً، فستخرج".
    • إنه يختبرهم بعناية دون استنزاف الميزانية. إذا كان الشيف الجديد سيئاً حقاً، فإن النظام يطرده تلقائياً. أما إذا كان رائعاً، فيبدأ في استخدامه بشكل أكبر.

ما مدى سرعته؟

هذا النظام سريع للغاية.

  • اتخاذ قرار (أي شيف يختار) يستغرق 22 ميكروثانية. هذا أسرع من رمشة العين.
  • العملية بأكملها (بما في ذلك قراءة الطلب) تستغرق أقل من 10 مللي ثانية.
  • لتضع ذلك في الاعتبار: نموذج الذكاء الاصطناعي نفسه يستغرق حوالي 1,000 مللي ثانية (ثانية واحدة) لطهي الوجبة. قرار النادل يستغرق أقل من 1% من الوقت الإجمالي. لن تلاحظ وجود النادل حتى.

النتائج

اختبرت الورقة البحثية هذا النادل في أربعة سيناريوهات مخيفة:

  1. البقاء ضمن الميزانية: لم يتجاوز الحد المسموح به للإنفاق أبداً، حتى عندما تغيرت الأسعار بشكل جنوني.
  2. انخفاض الأسعار: عندما أصبح الشيف الغالي أرخص، بدأ النادل فوراً في استخدامه أكثر، مما أدى للحصول على طعام أفضل بنفس المال.
  3. الفشل الصامت: عندما ساءت جودة أحد الطهاة بصمت، لاحظ النادل الطعام السيئ، وتوقف عن الطلب منه، وانتقل إلى الآخرين - كل ذلك مع البقاء ضمن الميزانية.
  4. الموظفون الجدد: نجح في اختبار وتوظيف شيف جديد دون تعطل النظام أو كسر الميزانية.

الخلاصة

ParetoBandit يشبه سيارة ذاتية القيادة لميزانية الذكاء الاصطناعي الخاصة بك. فهو لا يتبع الخريطة فحسب؛ بل يراقب الطريق، ويتكيف مع زحام المرور (تغير الأسعار)، ويتجنب الحفر (سوء الجودة)، ويضمن عدم نفاد الوقود (المال) أبداً، كل ذلك أثناء القيادة بسرعة تفوق سرعة رمشة عينك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →