UniScale: Adaptive Unified Inference Scaling via Online Joint Optimization of Model Routing and Test-Time Scaling
تقدم هذه الورقة UniScale، وهو إطار عمل عبر الإنترنت يوحد توجيه النماذج وتوسيع نطاق وقت الاختبار في مساحة تحسين تكيفية واحدة باستخدام خوارزميات "متعددة الأذرع السياقية" (contextual multi-armed bandits) لتحقيق مقايضة متفوقة بين الجودة والتكلفة في عمليات نشر النماذج اللغوية الكبيرة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تدير مطبخ مطعم مزدحم. هدفك هو تقديم وجبات لذيذة (إجابات عالية الجودة) للزبائن بأسرع وقت ممكن وأقل تكلفة (تكلفة حوسبة منخفضة).
في عالم النماذج اللغوية الكبيرة (LLMs)، استخدم الطهاة تقليديًا استراتيجيتين منفصلتين لإدارة ذلك:
"تبديل القائمة" (توجيه النموذج - Model Routing): إذا طلب زبون سلطة بسيطة، ترسل الطلب إلى طباخ مبتدئ. وإذا طلب وليمة معقدة مكونة من 10 أطباق، ترسل الطلب إلى كبير الطهاة. المشكلة؟ ليس لديك سوى عدد قليل من الطهاة المحددين في طاقم العمل. لا يمكنك بسهولة العثور على "طباخ متوسط المستوى" لطبق متوسط الصعوبة. فإما أن تحصل على سلطة بسيطة أو وليمة ضخمة، دون وجود منطقة وسطى سلسة.
"الجهد الإضافي" (التوسع وقت الاختبار - Test-Time Scaling): تحتفظ بنفس الطباخ ولكن تطلب منه أن يفكر بعمق أكبر. ربما يتذوق الحساء خمس مرات بدلاً من مرة واحدة، أو يكتب ثلاث وصفات مختلفة قبل تقديم واحدة منها. المشكلة؟ حتى أفضل طباخ له حد معين. إذا كان الطبق شديد التعقيد، فلن ينقذه أي قدر من التفكير الإضافي، وقد يصاب بالإرهاق (يهدر الكثير من الوقت والطاقة).
المشكلة:
لفترة طويلة، تم تشغيل هاتين الاستراتيجيتين بشكل منفصل. تجادل الورقة البحثية بأن هذا يشبه وجود مدير يقرر أي طباخ يستخدم، ومدير آخر يقرر مدى صعوبة عمل ذلك الطباخ، دون أن يتحدثا مع بعضهما البعض أبدًا. يؤدي هذا إلى عدم الكفاءة: فقد ترسل طلبًا بسيطًا إلى كبير الطهاة الذي يبالغ في التفكير فيه، أو طلبًا صعبًا إلى طباخ مبتدئ يستسلم سريعًا.
الحل: UNISCALE
يقدم المؤلفون نظامًا جديدًا يسمى UNISCALE (الاستدلال الموحد المتوسع - Unified Inference Scaling). تخيل هذا كـ "رئيس طهاة فائق الذكاء" يدير المطبخ بأكه في الوقت الفعلي.
بدلاً من اختيار طباخ أو مستوى جهد، يقوم رئيس الطهاة هذا بالنظر في كل طلب وإنشاء خطة مخصصة تجمع بين كلا القرارين فورًا.
- "هذا الطلب صعب، لذا دعونا نستخدم طباخًا من فئة 4 نجوم، ولكن نجعله يراجع عمله مرتين."
- "هذا الطلب سهل، لذا دعونا نستخدم طباخًا من فئة نجمة واحدة، ولكن نجعله يدقق في العمل لمجرد التأكد."
- "هذا الطلب كابوس، لذا نحتاج من طباخ الـ 5 نجوم أن يكتب خمس نسخ مختلفة ويختار الأفضل بينها."
كيف يتعلم (النادل الذكي):
المطبخ فوضوي. الطلبات تتغير، طهاة جدد ينضمون، وأحيانًا يغادر القدامى. لا يمكن لرئيس الطهاة حفظ كل القواعد. بدلاً من ذلك، يعمل UNISCALE مثل نادل ذكي يتعلم من خلال الممارسة.
- يستخدم طريقة تسمى LinUCB (نوع من الحيل الرياضية المستخدمة في المقامرة واتخاذ القرار).
- في كل مرة يقدم فيها طبقًا، يحصل على ملاحظات: "هل كان لذيذًا؟" و"كم كلفنا؟"
- يستخدم هذه الملاحظات لبناء خريطة ذهنية. يتعلم أن "بالنسبة لمسائل الرياضيات، فإن نموذج 8B مع 4 عمليات تحقق هو الخيار المثالي"، ولكن "بالنسبة للبرمجة، فإن نموذج 14B مع تحققين هو الأفضل".
- والأهم من ذلك، أنه يوازن بين الاستكشاف (تجربة تركيبات جديدة لمعرفة ما إذا كانت ستنجح) والاستغلال (استخدام ما يعرف بالفعل أنه يعمل جيدًا).
الأسلحة السرية:
لجعل هذا النظام سريعًا وفعالًا، هناك حيلتان خاصتان:
"الخروج المبكر" (الخروج المبكر المدرك للمسار - Path-Aware Early Exiting): تخيل أن الطهاة يكتبون وصفات متعددة. يقوم النظام بوضع "متذوق" (مُحقِّق) يتحقق من العمل أثناء تنفيذه. إذا رأى "المتذوق" أن وصفة واحدة ستكون سيئة بوضوح، فإنه يخبر الطباخ فورًا بأن يتوقف عن العمل عليها. هذا يوفر قدرًا هائًا من الوقت والطاقة لأنه لا ينتظر انتهاء الوصفة السيئة.
"بطاقة التقييم الشاملة" (نموذج التكلفة - Cost Model): لا يكتفي النظام بعدّ "الخطوات" فقط، بل يحسب "الجهد" بطريقة موحدة. إنه يفهم أن تحريك وعاء ثقيل (الذاكرة) هو أمر متعب تمامًا مثل تقطيع الخضروات (الحوسبة). وهذا يسمح له بمقارنة طباخ صغير يبذل الكثير من العمل مقابل طباخ كبير يبذل القليل من العمل على قدم المساواة.
النتائج:
اختبرت الورقة البحثية هذا النظام على مسائل الرياضيات (مثل امتحانات AIME).
- توازن أفضل: وجد UNISCALE "النقطة المثالية" لكل سؤال. لم يكتفِ باختيار أكبر نموذج أو أكبر جهد؛ بل وجد المزيج المثالي.
- منحنى أكثر سلاسة: بدلاً من القفز من "رخيص ولكنه سيء" إلى "غالي ولكنه جيد"، خلق UNISCALE منحنى سلسًا حيث تحصل على إجابات أفضل قليلاً مقابل تكلفة أعلى قليلاً، وصولاً إلى أفضل الإجابات الممكنة.
- القدرة على التكيف: عندما تغيرت "ظروف المطبخ" (على سبيل المثال، غادر أحد الطهاه أو تغير نوع الطلبات)، استطاع UNISCALE اكتشاف الاستراتيجية الجديدة الأفضل بسرعة، بينما ظلت الأنظمة القديمة عالقة أو ترتكب الأخطاء.
باختًا:
UNISCALE يشبه قائد الأوركسترا الماهر. فبدلاً من مجرد اختيار آلة أعلى صوتًا (نموذج أكبر) أو مطالبة الموسيقيين بالعزف بشكل أسرع (جهد أكبر)، فإنه يقرر ديناميكيًا أي موسيقي سيعزف أي جزء وكيف سيعزفونه، كل ذلك بينما يستمع إلى الموسيقى في الوقت الفعلي ليوقف أي موسيقي يعزف نوتة خاطئة. يؤدي هذا إلى أداء رائع (جودة عالية) بأقل قدر ممكن من الطاقة (تكلفة منخفضة).
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.