SweetSpot: An Analytical Model for Predicting Energy Efficiency of LLM Inference
تقدم الورقة البحثية SweetSpot، وهو نموذج تحليلي يتنبأ بدقة بكفاءة الطاقة غير الخطية لاستنتاج النماذج اللغوية الكبيرة (LLM) من خلال تحديد مجموعات أطوال المدخلات والمخرجات المثلى، مما يتيح تحقيق تخفيضات كبيرة في استهلاك الطاقة عبر استراتيجيات توليد تكيفية.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك تدير مخبزًا ضخمًا وعالي التقنية يسمى "مخبز LLM".
في هذا المخبز، لديك أفران عملاقة (نماذج الذكاء الاصطنا-ي) تأخذ قائمة من المكونات (المدخلات - Input) لتخبزها وتحولها إلى خبز طازج (المخرجات - Output).
لفترة طويلة، اعتقد الجميع أن خبز الخبز أمر بسيط: "إذا استخدمت 100 مكون، فالتكلفة هي 10 دولارات. إذا استخدمت 200 مكون، فالتكلفة هي 20 دولارًا". افترضوا أن تكلفة الطاقة تسير في خط مستقيم، مثل المنحدر.
لكن مؤلفي هذه الورقة البحثية، وهم فريق من الباحثين من جامعة بولونيا، اكتشفوا شيئًا مذهلاً. لقد وجدوا أن تكلفة الطاقة ليست خطًا مستقيمًا على الإطلاق. إنها أشبه بـ أفعوانية (Rollercoaster).
إليك قصة اكتشافهم، والتي تسمى "SweetSpot" (النقطة المثالية).
1. مرحلتا الخبز
لفهم الأفعوانية، عليك أن تفهم كيف يعمل المخبز. هناك مرحلتان متميزتان:
المرحلة (أ): التحضير (Prefill)
قبل خبز رغيف واحد، يجب على الطاهي قراءة كامل قائمة المكونات التي قدمتها له. إذا أعطيتهم قائمة قصيرة (مثل: "اصنع لي شطيرة")، فسيكون الأمر سريعًا. ولكن إذا أعطيتهم رواية من 50 صفحة ("اصنع لي شطيرة بناءً على هذا الكتاب بأكمله")، فعلى الطاهي قراءة كل كلمة قبل البدة. مرحلة "القراءة" هذه مكلفة وتصبح أكثر تكلفة بكثير كلما طالت القائمة (الأمر ليس مجرد مضاعفة التكلفة؛ بل هو أربعة أضعاف!).المرحلة (ب): الخبز (Decode)
بمجرد الانتهاء من التحضير، يبدأ الطاهي في خبز رغيف واحد في كل مرة. كل رغيف يستغرق قدرًا ثابتًا ومتوقعًا من الطاقة. سواء خبزت رغيفًا واحدًا أو 100 رغيف، تظل تكلفة الرغيف الواحد تقريبًا كما هي.
2. اكتشاف "النقطة المثالية" (Sweet Spot)
أدرك الباحثون أن كفاءة الطاقة (كمية الخبز التي تحصل عليها مقابل فاتورة الكهرباء الخاصة بك) تعتمد كليًا على التوازن بين المرحلة (أ) والمرحلة (ب).
فخ "المدخلات الطويلة، المخرجات القصيرة":
تخيل أنك أعطيت الطاهي رواية من 50 صفحة (مدخلات ضخمة) ولكنك طلبت منه فتات خبز واحد فقط (مخرجات ضئيلة).
النتيجة: يقضي الطاهي كل طاقته في قراءة الكتاب، ثم يتوقف. لقد دفعت ثروة مقابل فتات صغير. هذه هي أسوأ كفاءة.فخ "المدخلات القصيرة، المخرجات القصيرة":
تخيل أنك أعطيت الطاهي قائمة قصيرة (مدخلات صغيرة) وطلبت منه فتات خبز واحد (مخرجات ضئيلة).
النتيجة: يقضي الطاهي الكثير من الوقت في تجهيز الفرن (تكلفة "التحضير") لمجرد خبز فتات صغير واحد. تكلفة التجهيز لم يتم "توزيعها" (amortized) بشكل كافٍ. هذا أيضًا غير فعال."النقطة المثالية" (Sweet Spot):
الآن، تخيل أنك أعطيت الطاهي قائمة متوسطة (مدخلات متوسطة) وطلبت منه رغيفًا كاملاً أو اثنين (مخرجات متوسطة).
النتيجة: يقرأ الطاهي القائمة (تكلفة معقولة)، ثم يخبز ما يكفي من الخبز لجعل تكلفة القراءة تلك "تستحق العناء". يتم توزيع تكلفة التجهيز على العديد من الأرغفة. هذه هي ذروة الكفاءة.
وجد الباحثون أن الطريقة الأكثر كفاءة في استهلاك الطاقة لتشغيل نماذج الذكاء الاصطناعي هذه هي ليست باستخدام أطول المطالبات (prompts) أو أقصر الإجابات. بل هي باستخدام مطالبات قصيرة إلى متوسطة وإجابات متوسطة الطول.
3. نموذج "SweetSpot"
بنى الفريق صيغة رياضية (خريطة) تسمى SweetSpot.
فكر في الأمر كجهاز تحديد مواقع (GPS) للطاقة. إذا أخبرت الـ GPS: "لدي 500 كلمة من المدخلات"، يمكن للنموذج حساب عدد الكلمات التي يجب أن تطلبها كمخرجات بالضبط للحصول على أفضل "قيمة مقابل ما تدفعه" (أو "خبز مقابل كل واط").
لقد اختبروا ذلك على العديد من "الأفران" (نماذج الذكاء الاصطناعي مثل Llama وGemma وFalcon) باستخدام حواسيب فائقة السرعة (NVIDIA H100 GPUs). كانت خريطتهم دقيقة للغاية، حيث توقعت استخدام الطاقة بدقة تصل إلى 98%.
4. لماذا يهم هذا الأمر؟
قد تتساءل، "لماذا يهمني تكلفة الطاقة لدردشة واحدة مع الذكاء الاصطناعي؟"
- النطاق: تخيل شركة تدير ملايين من هذه الدردشات يوميًا. إذا كانوا يستخدمون حاليًا طريقة "المدخلات الطويلة، المخرجات القصيرة" (قراءة رواية للحصول على إجابة من كلمة واحدة)، فهم يهدرون كمية هائلة من الكهرباء.
- التوفير: أظهر الباحثون أنه من خلال مجرد ضبط طول المطالبات والإجابات للوصول إلى "النقطة المثالية"، يمكن للشركات تقليل استهلاك الطاقة بنسبة تصل إلى 33 ضعفًا.
- التأثير في العالم الحقيقي: هذا يعني أنه يمكننا جعل تشغيل الذكاء الاصطناعي أرخص وأفضل للبيئة دون تغيير الذكاء الاصطناعي نفسه. نحن فقط بحاجة لتغيير كيفية طرح الأسئلة.
ملخص التشبيه
فكر في الذكاء الاصطناعي مثل رحلة تاكسي:
- المدخلات هي الوقت الذي يقضيه السائق في القيادة للوصول إلى منزلك لPick up (أخذك).
- المخرجات هي المسافة التي تقطعها في السيارة.
إذا قاد السائق مسافة 50 ميلاً للوصول إليك (مدخلات ضخمة) ولكنك طلبت منه أن يقودك لمسافة مربع سكني واحد فقط (مخرجات ضئيلة)، فأنت تدفع ثمنًا باهظًا لرحلة قصيرة جدًا. هذه صفقة سيئة.
إذا قاد السائق لمسافة مربع سكني واحد للوصول إليك، ثم ركبت لمسافة مربع واحد فقط، فأنت لا تزال تدفع مقابل جهد "الوصول إليك"، وهو ما يبدو هدراً.
النقطة المثالية هي عندما يمر السائق بجانبك (مدخلات قصيرة/متوسطة) وتقوم أنت برحلة طويلة وجميلة (مخرجات متوسطة). أنت تحصل على أكبر قيمة مقابل مالك.
الخلاية:
تعلمنا هذه الورقة البحثية أنه لكي نوفر الطاقة والمال عند استخدام الذكاء الاصطناوي، لا ينبغي لنا فقط أن نغذيه بكل ما لدينا. يجب أن نكون استراتيجيين. أحيانًا، تلخيص مطالبتك أو طلب إجابة أطول قليلاً يمكن أن يجعل الذكاء الاصطناعي يعمل بكفاءة أكبر بكثير. لقد حولت كفاءة الطاقة من لغز إلى علم يمكن التنبؤ به.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.