Accelerating PayPal's Commerce Agent with Speculative Decoding: An Empirical Study on EAGLE3 with Fine-Tuned Nemotron Models
تُظهر هذه الدراسة التجريبية أن تنفيذ فك التشفير الاستباقي EAGLE3 مع نموذج Nemotron مضبوط بدقة على وكيل التجارة الخاص بـ PayPal يحقق تحسينات كبيرة في معدل الإنتاجية وزمن الاستجابة مع الحفاظ على جودة المخرجات، مما يؤدي في النهاية إلى خفض تكاليف وحدة معالجة الرسومات بنسبة 50% مقارنة بنشر NVIDIA NIM القياسي.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل "وكيل التجارة" (Commerce Agent) الخاص بـ PayPal كمتسوق شخصي ماهر للغاية وسريع جداً. مهمته هي الاستماع لما تكتبه (مثل "أريد فستاناً أحمر لحفل زفاف بسعر أقل من 50 دولاراً") وتحويل ذلك فوراً إلى قائمة دقيقة من المنتجات ليعرضها لك.
في الماضي، كان هذا المتسوق سريعاً بالفعل لأن الفريق علمه خصيصاً حول التسوق (الضبط الدقيق/Fine-tuning). لكنهم أرادوا جعله أسرع وأرخص في التشغيل، دون أن يصبح أقل ذكاءً.
هذه الورقة البحثية تتحدث عن خدعة ذكية استخدموها تسمى "التوليد التخميني" (Speculative Decoding)، وتحديداً باستخدام طريقة تسمى EAGLE3. وإليك كيف تعمل، مشروحة عبر تشبيهات بسيطة.
المشكلة: عنق الزجاجة المتمثل في "الخطوة الواحدة في كل مرة"
عادةً، عندما يكتب الذكاء الاصطناعي جملة، يكون الأمر مثل كاتب دقيق جداً يكتب كلمة واحدة في كل مرة:
- يفكر في الكلمة الأولى.
- يكتبها.
- يفكر في الكلمة الثانية.
- يكتبها.
- وهكذا...
هذا الأمر بطيء لأن الكمبيوتر يجب أن يتوقف ويفكر لكل كلمة على حدة. في عالم الذكاء الاصطناعي، يُطلق على هذا اسم "التوليد ذاتي الانحدار" (Autoregressive Generation). إنه يشبه الطاهي الذي يتذوق الحساء، يضيف رشة ملح، يتذوقه مرة أخرى، يضيف رشة أخرى، يتذوقه مرة أخرى... بدلاً من تخمين الكمية الصحيحة وإضافتها كلها دفعة واحدة.
الحل: "المُسوّد" و"المحرر"
قدم الفريق نظام "التوليد التخميني" (Speculative Decoding). فكر في الأمر كفريق مكون من شخصين:
- المُسَوِّد (EAGLE3): هذا ذكاء اصطناعي صغير، سريع جداً، و"خفيف الوزن". هو ليس بذكاء الذكاء الاصطناعي الرئيسي، لكنه سريع بشكل لا يصدق. مهمته هي تخمين الكلمات القليلة التالية في الجملة دفعة واحدة.
- المحرر (الذكاء الاصطناعي الرئيسي): هذا هو الذكاء الاصطناعي الكبير، الذكي، والمكلف. هو لا يكتب الكلمات بنفسه، بل ينظر إلى تخمينات "المُسوِّد" ويقول: "نعم، هذا صحيح!" أو "لا، هذا خطأ".
كيف يسرع ذلك العمل:
- الطريقة القديمة: المحرر يكتب كلمة واحدة، يتوقف، يفكر، يكتب كلمة واحدة، يتوقف. (10 كلمات = 10 توقفات).
- الطريقة الجديدة: المُسوِّد يخمن 3 كلمات فوراً. المحرر يفحص الكلمات الثلاث في "نظرة" واحدة. إذا وافق المحرر على الثلاث جميعها، يتم قبولها دفعة واحدة.
- النتيجة: يحصل الفريق على 3 كلمات بتكلفة فحص كلمة واحدة فقط. الأمر يشبه أن يخمن الطاهي الوصفة بأكملها ثم يكتفي فقط بفحص المذاق النهائي، بدلاً من التذوق بعد كل رشة ملح.
التجربة: اختبار الفريق
اختبر الباحثون هذا النظام على نظام التسوق الفعلي لـ PayPal. أقاموا سباقاً بين:
- الفريق (أ) (الأساس): الذكاء الاصطناعي القوي القياسي الذي يعمل على شريحتين ضخمتين من الحواسيب الفائقة (H100 GPUs).
- الفريق (ب) (الفريق التخميني): نفس الذكاء الاصطناعي القوي، ولكن مع وجود المساعد "المُسوِّد"، ويعمل على نفس الشريحتين.
اختبروا ذلك تحت ظروف مختلفة:
- الازدحام: ماذا يحدث عندما يسأل شخص واحد مقابل 32 شخصاً في وقت واحد؟
- الإبداع: ماذا لو كان على الذكاء الاصطناعي أن يكون صارماً جداً (درجة حرارة 0) أو مبدعاً قليلاً (درجة حرارة 0.5)؟
- طول التخمين: ماذا لو خمن المُسوِّد 3 كلمات في كل مرة (γ=3) مقابل 5 كلمات (γ=5)؟
النجاحات الكبيرة (النتائج)
1. "النقطة المثالية" هي 3 كلمات
عندما خمن المُسوِّد 3 كلمات في كل مرة، حقق نجاحاً باهراً.
- السرعة: أصبح النظام أسرع بنسبة 22% إلى 49%.
- الموثوقية: كان المُسوِّد محقاً في 35.5% من الحالات. وهذا رقم مستقر بشكل مدهش! سواء كان النظام مزدحماً أو هادئاً، حافظ المُسوِّد على نفس معدل النجاح تقريباً.
- لماذا ليس 5؟ عندما جربوا تخمين 5 كلمات، ارتبك المُسوِّد أكثر (كان محقاً بنسبة 25% فقط). لقد قضى وقتاً طويلاً في تخمين كلمات خاطئة اضطر المحرر لرفضها. كان الأمر أشبه بمُسوِّد يكتب فقرة كاملة معظمها هراء؛ مما جعل المحرر يضيع وقتاً طويلاً في شطبها جميعاً.
2. الجودة لم تنخفض
أحد المخاوف الكبرى مع الذكاء الاصطناعي هو أن "السرعة" تعني "الغباء". استخدموا ذكاءً اصطناعياً آخر ليعمل كحكم للمقارنة بين الإجابات القديمة البطيئة والإجابات الجديدة السريعة.
- الحكم: كانت الإجابات متطابقة في الجودة. الطريقة السريعة لم ترتكب أي أخطاء؛ بل وصلت إلى الإجابة فقط بشكل أسرع.
3. معجزة "الشريحة الواحدة"
هذا هو الجزء الأكثر إثارة لتوفير المال.
- "الفريق القياسي" احتاج إلى شريحتين من الحواسيب الفائقة للتعامل مع الضغط.
- "الفريق التخميني" استطاع التعامل مع نفس كمية العمل باستخدام شريحة واحدة فقط.
- التشبيه: الأمر يشبه شركة توصيل تحتاج عادةً إلى شاحنتين لتوصيل الطرود في الوقت المحدد. من خلال استخدام نظام توجيه أذكى (التوليد التخميني)، أدركوا أنه يمكنهم القيام بنفس المهمة تماماً باستخدام شاحنة واحدة فقط، مما وفر 50% من تكاليف الوقود والسائقين.
لماذا نجح هذا بشكل جيد جداً؟
قد تتساءل: "لماذا لم يحصل المُسوِّد على نسبة نجاح 80% مثل الدراسات الأخرى؟"
- القواعد الصارمة: يجب على ذكاء PayPal أن يخرج إجابات بتنسيق صارم جداً (مثل كود JSON مع أقواس وفواصل محددة). من الصعب تخمين الكلمة التالية عندما يتعين عليك اتباع قواعد قواعدية صارمة مقارنة بكتابة قصة عادية.
- التدريب المتخصص: تم تدريب الذكاء الاصطناعي الرئيسي خصيصاً للتسوق. أما المُسوِّد فلم يتم تدريبه على بيانات التسوق، لذا كان بمثبه "غريب" عن المجال.
- لكنه نجح رغم ذلك! حتى مع معدل نجاح منخفض (35%)، فإن حقيقة أن المُسوِّد رخيص وسريع جداً تعني أن حتى التخمينات الصحيحة القليلة وفرت قدراً هائلاً من الوقت.
الخلاصة
لقد وجد PayPal طريقة لجعل مساعد التسوق الخاص بهم أسرع بكثير وأرخص في التشغيل دون تغيير "عقل" الذكاء الاصطناعي.
من خلال إضافة "مُخمِّن فائق السرعة" (EAGLE3) يقترح الكلمات القليلة التالية ليقوم الذكاء الاصطناعي الرئيسي بفحصها، تمكنوا من تقليل أوقات الانتظار إلى النصف، ويمكنهم تقليل تكاليف الأجهزة إلى النصف أيضاً. إنه مثال مثالي للعمل بذكاء أكبر، وليس بجهد أكبر، لإنجاز المهام.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.