← أحدث الأبحاث
💬 NLP

Batch Speculative Decoding Done Right

تحدد هذه الورقة أن تطبيقات فك التشفير الاستباقي بالدفعات الحالية تفشل في الحفاظ على تكافؤ المخرجات بسبب مشكلة الموتر المتعرج (ragged tensor)، وتقترح أول إطار عمل صحيح، EQSPEC، إلى جانب نسخته المحسنة EXSPEC، التي تحقق تحسناً في الإنتاجية يصل إلى 3 أضعاف مع ضمان الصحة الخوارزمية عبر مختلف أزواج النماذج.

المؤلفون الأصليون: Ranran Haoran Zhang, Soumik Dey, Ashirbad Mishra, Hansi Wu, Binbin Li, Rui Zhang

نُشر 2026-02-17
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ranran Haoran Zhang, Soumik Dey, Ashirbad Mishra, Hansi Wu, Binbin Li, Rui Zhang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير محطة قطارات فائقة السرعة. هدفك هو إدخال أكبر عدد ممكن من الركاب (الرموز - tokens) إلى القطارات (مخرجات نموذج الذكاء الاصطنا- AI model) بأسرع وقت ممكن.

المشكلة: ازدحام مروري ناتج عن "التخمين والتحقق"

عادةً، يكتب نموذج الذكاء الاصطناعي كلمة واحدة في كل مرة، ويتحقق من عمله قبل الانتقال للكلمة التالية. هذا أسلوب آمن ولكنه بطيء.
فك التشفير التخميني (Speculative Decoding) يشبه توظيف مساعد مبتدئ سريع (نموذج مسودة - draft model) ليخمن الكلمات الخمس التالية بدلاً منك. ثم يقوم النموذج الرئيسي (النموذج المستهدف - target model) بالتحقق بسرعة مما إذا كانت تخميناته صحيحة. إذا كانت كذلك، فإنك توفر الوقت. وإذا لم تكن، فإنه يصحح الخطأ ويحاول مجدداً.

هذا يعمل بشكل رائع لراكب واحد. ولكن ماذا يحدث عندما يكون لديك مجموعة من الركاب (دفعة - batch) يحاولون الصعود جميعاً في وقت واحد؟

الكارثة: كابوس "الموتر المتعرج" (Ragged Tensor)

في العالم الحقيقي، يقبل الركاب أعداداً مختلفة من التخمينات.

  • الراكب (أ): يقبل جميع التخمينات الخمسة.
  • الراكب (ب): يقبل أول كلمتين فقط، ثم يقول: "هذا خطأ!".
  • الراكب (ج): يقبل 4 كلمات.

الآن، أصبح لديك طابور فوضوي. البعض عند الموضع 5، والبعض عند 2، والبعض عند 4. في علوم الحاسوب، يُسمى هذا مشكلة "الموتر المتعرج" (Ragged Tensor). إن عقل الكمبيوتر (وحدة معالجة الرسومات - GPU) يحب الشبكات المستطيلة المنظمة، ويكره الخطوط المتعرجة الفوضوية.

الطريقة القديمة: الحلول "المكسورة"

حاولت المحاولات السابقة لإصلاح ذلك دفع الخط المتعرج داخل صندوق مربع عبر كسر القواعد:

  1. طريقة "القناع" (Masking): حاولوا إخفاء الاختلافات، لكن ذلك أربك جدول مواعيد القطار. بدأ الذكاء الاصطناعي في الهلوسة، مكرراً الكلمات مثل "ليس ليس ليس ليس" أو طباعة نصوص غير مفهومة.
  2. طريقة "التراجع" (Rollback): أجبروا الجميع على التوقف عند أقصر خط. إذا قبل الراكب (ب) كلمتين فقط، كان على الجميع التخلي عن كلماته الثلاث الإضافية والانتظار. هذا أضاع كل مكاسب السرعة.

النتيجة؟ أن أنظمة الدفعات الموجودة كانت سريعة ولكنها تنتج مخرجات فاسدة. كانت تشبه سيارة سباق تنطلق بسرعة 200 ميل في الساعة ولكنها تصطدم بالحائط كل 10 ثوانٍ.

الحل: المحطة "المنظمة تماماً"

يقدم هذا البحث طريقتين جديدتين، EQSPEC و EXSPEC، لإصلاح المحطة دون كسر القواعد.

1. EQSPEC: "مراقب حركة المرور الصارم"

تخيل EQSPEC كمراقب حركة مرور صارم ومنظم للغاية.

  • كيف يعمل: بعد كل جولة تخمين، يوقف القطار. يأخذ تذاكر الجميع، ويعيد ترتيبهم بحيث يكون الجميع متوافقين تماماً في خط مستقيم، ويحدث الجدول الزمني (معرفات الموضع - Position IDs)، وينقل الأمتعة (ذاكرة KV-Cache) إلى مكانها الصحيح.
  • التكلفة: عملية إعادة الترتيب هذه تستغرق وقتاً. إنها تشبه إيقاف القطار لإعادة تنظيم مخطط المقاعد. تضيف هذه العملية عبئاً بنسبة 40% تقريباً (عمل إضافي)، ولكنها تضمن أن المخرجات صحيحة بنسبة 100%. لا هراء، ولا أعطال.
  • الاستعارة: إنها تشبه أمين مكتبة يوقف المكتبة بأكملها لإعادة ترتيب الكتب بشكل مثالي بعد قراءة كل بضع صفحات. إنها بطيئة، لكن الكتب تكون دائماً في مكانها الصحيح.

2. EXSPEC: نظام "التجميع الذكي"

إن EQSPEC صحيح ولكنه بطيء قليلاً بسبب التوقف لإعادة التنظيم في كل مرة. أما EXSPEC فهو النسخة المطورة.

  • كيف يعمل: بدلاً من إجبار الجميع على دخول خط واحد كبير وفوضوي، يحتفظ EXSPEC بـ "مجموعة" من الركاب. ينظر حوله ويقول: "مهلاً، الراكب (أ) والراكب (ج) قبلا 4 كلمات كلاهما! لنضع فقط هؤلاء في قطار واحد معاً".
  • السحر: إذا قبل الجميع في قطار معين نفس عدد الكلمات، فلن تكون هناك حاجة لإعادة التنظيم. ينطلق القطار فوراً.
  • الاستعارة: تخيل نظام حافلات حيث لا يجبر السائق الجميع على ركوب حافلة واحدة. بدلاً من ذلك، يقوم بتجميع الناس حسب وجهتهم. إذا أراد مجموعة من 5 أشخاص الذهوة بالضبط لثلاث محطات، فإنهم يستقلون حافلة تغادر فوراً دون أي انتظار أو إعادة ترتيب.

النتائج: سريع وَ دقيق

اختبر المؤلفون هذه الطرق على نماذج ذكاء اصطناعي حقيقية (مثل Vicuna و Qwen).

  • الطرق القديمة: سريعة، ولكنها تنتج كلاماً غير مفهوم (مثل روبوت يتحدث في دوائر مفرغة).
  • الطرق الجديدة (EQSPEC/EXSPEC):
    • الدقة: في أكثر من 95% من الحالات، تكون المخرجات مطابقة للطريقة البطيئة والمثالية. الفرق الضئيل بنسبة 5% يعود فقط إلى كون رياضيات الكمبيوتر "ضبابية" قليلاً (أخطاء الفاصلة العائمة)، وليس خطأً منطقياً.
    • السرعة: عند حجم دفعة قدره 8، فهي أسرع بـ 3 مرات من التشغيل واحداً تلو الآخر، مع إنتاج نص مثالي في الوقت نفسه.

باخت_صار

كانت عمليات التشفير التخميني المجمعة السابقة تشبه "موش بيت" (حشد فوضوي): سريعة، ولكن الناس يتأذون فيها (مخرجات تالفة).
لقğت هذه الورقة البحثية قد بنيت ساحة رقص منظمة جيداً.

  • EQSPEC هو مصمم الرقصات الذي يوقف الموسيقى لتصحيح خطوات الجميع (يضمن الدقة).
  • EXSPEC هو "دي جي" ذكي يشغل فقط الأغاني التي يعرف الجميع حركات رقصها، حتى لا يضطر أحد للتوقف أبداً (يحقق أقصى سرعة).

لقد أثبتوا أنه يمكنك الحصول على كل من السرعة و الدقة في الذكاء الاصطناعي، طالما أنك تحترم قواعد كيفية عمل ذاكرة الكمبيوتر.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →