← أحدث الأبحاث
🤖 AI

xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding

تقترح الورقة البحثية xPress، وهو مُنقٍّ سببي خفيف الوزن يستعيد التبعيات المفقودة في مسودات الانتشار الكتلي (block-diffusion) من خلال التنقيح المتوازي، مما يعزز طول القبول والإنتاجية الشاملة في فك التشفير التخميني بشكل كبير مقارنة بالطرق الحالية مثل dFlash.

المؤلفون الأصليون: Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang

نُشر 2026-08-04
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

السباق نحو التحدث بشكل أسرع: لماذا يحتاج الذكاء الاصطناعي إلى نظام مسودة أفضل؟

تخيل أنك تحاول كتابة قصة، ولكن لديك قاعدة صارمة: يمكنك كتابة كلمة واحدة فقط في كل مرة، ويجب عليك انتظار محرر فائق الذكاء ليفحص كلمتك قبل أن تتمكن من كتابة الكلمة التالية. هكذا تعمل معظم نماذج اللغة القوية للذكاء الاصطناعي اليوم. إنها دقيقة للغاية، لكنها بطيئة بشكل مؤلم لأنها تضطر إلى فحص كل كلمة على حدة. ولتسريع ذلك، اخترع العلماء حيلة تسمى "الترميز التخميني" (speculative decoding). فكر في الأمر كأنه مساعد سريع، وأقل حذرًا بقليل، يخمن الكلمات القليلة التالية من أجلك. إذا وافق المحرر فائق الذكاء على تخمينات المساعد، يمكنك كتابة كل تلك الكلمات دفعة واحدة، متجاوزًا وقت الانتظار.

المشكلة هي أن المساعد عادة ما يكون مندفعًا للغاية. فهو يخمن كلمات تبدو جيدة بمفردها ولكنها لا تتناسب جيدًا مع بعضها البعض في جملة، مثل طاهٍ يختار مكونات لذيذة ولكنه ينسى التحقق مما إذا كانت نكهاتها تتناسب معًا. مؤخرًا، تم ابتكار نوع جديد من المساعدين يسمى "المسود الـتوليدي" (diffusion drafter). وبدلاً من تخمين كلمة تلو الأخرى، يحاول تخمين كتلة كاملة من الكلمات دفعة واحدة، مثل إلقاء حفنة من قطع الأحجية (البازل) على الطاولة. هذا سريع للغاية، ولكن نظرًا لأنه يلقي بها جميعًا في وقت واحد، فإن القطع غالبًا لا تتصل ببعضها بشكل صحيح. ويضطر المحرر فائق الذكاء إلى رفض معظمها، مما يؤدي إلى إبطاء كل شيء مرة أخرى. السؤال الكبير الذي يسأله الباحثون هو: هل يمكننا الحفاظ على سرعة "المخمن الذي يرمي الكل دفعة واحدة" مع إصلاح الأخطاء حتى يقبل المحرر الكلمات بالفعل؟

دخول xPress: "المُحسِّن المتوازي" الذي يصلح الأحجية

يقدم هذا البحث حلاً ذكيًا يسمى xPress. أدرك المؤلفون، أثناء عملهم مع نماذج مثل Qwen3-8B، أنه بينما يبرع "المسود التوليدي" السريع في تخمين كتلة من الكلمات، فإنه يفتقر إلى القاعدة الحاسمة المتمثلة في أن الكلمات تعتمد على بعضها البعض (السببية/causality). على سبيل المثال، إذا كانت الكلمة الأولى هي "هي" (she)، فلا ينبغي أن تكون الكلمة التالية "يكونون" (are) حتى لو كانت "يكونون" كلمة شائعة في حد ذاتها. المسود التوليدي لا يعرف هذا لأنه يخمن كل شيء في آن واحد.

ولإصلاح ذلك، يعمل xPress كـ مُحسِّن سببي خفيف الوزن. تخيل أن المسود التوليدي ألقى حفنة من قطع الأحجية على الطاولة؛ x-Press هو يد ذكية وسريعة تنظر إلى كومة القطع بأكملها دفعة واحدة وتدفع القطع إلى ترتيبها الصحيح دون تفكيكها قطعة قطعة. وهو يفعل ذلك باستخدام تقنية تسمى فك تشفير جاكوبي (Jacobi decoding). فبدلاً من إصلاح قطعة الأحجية قطعة قطعة (وهو أمر بطيء)، ينظر xPress إلى الصورة بأكملها، ويجري تعديلاً سريعًا لكل قطعة في وقت واحد، ثم ينظر مرة أخرى. ويكرر دورة "النظر والتدقيق" هذه بضع مرات فقط (عادةً حوالي 4 إلى 6 مرات) حتى تستقر القطع في مكانها المثالي تمامًا.

النتائج مبهرة. فباستخدام xPress، يمكن للنظام قبول حوالي 30% أكثر من الكلمات المخمنة في المتوسط مقارنة بالمسود السريع الأصلي. وفي اختبارات محددة، مثل حل المسائل الرياضية، وصلت سرعة التسريع إلى 56%. وعند قياس السرعة الإجمالية لتحدث الذكاء الاصطناعي، جعل xPress العملية أسرع بمقدار 1.3 مرة في المتوسط، وما يصل إلى 1.7 مرة أسرع في أفضل الحالات، مقارنة بالطريقة الأصلية.

يجادل البحث صراحةً ضد طريقتين حاول فيهما الناس حل هذه المشكلة. تتضمن إحدى الطرق بناء "شجرة" ضخمة من التخمينات، وهي عملية معقدة ومكلفة للتشغيل. وتستخدم طريقة أخرى "رأس ماركوف" (Markov head) يقوم بإصلاح الكلمات واحدة تلو الأخرى في خط مستقيم صارم، وهي طريقة دقيقة ولكنها بطيئة لأنها تفقد ميزة السرعة الناتلة عن تخمين كل شيء دفعة واحدة. يظهر المؤلفون أن xPress يتفوق على كليهما: فهو أسرع من المُصلح البطيء الذي يعمل خطوة بخطوة، وأبسط من طريقة الشجرة المعقدة.

تؤكد الدراسة أن xPress يعمل من خلال حقن "المعلومات السببية" (القاعدة التي تنص على أن الكلمات تعتمد على الكلمات السابقة) مرة أخرى في النظام السريع دون إبطائه. لقد اختبروا ذلك على اختبارات الرياضيات، والبرمجة، والمحادثة، ووجدوا أن xPress يتفوق باستمرار على المنافسين. يشير البحث إلى أن هذا النهج هو تحسين مدروس وثابت يسمح للذكاء الاصطناعي بأن يكون سريعًا ودقيقًا في آن واحد، مما يثبت أنك لست مضطرًا للتضحية بالجودة من أجل السرعة إذا كان لديك الطريقة الصحيحة لتحسين تخميناتك.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →