← أحدث الأبحاث
🤖 machine learning

Bastion: Budget-Aware Speculative Decoding with Tree-structured Block Diffusion Drafting

يُعد BASTION إطار عمل لفك التشفير التخميني (speculative decoding) خالٍ من التدريب ومراعٍ للميزانية، يقوم ببناء هياكل شجرية تعتمد على الاستعلام ديناميكيًا عبر التوسع التكيفي بنظام "الأفضل أولاً" (best-first expansion) لموازنة جودة المسودة مع قيود الأجهزة، محققًا تسريعًا يصل إلى 6.61 ضعفًا مقارنة بفك التشفير التلقائي القياسي، مع التفوق على النماذج المرجعية الحالية القائمة على الانتشار الكتلي (block-diffusion).

المؤلفون الأصليون: Soowon Oh, Nam Cao, Yujin Kim, Hojung Jung, Huzama Ahmad, Sangmin Bae, Se-Young Yun

نُشر 2026-05-29
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Soowon Oh, Nam Cao, Yujin Kim, Hojung Jung, Huzama Ahmad, Sangmin Bae, Se-Young Yun

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول كتابة قصة مع محرر حكيم للغاية، ولكنه بطيء بشكل لا يصدق (النموذج المستهدف). في كل مرة تكتب فيها كلمة واحدة، عليك الانتظار حتى يقرأها المحرر، ويفكر فيها، ثم يعطيك الضوء الأخضر قبل أن تتمكن من كتابة الكلمة التالية. هكذا تعمل روبوتات الدردشة الآلية الحالية: فهي تكتب كلمة واحدة في كل مرة، وتنتظر "التحقق" بعد كل خطوة. إنها دقيقة، لكنها بطيئة بشكل مؤلم.

لتسريع هذه العملية، يستخدم الباحثون (نموذج مسودة) وهو مساعد أسرع وأقل حكمة، ليخمن الكلمات القليلة التالية قبل أن يتحقق منها المحرر. إذا وافق المحرر على التخمين، يمكنك كتابة عدة كلمات دفعة واحدة، متجاوزاً وقت الانتظار.

ومع ذلك، هناك عقبة؛ فالنماذج الأحدث والأسرع (المسماة Block Diffusion) لا تخمن الكلمات واحدة تلو الأخرى، بل تصرخ بمجموعة كاملة من الكلمات دفعة واحدة. المشكلة هي أنه بسبب صراخها بالكلمات معاً، لا تكون متأكدة دائماً من كيفية ملاءمة الكلمات لبعضها البعض في تسلسل منطقي. الأمر يشبه طباخاً يلقي بمجموعة من المكونات على الطاولة دفعة واحدة؛ تبدو المكونات جيدة بشكل فردي، ولكن إذا التقطت المكون العلوي فقط، فقد ينتهي بك الأمر بطبق غريب وغير منطقي.

نظام BASTION هو نظام جديد صُمم لإصلاح هذه الفوضى وجعل العملية سريعة للغاية. إليك كيف يعمل، باستخدام تشبيهات بسيطة:

1. "شجرة الاحتمالات" (بدلاً من المسار الواحد)

كانت الطرق القديمة تأخذ صرخة المسودة، وتختار الكلمة "الأفضل" الوحيدة، ثم الكلمة التالية "الأفضل"، وتأمل في الحصول على نتيجة جيدة. إذا تبين أن هذا المسار خاطئ، كان على المحرر رفضه بالكامل، مما يعني ضياع الوقت.

BASTION مختلف. تخيل أن المسودة لا تعطيك مساراً واحداً فحسب، بل تعطيك شجرة عائلة من الاحتمالات.

  • في الخطوة الأولى، تقول: "ربما الكلمة التالية هي 'قطة' (احتمال 80%) أو 'كلب' (احتمال 20%)".
  • بدلاً من اختيار 'قطة' فقط، يبني BASTION شجرة صغيرة: فرع لـ 'قطة'، وفرع لـ 'كلب'.
  • ثم، بالنسبة للكلمة التالية، تتفرع الشجرة مجدداً من كل من 'القطة' و'الكلب'.
  • فجأة، يصبح لديك غابة صغيرة من الجمل المحتملة التي تنمو من نفس نقطة البداية.

2. "البستاني الذكي" (المتحكم الواعي بالميزانية)

هذا هو الجزء الصعب: لا يمكنك زراعة غابة لانهائية. فالمحرر (النموذج المستهدف) لديه حد مسموح به لعدد الفروع التي يمكنه فحصها في المرة الواحدة. إذا زرعت شجرة واسعة جداً أو عميقة جداً، فإن الوقت المستغرق لفحص الشجرة سيصبح أطول من مجرد كتابة الكلمات واحدة تلو الأخرى.

هنا يأتي دور "البستاني الذكي" في BASTION.

  • الميزانية: يعرف البستاني بالضبط مقدار الوقت الذي يمتلكه المحرر (الميزانية).
  • الاستراتيجية: بدلاً من نمو الشجرة بحجم ثابت (مثل "دائماً 10 فروع")، ينظر البستاني إلى مدى ثقة كل فرع.
    • إذا بدا فرع ما واعداً جداً (ثقة عالية)، يقوم البستاني بتنمية عمقه.
    • إذا بدا الفرع ضعيفاً، يتوقف عن النمو هناك.
  • إشارة التوقف: يسأل البستاني باستمرار: "هل إضافة فرع واحد آخر سيعطينا مزيداً من السرعة، أم أنه سيضيع الوقت فقط في فحص نهايات مسدودة؟" وبمجرد أن تتجاوز تكلفة فحص فرع جديد الفائدة المرجوة، يوقف البرستاني نمو الشجرة ويرسلها إلى المحرر.

3. "عداد السرعة" (الوعي بالأجهزة)

أجهزة الكمبيوتر المختلفة (GPUs) تشبه السيارات المختلفة. السيارة الرياضية (وحدة معالجة رسومات قوية) يمكنها فحص شجرة ضخمة بسرعة كبيرة. أما السيارة الصغيرة (وحدة معالجة رسومات أضعف) فقد تعاني مع نفس الشجرة.

يحتوي BASTION على "عداد سرعة" مدمج يعرف بالضبط مدى سرعة جهاز الكمبيوتر الخاص بك. هو لا يخمن فقط، بل يقيس المدة التي يستغرقها التحقق من شجرة ذات حجم معين على جهازك. ويستخدم هذه البيانات اللحظية لتحديد الحجم المثالي للشجرة لجهازك تحديداً، مما يضمن لك الحصول على أقصى سرعة دون تحميل جهازك فوق طاقته.

النتيجة

من خلال الجمع بين هذه الأفكال، يحقق BASTION ما تسميه الورقة البحثية تسريعاً بمقدار 6.61 ضعفاً.

  • الذكاء الاصطناعي القياسي: يكتب كلمة واحدة، ينتظر، يكتب كلمة واحدة، ينتظر. (السرعة: 1x)
  • الطرق السريعة القديمة: تخمن بضع كلمات، لكنها غالباً ما تتعثر في المسار الخاطئ. (السرعة: ~2-3x)
  • BASTION: ينمي شجرة تخمينات ذكية ومخصصة الحجم، ويفحص المسارات الأكثر وعداً، ويتوقف تماماً عند الوصول لأقصى كفاءة. (السرعة: ~6.6x)

باختصار، BASTION يشبه مدير مشروع ذكي للكتابة بالذكاء الاصطناعي. فبدلاً من التخمين الأعمى أو بناء هيكل جامد، فإنه يبني ديناميكياً "شجرة خيارات" مرنة ومصممة خصيصاً لتناسب سرعة الكمبيوتر، مما يضمن كتابة الذكاء الاصطناعي بأسرع ما يمكن دون ارتكاب أخطاء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →