تقدم الورقة البحثية نموذج Budget EAGLE (Beagle)، وهو بنية لفك التشفير الاستنتاجي تعتمد على الانتباه المتقاطع (cross-attention) بشكل مبسط، وتحقق أداءً يضاهي نماذج الانتباه الذاتي (self-attention) الحديثة مع توفير كفاءة تدريب محسنة وبساطة هيكلية من خلال طريقة تدريب مبتكرة تعتمد على "انتباه الكتلة ذات المرحلتين" (Two-Stage Block-Attention Training).
المؤلفون الأصليون:Wei Zhong, Manasa Bharadwaj, Yixiao Wang, Yipeng Ji, Chul Lee
تخيل أنك في مطعم مزدحم. تريد طلب وجبة مكونة من 5 أطباق، لكن الطاهي (النموذج المستهدف - Target LLM) هو خبير عالمي يستغر وقتًا طويلاً لتحضير كل طبق بإتقان تام. إذا انتظرت حتى ينتهي الطاهي من طبق واحد قبل التفكير في الطبق التالي، فستظل جالساً هناك لساعات.
لتسريع الأمور، تقوم بتعيين "مساعد مبتدئ" (نموذج المسودة - Draft Model). هذا المساعد سريع جداً ولكنه ليس بذكاء الطاهي. الاستراتيجية هي: يقوم المساعد بسرعة بتخمين الأطباق الخمسة التالية التي قد تُقدم. أنت تعرض هذه التخمينات على الطاهي الخبير. إذا قال الطاهي: "نعم، هذه هي الأطباق التي كنت سأعدها بالضبط!" — بوم! لقد اختصرت خمس فترات انتظار طويلة. أما إذا قال الطاهي: "لا، الطبق الثالث خاطئ"، فأنت لا تخسر سوى القليل من الوقت، حيث يتولى الطاهي المهمة من تلك النقطة.
تقدم هذه الورقة البحثية طريقة جديدة، أذكى، وأكثر رشاقة لتدريب هذا "المساعد المبتدئ".
المشكلة: "المساعد الثقيل"
المساعدون السريعون الحاليون (مثل طريقة تسمى EAGLE) أذكياء جداً، لكنهم "ثقيلون". لجعلهم يعملون، يتعين على المهندسين بناء "أدوات إضافية" معقدة (طبقات مساعدة) والقيام بعمليات "نسخ ولصق" معقدة للمعلومات لمساعدة المساعد على فهم ما يفعله الطاهي الخبير. الأمر يشبه إعطاء المساعد دليلاً ضخماً وثقيلاً يتعين عليه تصفحه باستمرار، مما يجعل تدريبهم بطيئاً ومكلفاً.
ابتكر الباحثون Beagle. بدلاً من استخدام عقل ضخم ومعقد، يستخدم Beagle طريقة انسيابية تسمى الانتباه المتقاطع (Cross-Attention).
التشبيه: "الأذن الموسيقية" مقابل "بنك الذاكرة"
الطرق القديمة (الانتباه الذاتي - Self-Attention): تخيل المساعد وهو يحاول التنبؤ بالنوتة الموسيقية التالية في أغنية عن طريق إعادة قراءة كل نوتة عُزفت حتى الآن باستمرار. هذا دقيق، لكنه يتطلب جهداً ذهنياً كبيهراً.
Beagle (الانتباه المتقاطع): تخيل المساعد وهو "يستمع" فقط إلى الطاهي الخبير. بدلاً من إعادة قراءة كل شيء، يقوم المساعد ببساطة بضبط أذنه على إيقاع الطاهي الحالي. إنه ينظر إلى "روح" أو "نمط" الطاهي (الحالات المخفية) ويتنبأ بالحركة التالية فوراً. هذا أخف بكثير ويتطلب "أوراقاً" (ذاكرة) أقل بكثير.
السر الصغير: التدريب على مرحلتين
تدريب مساعد ليكون سريعاً ودقيقاً في نفس الوقت أمر صعب. إذا دربته ببساطة شديدة، فسيقع في الأخطاء. وإذا دربته بكثافة مفرطة، فسيستغرق ذلك وقتاً طويلاً جداً. يستخدم Beagle برنامج تدريب من خطوتين:
المرحلة الأولى: "تمرين السرعة" (المرحلة المبكرة): نعطي المساعد مجموعة من النوتات المستقبلية دفعة واحدة ونقول له: "خمن أكبر عدد ممكن منها!". هذا يعلمه رؤية "الصورة الكبيرة" بسرعة دون الغرق في التفاصيل.
المرحلة الثانية: "البروفة" (المرحلة المتأخرة): الآن، نجعلهم يؤدون فعلياً. نتركهم يقدمون تخميناً، ثم نتركهم يستخدمون ذلك التخمين لصنع التخمين التالي، محاكيين بذلك خدمة وجبة حقيقية. هذا يعلمهم كيفية التعامل مع أخطائهم حتى لا يخرجوا عن المسار أثناء العشاء الحقيقي.
لماذا يهم هذا؟
إنه أسرع: يحقق نفس السرعات العالية للنماذج التي تعتبر "المعيار الذهبي" الحالي.
إنه أبسط: لا يحتاج إلى تلك "الأدلة" أو "الأدوات" الإضافية والثقيلة.
إنه أرخص: نظرما أنه فعال للغاية، يمكنك تدريب مساعد ذكي جداً على شريحة كمبيوتر قياسية واحدة (GPU) بدلاً من الحاج الحاجة إلى كمبيوتر خارق ضخم.
باختصار: يجعل Beagle "المساعد المبتدئ" في الذكاء الاصطناعي أسرع، وأذكى، وأسهل بكثير في التدريب، مما يجعل "مطعم" الذكاء الاصطنا_الكامل أكثر كفاءة للجميع.
ملخص تقني: فك التشفير الاستنباطي عبر الانتباه المتقاطع (Beagle)
1. بيان المشكلة
يعمل فك التشفير الاستنباطي (Speculative Decoding - SD) على تسريع استنتاج النماذج اللغوية الكبيرة (LLM) باستخدام "نموذج مسودة" خفيف الوزن للتنبؤ بعدة رموز مستقبلية، والتي يتم التحقق منها بالتوازي بواسطة "النموذج المستهدف". وعلى الرغم من نجاحه، تواجه طرق فك التشفير الاستنباطي الحالية (مثل EAGLE-v2) عدة تحديات:
التعقيد المعماري: تعتمد معظم نماذج المسودة عالية الأداء على آليات الانتباه الذاتي التي تتطلب مكونات مساعدة (مثل طبقات التجميع أو الدمج) لمواءمة الحالات الخفية لنموذج المسودة مع حالات النموذج المستهدف.
صعوبات التكامل: تولد رؤوس الانتباه الذاتي في نموذج المسودة الاستعلامات (Queries) والمفات keys (Keys) من نفس الحالة الخفية، مما يجعل من الصعب دمج الميزات غير المتجانسة من النموذج المستهدف دون تخصيص معقد.
عدم كفاءة التدريب: تعاني طرق "اختبار وقت التدريب" (TTT) الحالية، والتي تحاكي الاستنتاج التكراري أثناء التدريب لتحسين المواءمة، غالبًا من استهلاك عالٍ للذاكرة وطول أوقات التدريب لأنها تزيد من حجم الحالات الخفية خطيًا مع عدد خطوات المحاكاة.
2. المنهجية
يقترح المؤلفون Budget EAGLE (Beagle)، وهو إطار عمل جديد لفك التشفير الاستنباطي يتميز بمعمارية مبسطة ونظام تدريب متخصص يتكون من مرحلتين.
أ. نمذجة المسودة عبر الانتباه المتقاطع (Cross-Attention) بدلاً من الانتباه الذاتي، يستخدم Beagle كتلة Transformer بسيطة مكونة من طبقة واحدة من الانتباه المتقاطع تليها طبقة MLP.
الآلية: يستخدم نموذج المسودة الحالات الخفية للنموذج المستهدف كـ مفاتيح (K) وقيم (V)، بينما تعمل الحالات السابقة للنموذج نفسه (أو التضمينات) كـ استعلامات (Q).
المزايا: تتعامل هذه الآلية بشكل طبيعي مع التفاوت بين الميزات منخفضة المستوى (التضمين) وعالية المستوى (الحالة الخفية) دون الحاجة إلى طبقات تجميع أو دمج مساعدة. كما أنها تتجنب الحاجة إلى نسخ ودمج حالات النموذج المستهدف صراحةً، مما يحسن من محلية الذاكرة.
ب. التدريب عبر مرحلتين بنظام انتباه الكتل (Block-Attention) لسد الفجوة بين ديناميكيات التدريب والاستنتاج، قدم المؤلفون استراتيجية تدريب من مرحلتين:
المرحلة المبكرة (انتباه الكتلة): لتعظيم كفاءة التدريب، يتنبأ النموذج بعدة رموز مستقبلية بالتوازي باستخدام قناع "الانتباه الكتلي العكسي". يقوم هذا القناع بإخفاء الرموز المحلية عن الاستعلام، مما يجبر النموذج على "تكثيف" المعلومات حول الرموز المستقبلية في التمثيل الحالي. تستخدم هذه المرحلة فقدان التنبؤ متعدد الرموز (Learly) لتسريع التقارب.
المرحلة المتأخرة (المحاكاة في الموقع): لضمان أداء النموذج بشكل جيد أثناء الاستنتاج التكراري الفعلي، تقوم المرحلة الثانية بعملية "فك" محدودة للحالات المتنبأ بها. وخلافًا للطرق السابقة، يستخدم Beagle تعديلات في الموقع (in-place modifications) لقناع الانتباه والذاكرة، مما يسمح بمحاكاة الاستنتاج باستخدام استهلاك ثابت للذاكرة. تستخدم هذه المرحلة فقدانًا بديلًا (Llate) يقرب بدقة أكبر طول القبول المتوقع أثناء الاستنتاج.
3. المساهمات الرئيسية
تبسيط المعمارية: تقديم أول وحدة فك تشفير Transformer تعتمد على الانتباه المتقاطع لفك التشفير الاستنباطي، والتي تلغي طبقات التجميع/الدمج المساعدة مع مطابقة أداء الانتباه الذاتي الرائد (SOTA).
ابتكار التدريب: تطوير طريقة التدريب عبر مرحلتين بنظام انتباه الكتلة، والتي توازن بين الإنتاجية العالية للتنبؤ المتوازي متعدد الرموز ودقة المحاكاة التكرارية.
كفاءة الذاكرة: تحقيق نظام تدريب يحافظ على استهلاك ثابت للذاكرة أثناء المحاكاة، مما يسمح بتدريب نماذج بمقياس 7B على أجهزة استهلاكية (مثل بطاقة رسوميات واحدة بسعة 24 جيجابايت).
4. النتائج
أظهرت التجارب المكثفة عبر نماذج Vicuna و LLaMA-2 و LLaMA-3 ما يلي:
الأداء: يحقق Beagle تسريعًا في الاستنتاج يضاهي (وفي بعض الحالات يتجاوز) EAGLE-v2. على سبيل المثال، حقق Beagle في نموذج Vicuna-7B تسريعًا قدره 104.6 ضعفًا مقارنة بالنموذج الأساسي.
الكفاءة: يظهر Beagle كفاءة تدريب متفوقة في المراحل المبكرة مقارنة بـ EAGLE.
استخدام الموارد: يحافظ Beagle على بصمة ذاكرة أقل لوحدة معالجة الرسومات مقارنة بـ EAGLE، الذي يتطلب عادةً ذاكرة أكثر بنسبة 10-15% بسبب مكوناته المعمارية المعقدة.
المتانة: نجحت استراتيجية التدريب ثنائية المرحلة في منع تدهور الدقة الذي يحدث عادةً عند الانتقال من التدريب المتوازي إلى الاستنتاج التكراري.
5. الأهمية
يثبت هذا العمل أن البساطة المعمارية لا تستلزم مقايضة في الأداء في عملية فك التشفير الاستنباطي. ومن خلال الانتقال من الانتباه الذاتي إلى الانتباه المتقاطع وتحسين هدف التدريب ليتوافق مع ديناميكيات الاستنتاج، يوفر Beagle بديلاً أكثر قابلية للتوسع، وأسهل في التكامل، وأكثر كفاءة في استخدام الذاكرة لتسريع استنتاج النماذج اللغوية الكبيرة. يفتح هذا النهج آفاقًا جديدة لتطبيق فك التشفير الاستنباطي على الوسائط الأخرى، مثل النماذج اللغوية البصرية (VLMs).