← أحدث الأبحاث
🤖 machine learning

TIDE: Token-Informed Depth Execution for Per-Token Early Exit in LLM Inference

إنَّ TIDE هو نظام ما بعد التدريب يتيح الخروج المبكر لكل رمز (per-token early exit) في النماذج اللغوية الكبيرة عبر إلحاق موجهات متعلمة خفيفة الوزن بطبقات نقاط التفتيش (checkpoint layers)، مما يسمح للرموز بتجاوز الحسابات الفائضة بمجرد تقارب حالاتها الخفية دون الحاجة إلى إعادة تدريب النموذج.

المؤلفون الأصليون: Jaber Jaber, Osama Jaber

نُشر 2026-03-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jaber Jaber, Osama Jaber

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مصنعاً ضخماً وعالي الجودة ينتج قصصاً مخصصة، كلمة بكلمة. يحتوي هذا المصنع على 32 (أو حتى 80) محطة عمل مختلفة، أو "طبقات"، يجب أن تمر عبرها كل كلمة.

في نماذج اللغات الكبيرة (LLM) القياسية، تحصل كل كلمة على معاملة كبار الشخصيات (VIP) الكاملة.

  • كلمة مثل "الـ" (كلمة شائعة ومملة) تمر عبر الـ 32 محطة، حيث يتم صقلها وتحليلها ومعالجتها تماماً مثل معادلة رياضية معقدة أو رؤية فلسفية عميقة.
  • الأمر يشبه إرسال كلمة "مرحباً" بسيطة عبر فحص أمني مكون من 32 خطوة، و3ر 32 خطوة لمراقبة الجودة، و32 خطوة من الطهي الفاخر. هذا آمن، ولكنه هدر هائل للموارد. أنت تنفق ثروة من الكهرباء والوقت على كلمات لا تحتاج إلى ذلك.

دخول TIDE: "الحارس الذكي"

TIDE (التنفيذ ذو العمق المدرك للرموز - Token-Informed Depth Execution) هو نظام جديد يعمل مثل حارس ذكي للغاية لهذا المصنع. هو لا يمنع الكلمات من دخول المصنع، لكنه يقرر بالضبط متى يمكنها المغادرة مبكراً.

إليك كيف يعمل، باستخدام تشبيهات بسيطة:

1. "الجولة التجريبية" (المعايرة)

قبل أن يفتح المصنع أبوابه للأعمال، يقوم TIDE بـ "بروفة" سريعة. يقوم بتغذية النموذج بـ 2,000 جملة بسيطة (مثل مقال من ويكيبيديا) ويراقب كيف تتغير الكلمات أثناء حركتها عبر الطبقات.

  • لاحظ أنه بالنسبة لكلمة "الـ"، يتوقف معناها عن التغير بعد الطبقة 8. بحلول الطبقة 9، تصبح مجرد الكلمة نفسها مرة أخرى.
  • بالنسبة لكلمة رياضية معقدة، يستمر معناها في التطور طوال الطبقة 31.
  • يقوم TIDE بتدريب "موجهات" (Routers) صغيرة وخفيفة الوزن (مثل رقائق اتخاذ قرار صغيرة) للتعرف على هذا النمط. يستغرق تعلم هذا الأمر 3 دقائق فقط، و"كتيب القواعد" الناتج صغير جداً (4 ميجابايت فقط).

2. "مراجعة ما بعد المباراة" (الاستدلال)

هذا هو الجزء الذكي. TIDE لا يمنع الكلمة من المرور عبر جميع الطبقات الـ 32 أثناء معالجة الكلمة. لماذا؟ لأن الإيقاف المبكر يكسر ذاكرة المصنع ("KV Cache")، مما يسبب أخطاءً.

بدلاً من ذلك، يسمح TIDE للكلمة بالمرور عبر جميع الطبقات الـ 32 مثل المعتاد، ولكنه يفعل شيئاً خاصاً في الخلفية:

  • بينما تمر الكلمة بكل نقطة تفتيش، يهمس الموجه الصغير: "مهلاً، هذه الكلمة جاهزة! لقد اكتملت تماماً!"
  • بمجرد انتهاء الكلمة من الطبقات الـ 32 كاملة، ينظر النظام إلى ملاحظات الموجه.
  • إذا قال الموجه: "كانت هذه الكلمة جاهزة عند الطبقة 8"، فإن النظام يتجاهل العمل الذي تم من الطبقة 9 إلى 32 لهذا الكلمة تحديداً. يأخذ النتيجة من الطبقة 8 ويمضي قدماً.

فكر في الأمر كطالب يؤدي امتحاناً مكوناً من 32 سؤالاً:

  • الطريقة القديمة: يجيب الطالب على جميع الأسئلة الـ 32، حتى لو كان يعرف الإجابة على السؤال الأول فوراً.
  • طريقة TIDE: يجيب الطالب على جميع الأسئلة الـ 32 (للحفاظ على انسيابية الاختبار)، ولكن المعلم يصحح لهم بناءً على أبكر سؤال أجاب عليه الطالب بشكل صحيح. إذا أجاب على السؤال الأول بشكل صحيح، يتجاهل المعلم بقية الورقة بالنسبة لتلك الإجابة المحددة.

3. النتائج: السرعة والتوفير

لأن TIDE يدرك أن معظم الكلمات (مثل "الـ"، "يكون"، "و") بسيطة ولا تحتاج إلى تفكير عميق، فإنه يلغي العمل غير الضروري.

  • للكلمات البسيطة: قد تخرج عند الطبقة 11، متجاوزة 21 طبقة من العمل.
  • للكلمات الصعبة: تستمر حتى النهاية.
  • العملية الحسابية: في اختبار لمسألة رياضية، كانت 99% من الكلمات بسيطة بما يكفي للخروج مبكراً، ومع ذلك حل النموذج المسألة المعقدة بشكل مثالي.

لماذا يعد هذا أمراً هاماً؟

  • لا حاجة لإعادة التدريب: لا تحتاج إلى إعادة بناء المصنع أو إعادة تدريب العمال. TIDE مجرد "إضافة" صغيرة يمكن تركيبها على النماذج الموجودة (مثل تلك الموجودة في Hugging Face).
  • يعمل على أي نموذج: سواء كان Llama أو Qwen أو GPT، يمكن لـ TIDE معرفة كيفية الاتصال به.
  • أسرع وأرخص: من خلال تخطي العمل الإضافي للكلمات البسيطة، يعمل المصنع بشكل أسرع (زمن استجابة أقل) ويمكنه التعامل مع المزيد من العملاء في وقت واحد (إنتاجية أعلى). على وحدات معالجة الرسومات (GPUs) القوية، يعني هذا توليد النصوص بسرعة أكبر بنسبة تصل إلى 8% مع استهلاك طاقة أقل.

العقبة (القيود)

TIDE حالياً هو نظام "مراجعة ما بعد المباراة". فهو لا يزال يشغل الكلمة عبر جميع الطبقات فعلياً، لضمان السلامة مع الذاكرة. إنه لا يوقف الكلمة فيزيائياً عن دخول الغرف اللاحقة بعد.

  • التشبيه: الأمر يشبه حارساً يسمح للجميع بدخول النادي، ولكنه يفحص هوياتهم عند الباب. إذا كانوا على القائمة، فإنه يخبر منسق الموسيقى (DJ) بالتوقف عن تشغيل الموسيقى لهم. هذا يوفر الطاقة على الموسيقى، لكنهم لا يزالون قد مروا عبر الباب.
  • المستقبل: الخطوة التالية هي جعل الحارس يمنعهم حتى قبل دخول الغرف اللاحية، مما سيوفر وقتاً أكبر بكثير.

الملخص

TIDE هو أداة كفاءة ذكية. إنه يدرك أن ليس كل كلمة تحتاج إلى تحليل بمستوى الدكتوراه. من خلال إرفاق "حساسات ذكية" متعلمة بالنماذج الحالية، فإنه يسمح للكلمات البسيطة بالمغادرة من المصنع مبكراً بينما يترك الكلمات المعقدة لتتلقى المعاملة الكاملة. النتيجة؟ ذكاء اصطناعي أسرع، تكاليف أقل، ونفس الإجابات عالية الجودة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →