← أحدث الأبحاث
💬 NLP

Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed

تقدم هذه الورقة Efficient-DLM، وهو إطار عمل يحول النماذج التنبؤية ذاتية الانحدار سابقة التدريب إلى نماذج لغوية انتشارية عالية الكفاءة من خلال توظيف نمط انتباه قائم على الكتل وقناع رموز يعتمد على الموضع، مما يحقق دقة وإنتاجية متفوقة مقارنة بالنماذج الرائدة الحالية.

المؤلفون الأصليون: Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

نُشر 2026-05-01
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحث "Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed" باستخدام لغة بسيطة وتشيهات من الحياة اليومية.

الصورة الكبيرة: الازدحام المروري مقابل الطريق السريع

تخيل طريقتين لكتابة قصة:

  1. الطريقة القديمة (التوليد التتابعي/AR): تشبه طريقاً ذا مسرب واحد. تكتب كلمة واحدة، ثم التي تليها، ثم التي تليها. لا يمكنك كتابة الكلمة الثانية حتى تنتهي من الأولى. هي دقيقة جداً، لكنها بطيئة لأن عليك الانتظار في الطابور لكل كلمة على حدو.
  2. الطريقة الجديدة (الانتشار/DLM): تشبه طريقاً سريعاً متعدد المسارات. يمكنك كتابة العديد من الكلمات في نفس الوقت (بالتوازي). من المفترض أن تكون أسرع بكثير. ومع ذلك، كانت هذه "الطرق السريعة" في الماضي وعرة، ومربكة، وغالباً ما تنتج قصصاً أقل جودة من طريق المسرب الواحد. كما كانت مكلفة جداً في بنائها (تدريبها).

المشكلة: أراد العلماء الحصول على سرعة الطريق السريع وجودة طريق المسرب الواحد، لكنهم لم يستطيعوا معرفة كيفية بناء ذلك دون البدء من الصفر (وهو أمر يكلف ثروة).

الحل: توصل مؤلفو هذه الورقة إلى كيفية أخذ نموذج موجود عالي الجودة (نموذج المسرب الواحد) وتحويله إلى نموذج "طريق سريع" يكون سريعاً ودقيقاً في آن واحد. ويطلقون على هذه العائلة الجديدة من النماذج اسم Efficient-DLM.


كيف فعلوا ذلك: ثلاث حيل رئيسية

حددت الورقة البحثية ثلاث "قواعد" رئيسية كان عليهم اتباعها لجعل هذا التحول ناجحاً.

1. قاعدة "السياق النظيف" (طريقة الكتل - The Block-Way)

  • الخطأ القديم: حاولت المحاولات السابقة جعل النموذج ينظر إلى الجملة بأكملة في وقت واحد، حتى الأجزاء التي لا تزال غير مرتبة أو مفقودة. تخيل أنك تحاول حل لغز (Puzzles) حيث نصف القطع مفقودة، ويُسمح لك بالنظر إلى المساحات الفارغة وكأنها مليئة. هذا أربك النموذج وجعله ينسى ما تعلمه سابقاً.
  • الإصلاح: قرر المؤلفون تقسيم الجملة إلى كتل صغيرة (مثل فصول الكتاب).
    • ينظر النموذج إلى الفصول السابقة، وهي مكتملة ونظيفة بالفعل.
    • يحاول فقط إصلاح الفصل الحالي، وهو غير مرتب.
    • تشبيه: فكر في الأمر كفريق بناء. هم لا يحاولون إصلاح المبنى بأكمله دفعة واحدة. بل ينهون الأساس والطابق الأول (سياق نظيف) قبل الانتقال للأعلى لإصلاح الطابق الثاني (الكتلة غير المرتبة). هذا يحافظ على استقرار الهيكل ويسمح لهم باستخدام "اختصار" (يسمى KV caching) لتذكر ما بنوه بالفعل، مما يجعل العملية أسرع بكثير.

2. قاعدة "عدم إزاحة الرموز" (توقف عن تخمين الخطوة التالية)

  • الخطأ القديم: عند تحويل النموذج القديم، كان الباحثون يجعلون النموذج يخمن الكلمة التالية، تماماً كما يفعل نموذج المسرب الواحد القديم.
  • الإصلاح: وجد المؤلفون أن النموذج ليس بحاجة لتخمين الكلمة "التالية". هو فقط يحتاج إلى إصلاح الكلمات المفقودة الموجودة أمامه مباشرة.
  • تشبيه: تخيل أنك تقوم بتحرير مستند.
    • الطريقة القديمة: تقرأ جملة، ثم تحاول التنبؤ بالجملة التالية قبل أن تنهي حتى تحرير الجملة الحالية.
    • الطريقة الجديدة: أنت فقط تركز على ملء الفراغات في الفقرة الحالية. اتضح أن إصلاح الفراغات أسهل وأكثر دقة من محاولة التنبؤ بالمستقبل.

3. قاعدة "القناع المعتمد على الموقع" (الانحياز من اليسار إلى اليمين)

  • المشكلة: عندما يتم تدريب النموذج، كان يتم إخفاء الكلمات بشكل عشوائي (مثل اختيار أرقام اليانصيب). ولكن عندما يتم استخدام النموذج فعلياً (الاستنتاج)، فإنه يميل طبيعياً إلى إنهاء الكلمات من اليسار إلى اليمين، تماماً مثل البشر أثناء القراءة. هذا خلق عدم تطابق: التدريب لم يكن يشبه الاختبار الحقيقي.
  • الإصلاح: قام المؤلفون بتغيير التدريب بحيث يكون النموذج أكثر عرضة لإخفاء الكلمات في نهاية الكتلة، بدلاً من بدايتها.
  • تشبيه: تخيل معلماً يصحح اختباراً.
    • التدريب القديم: المعلم يغطي أسئلة عشوائية في الصفحة.
    • التدريب الجديد: يدرك المعلم أن الطلاب عادة ما يتعثرون في الأسئلة الأخيرة من القسم. لذا، يتدرب المعلم خصيصاً على تغطية نهاية القسم. هذا يهيئ النموذج للعالم الحقيقي، حيث يتعين عليه إنهاء الجملة من اليسار إلى اليمين.

النتائج: السرعة والذكاء

من خلال اتباع هذه القواعد، أنشأ المؤلفون عائلة Efficient-DLM (بأحجام 1.5B و 4B و 8B).

  • السرعة: هم أسرع بكثير من النماذج الموجودة حالياً. على سبيل المثال، نموذج 8B الخاص بهم أسرع بـ 4.5 مرة من منافس يدعى "Dream" وأسرع بـ 2.7 مرة من "Qwen3 4B".
  • الدقة: رغم كونهم أسرع، إلا أنهم في الواقع أكثر دقة في مهام الرياضيات والبرمجة والاستنتاج من النماذج التي تفوقونها.
  • المرونة: نظرًا لأنهم يمكنهم توليد العديد من الكلمات في وقت واحد، يمكنك ضبطهم. إذا كنت بحاجة للسرعة، تولد العديد من الكلمات معاً. إذا كنت بحاجة لدقة متناهية، تولد عدداً أقل من الكلمات في المرة الواحدة. الأمر يشبه امتلاك سيارة يمكنها التبديل بين "وضع السباق" و"وضع الترحال" فوراً.

الملخص

تقول الورقة: "لقد أخذنا نموذجاً بطيئاً ودقيقاً وعلمناه كيف يركض على طريق سريع. فعلنا ذلك عبر تنظيم العمل في كتل نظيفة، والتوقف عن تخمين المستقبل، والتدريب على التركيز على نهايات الجمل. النتيجة هي عائلة نماذج أسرع وأذكى من أحدث ما توصل إليه العلم حالياً."

كما لاحظوا أنه نظرًا لأن هذه النماذج يمكنها النظر إلى النصوص من كلا الاتجاهين (ثنائية الاتجاه)، فإنها جيدة بشكل مدهش في فهم "معنى" النصوص لمهام البحث والتمثيل الرقمي (embedding)، متفوقة بذلك على النماذج القديمة ذات الاتجاه الواحد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →