← أحدث الأبحاث
💻 computer science

Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention

يقدم Gated DeltaNet-2 آلية انتباه خطي مبتكرة تفك الارتباط بين عمليتي المسح والكتابة على مستوى القنوات عبر بوابات منفصلة للتغلب على قيود التحرير المرتبط بالقيم القياسية في النماذج السابقة، محققاً أداءً هو الأفضل في فئته في مهام نمذجة اللغة واسترجاع السياق الطويل.

المؤلفون الأصليون: Ali Hatamizadeh, Yejin Choi, Jan Kautz

نُشر 2026-05-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Ali Hatamizadeh, Yejin Choi, Jan Kautz

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح لورقة بحثية بعنوان "Gated DeltaNet-2" باستخدام لغة بسيطة وتشبيهات إبداعية.

الصورة الكبيرة: مشكلة "الذاكرة الزائدة عن الحد"

تخيل أمين مكتبة فائق الذكاء (نموذج ذكاء اصطناعي) يحتاج إلى قراءة كتاب طويل جداً للإجابة على سؤال ما.

  • الطريقة القديمة (Transformers القياسية): يقوم أمين المكتبة بالاحتفاظ بمجموعة ضخمة ومتزايدة من بطاقات الفهرسة لكل كلمة قرأها على الإطلاق. إذا كان الكتاب مكوناً من 100,000 كلمة، ستكون المجموعة ضخمة جداً. هذا يشغل مساحة كبيرة من المكتب (الذاكرة) ويجعل عملية البحث بطيئة.
  • الطالطريقة الأحدث (الانتباه الخطي - Linear Attention): لتوفير المساحة، يستخدم أمين المكتبة دفتر ملاحظات واحداً ثابتاً الحجم. بدلاً من تدوين كل شيء، يقوم بتلخيص القصة أثناء تقدمه. وإذا امتلأ الدفتر، يتعين عليه مسح شيء ما لكتابة شيء جديد.

مشكلة هذا "الدفتر الثابت الحجم" هي التداخل (Interference). إذا قام أمين المكتبة بمسح صفحة لكتابة قصة جديدة، فقد يمسح بالخطأ تفصيلاً مهماً من الماضي لا يزال يحتاجه لاحقاً. الأمر يشبه محاولة كتابة قائمة تسوق جديدة على ملاحظة لاصقة (Sticky Note) تحتوي بالفعل على رقم هاتفك؛ إذا كتبت فوق الرقم، فستفقده.

الحل السابق: الممحاة التي "تناسب الجميع"

حاول الباحثون إصلاح ذلك باستخدام نماذج مثل KDA و Gated DeltaNet. لقد منحوا أمين المكتبة "ممحاة" و"قلماً" خاصين.

ومع ذلك، كانت هذه النماذج تعاني من عيب: الممحاة والقلم كانا مرتبطين معاً.
تخيل مفتاحاً واحداً يتحكم في شيئين في آن واحد:

  1. مقدار ما سيتم مسحه من الكتابة القديمة.
  2. مقدار ما سيتم تسجيله من الكتابة الجديدة.

إذا أراد أمين المكتبة مسح كلمة محددة من الماضي مع الحفاظ على بقية الصفحة، لم يكن يستطيع ذلك. المفتاح أجبره إما على مسح الصفحة بأكملها أو كتابة القصة الجديدة بالكامل. لم يكن دقيقاً، فقد كانا "مرتبطين ببعضهما البعض".

الحل الجديد: Gated DeltaNet-2

Gated DeltaNet-2 هو نسخة جديدة من نظام دفتر ملاحظات أمين المكتبة هذا. ابتكاره الرئيسي هو فك الارتباط (Decoupling) بين الممحاة والقلم.

بدلاً من مفتاح واحد، أصبح لدى النموذج الآن تحكمان مستقلان:

  1. بوابة المسح (The Erase Gate - الممحاة): ينظر هذا التحكم إلى المعلومات القديمة. ويقرر بالضبط أي أجزاء محددة من القصة القديمة يجب مسحها. إنه يشبه امتلاك ممحاة دقيقة يمكنها إزالة كلمة "تفاحة" فقط دون المساس بكلمة "برتقالة" المجاورة لها.
  2. بوابة الكتابة (The Write Gate - القلم): ينظر هذا التحكم إلى المعلومات الجديدة. ويقرر بالضبط أي أجزاء من القصة الجديدة يجب تدوينها. إنه يشبه امتلاك قلم يمكنه كتابة المكونات الجديدة التي اشتريتها فقط، دون إعادة كتابة القائمة بأكملها.

التشبيه:
فكر في صفحة دفتر الملاحظات كأنها سبورة بيضاء رقمية.

  • النموذج القديم: لديك جهاز تحكم عن بعد. إذا ضغطت على "تحديث"، فسيقوم بمسح 50% من السبورة ويكتب 5الـ 50% الجديدة. لا يمكنك اختيار ما يتم مسحه أو ما يتم كتابته.
  • Gated DeltaNet-2: لديك مؤشر ليزر وقلم تحديد (Marker). يمكنك استخدام الليزر لإزالة المعلومات القديمة الخاطئة فقط (بوابة المسح)، ثم استخدام قلم التحديد لكتابة المعلومات الجديدة المهمة فقط (بوابة الكتابة).

لماذا هذا مهم (النتائج)

اختبرت الورقة البحثية نظام "البوابتين" الجديد هذا مقابل نماذج ذكية أخرى (مثل Mamba-2 و Mamba-3 و KDA الأصلي) على نموذج مكون من 1.3 مليار معلمة (parameter) تم تدريبه على كمية هائلة من النصوص التعليمية.

إليك ما وجدوه:

  1. أفضل في العثـور على "الإبرة في كومة القش":
    تخيل اختباراً حيث يتعين على أمين المكتبة العثور على جملة واحدة محددة مخبأة داخل وثيقة مكونة من 100 صفحة.
  • النماذج القديمة كانت ترتبك أحياناً لأن الممحاة "المرتبطة" كانت تمسح "الإبرة" بالخطأ أثناء محاولتها كتابة معلومات جديدة.
  • Gated DeltaNet-2 كان الأفضل في هذا. لأنه استطاع مسح المعلومات المشتتة فقط مع حماية "الإبرة" المهمة، مما جعله يتذكر الإجابة الصحيحة بشكل أفضل بكثير، حتى في الوثائق الطويلة جداً.
  1. تفكير أكثر ذكاءً:
    في الاختبارات المتعلقة بالمنطق العام (مثل "إذا وضعت كوباً على الطاولة، أين يوجد الكوب؟")، سجل النموذج الجديد درجات أعلى من منافسيه. يبدو أن القدرة على تعديل الذاكرة بدقة تساعد النموذج على فهم العلاقات بشكل أفضل.

  2. السرعة والكفاءة:
    على الرغم من امتلاكه ضوابط أكثر تعقيداً (بوابتان بدلاً من بوابة واحدة)، إلا أن النموذج لم يصبح أبطأ بشكل ملحوظ. لا يزال يعالج النصوص بسرعة مماثلة للنماذج الفعالة الأخرى، مما يجعله عملياً للاستخدام في العالم الحقيقي.

الملخص

Gated DeltaNet-2 هو طريقة أذكى لإدارة الذكاء الاصطناعي لذاكرته قصيرة المدى. من خلال فصل عملية النسيان (مسح البيانات القديمة) عن عملية التعلم (كتابة البيانات الجديدة)، يتجنب النموذج "الأضرار الجانبية" المتمثلة في حذف المعلومات المهمة عن طريق الخطأ. يتيح ذلك له التعامل مع القصص الطويلة والمهام المعقدة بدقة أكبر من الطرق السابقة، كل ذلك مع الحفاظ على انخفاض استهلاك الذاكرة وارتفاع السرعة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →