← أحدث الأبحاث
💬 NLP

Bayesian Attention Mechanism: A Probabilistic Framework for Positional Encoding and Context Length Extrapolation

تقدم هذه الورقة آلية الانتباه البايزي (BAM)، وهي إطار عمل احتمالي يوحد طرق الترميز الموضعي الحالية ويقترح توزيع غاوسي معمم (Generalized Gaussian prior) لتحقيق أداء فائق في تعميم السياق الطويل، مما يتيح استرجاع المعلومات بدقة عند 500 ضعف طول سياق التدريب مع حد أدنى من الزيادة في عدد المعلمات.

المؤلفون الأصليون: Arthur S. Bianchessi, Yasmin C. Aguirre, Rodrigo C. Barros, Lucas S. Kupssinskü

نُشر 2026-05-11
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Arthur S. Bianchessi, Yasmin C. Aguirre, Rodrigo C. Barros, Lucas S. Kupssinskü

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل نموذج لغة من نوع "ترانسفورمر" (المحرك الذي يقف وراء روبوتات الدردشة الذكية الحديثة) كأنه أمين مكتبة فائق الذكاء يحاول قراءة كتاب ضخم. أمين المكتبة هذا بارع للغاية في فهم معاني الكلمات، لكن لديه مشكلة غريبة: ليس لديه أي إحساس بالترتيب. إذا أعطيته جملة مثل "القط جلس على الحصيرة"، فلن يستطيع معرفة ما إذا كانت كلمة "القط" جاءت قبل "جلس" أم بعدها، لأن الكلمات تبدو له متشابهة بغض النظر عن مكان جلوسها.

ولإصلاح ذلك، نمنح أمين المكتبة عادةً ما يسمى "التشفير الموضعي" (Positional Encoding - PE). فكر في هذا الأمر كأنه بطاقة اسم صغيرة غير مرئية أو ملصق ملون على كل كلمة يقول: "أنا الكلمة الأولى"، "أنا الكلمة الثانية"، وهكذا. هذا يساعد أمين المكتبة على فهم تدفق القصة.

ومع ذلك، فإن معظم أنظمة "الملصقات" هذه بها عيب: فهي تعمل بشكل رائع في القصص القصيرة، لكنها تنهار عندما يصبح الكتاب طويلاً حقاً (مثل رواية مكونة من 100,000 صفحة). يبدأ أمين المكتبة في تجاهل بداية الكتاب لأن الملصقات تصبح مربكة للغاية أو تتلاشى.

الفكرة الجديدة: "آلية الانتباه البايزي" (BAM)

يقترح مؤلفو هذه الورقة البحثية طريقة جديدة للتفكير في هذه الملصقات، والتي يسمونها BAM. بدلاً من مجرد لصق ملصق ثابت على الكلمة، تعامل BAM موقع الكلمة كأنه تخمين احتمالي.

إليك التشبيه:
تخيل أن أمين المكتبة يحاول العثور على معلومة محددة (مفتاح مرور) مخبأة في مكان ما داخل وثيقة طويلة.

  • الطريقة القديمة (مثل ALiBi): يفترض أمين المكتبة أن الإجابة هي الأرجح أن تكون بجوار الكلمة الحالية مباشرة، وكلما ابتعدت المسافة، قل احتمال وجود الإجابة. الأمر يشبه البحث عن مفتاح مفقود في منزلك؛ تفحص جيوبك أولاً، ثم الطاولة، وتتوقف عن البحث في المرآب لأن المكان "بعيد جداً".
  • طريقة BAM: يستخدم أمل المكتبة "اعتقاداً مسبقاً" (خريطة احتمالية) حول مكان وجود الإجابة المحتمل. هذه الخريطة ليست ثابتة؛ بل هي قاعدة مرنة يمكن ضبطها.

السر الكامن: خريطة "غاوس المعممة" (Generalized Gaussian)

قدمت الورقة نوعاً معيناً من خرائط الاحتمالات يسمى "الاحتمال الغاوسي المعمم" (Generalized Gaussian Prior). فكر في هذه الخريطة كأنها تضاريس بها تلال ووديان تمثل مدى احتمالية بحث أمين المكتبة عن كلمة معينة.

  1. "التل المحلي": يمكن أن تحتوي الخريطة على تل شديد الانحدار بجوار الكلمة الحالية مباشرة. هذا يساعد أمين المكتبة على فهم السياق المباشر (مثل القواعد وبنية الجملة).
  2. "ذيل المسافات الطويلة": هنا يكم ت السحر. وجد المؤلفون أنه من خلال ضبط مقبض معين (يسمى β\beta)، يمكنهم تغيير شكل الخريطة.
    • إذا أداروا المقبض في اتجاه واحد، فإن أمين المكتبة يتجاهل الأجزاء البعيدة من الكتاب (مثل الطرق القديمة).
    • إذا أداروا المقبض في الاتجاه الآخر (تحديداً بضبطه على رقم سالب)، فإن أمين المكتبة يتوقف عن النظر إلى الجيران المباشرين ويبدأ في التركيز بشدة على الكلمات التي تبعد مسافة بعيدة جداً.

ماذا حققوا بالفعل؟

لا تدعي الورقة البحثية أن هذا سيشفي الأمراض أو يكتب لك روايات بعد؛ فقد اختبروا الأمر في مهام محددة للغاية وخاضعة للتحكم:

  • اختبار "إبرة في كومة قش": قاموا بإخفاء رقم مكون من 5 أرقام (مفتاح مرور) في عمق نص يبلغ طوله آلاف الكلمات.
    • النتيجة: بينما استسلمت الطرق الأخرى (مثل RoPE أو ALiBi) وخمنت بشكل عشوائي عندما أصبح النص طويلاً جداً، استطاع نموذج BAM لاحقاً العثور على الرقم بدقة، حتى عندما كان النص أطول بـ 500 مرة مما تدرب عليه النموذج.
  • اختبار "الارتباك" (Perplexity): يقيس هذا الاختبار مدى قدرة النموذج على التنبؤ بالكلمة التالية في الجملة.
    • النتيجة: كان BAM جيداً في التنبؤ بالكلمات تماماً مثل أفضل الطرق الموجودة، مما يعني أنه لم يضحِّ بمهارات اللغة العامة في سبيل اكتساب هذه القوة الخارقة للمسافات الطويلة.

التكلفة "غير المرئية"

أحد أروع أجزاء اكتشافهم هو مدى رخص ثمن إضافته.

  • لقد أضافوا أقل من 1,000 معلمة جديدة (bits صغيرة من الذاكرة) إلى نموذج يمتلك بالفعل 120 مليون معلمة.
  • هذا يشبه إضافة حبة رمل واحدة إلى شاطئ، وفجأة يصبح الشاطل بأكمله قادراً على رؤية الأفق.
  • لم يؤدِ ذلك إلى إبطاء النموذج أو زيادة استهلاك قوة الكمبيوتر.

ملخص باللغة البسيطة

بنى المؤلفون نظام "ملصقات موضعية" جديد للذكاء الاصطنا Artificial Intelligence. بدلاً من افتراض أن الإجابة ستكون دائماً قريبة، منحوا الذكاء الاصطناعي كتاب قواعد مرناً يسمح له بتجاهل المحيط المباشر والتركيز على المعلومات المدفونة في الماضي البعيد.

لقد أثبتوا رياضياً أن هذا يعمل، وأظهروا في التجارب أن ذكاءهم الاصطناعي يمكنه العثور على إبرة في كومة قش مكونة من 500,000 كلمة، بينما يضيع الذكاء الاصطناعي الآخر بعد بضعة آلاف من الكلمات فقط. لم يختبروا ذلك على وثائق طبية أو قانونية حقيقية، لكنهم أظهروا أن الآلية لإيجاد المعلومات بعيدة المدى أصبحت الآن أقوى وأكثر موثوقية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →