← أحدث الأبحاث
🤖 machine learning

ThriftAttention: Selective Mixed Precision for Long-Context FP4 Attention

تعد ThriftAttention آلية انتباه انتقائية مختلطة الدقة تقوم ديناميكيًا بحساب جزء صغير فقط من كتل الاستعلام والمفتاح الحرجة بدقة FP16 بينما تعالج البقية بدقة FP4، مما يستعيد بفعالية جودة السياق الطويل لتكون قريبة من أداء FP16 الكامل دون التضحية بكفاءة الاستدلال منخفض البت.

المؤلفون الأصليون: Joe Sharratt

نُشر 2026-05-25
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Joe Sharratt

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول قراءة رواية ضخمة مكونة من 100,000 صفحة للإجابة على سؤال واحد فقط. للقيام بذلك، يتعين على عقلك (النموذج الذكي - AI) أن ينظر إلى كل صفحة قرأها حتى الآن للعثور على الأدلة المناسبة. عملية "النظر إلى الوراء" هذه تسمى الانتباه (Attention).

المشكلة هي أنه كلما زاد طول الكتاب، زاد الجهد المبذول للنظر إلى الوراء بشكل انفجاري. إذا كان الكتاب مكوناً من 100 صفحة، فالأمر سهل. أما إذا كان 100,000 صفحة، فإن العقل سيصبح مثقلاً ويتباطأ حتى يتوقف تماماً.

المعضلة الحالية: السرعة مقابل الدقة

لجعل العملية أسرع، حاول المهندسون استخدام نسخة "مختصرة" من الكتاب. فبدلاً من قراءة كل كلمة بدقة عالية (مثل FP16، وهي عالية الجودة ولكنها بطيئة)، قرروا قراءة كل شيء بنسخة باهتة ومنخفضة الدقة (مثل FP4، وهي سريعة جداً ولكنها تفقد التفاصيل).

  • المشكلة: عندما تقرأ كتاباً من 100,000 صفحة بلغة مختصرة وباهتة، تبدأ في فقدان التفاصيل الحاسمة. يصاب الذكاء الاصطناعي بالارتباك، ويرتكب الأخطاء، وتنخفض جودة إجاباته بشكل كبير.
  • الحل القديم: حاول البعض ببساطة تخطي قراءة صفحات معينة بالكامل (التناثر - Sparsity). ولكن إذا تخطيت الصفحة الخاطئة، فستفقد الإجابة تماماً، ولا يمكنك استعادة تلك المعلومة لاحقاً.

الحل الجديد: ThriftAttention

يقترح مؤلفو هذه الورقة البحثية حلاً وسطاً ذكياً يسمى ThriftAttention. فكر فيه كاستراتيجية "التمييز بين الدقة العالية والمنخفضة".

إليك التشبيه:
تخيل أنك محقق تراجع شريط مراقبة ضخم لشارع مزدحم في مدينة ما (السياق الطويل).

  1. استراتيجية التغبيش (FP4): تشاهد الشريط بأكل بوضع التسريع، وبصورة باهتة. أنت توفر الوقت، لكنك قد تفقد وجه المشتبه به.
  2. استراتيجية Thrift: تشاهد الشريط بالكامل بوضع التسريع والصورة الباهتة، ولكن لديك مساعد ذكي يمكنه رصد الـ 5% الأكثر أهمية من الشريط فوراً (مثل شخص يركض أو حادث سيارة).
  3. السحر: بالنسبة لتلك اللحظات المحددة (الـ 5%)، يقوم المساعد فوراً بالتحويل إلى الدقة العالية (FP16). أما بالنسبة للـ 95% المتبقية من الشارع الفارغ والممل، فيبقى في الوضع الباهت.

كيف يعمل (السر الخفي)

تدعي الورقة البحثية أن ليست كل أجزاء "الانتباه" متساوية في الأهمية.

  • الاكتشاف: وجد المؤلفون أن "التغبيش" (خطأ التكميم - quantization error) لا يضر الذكاء الاصطناعي حقاً إلا عندما ينظر إلى الروابط الأكثر أهمية بين الكلمات. وهذه الروابط عادة ما تكون التفاعلات "الصاخبة" أو "الهامة".
  • الإصلاح: قاموا ببناء قاعدة سريعة وخفيفة الوزن (Heuristic) تعمل مثل كشاف الضوء. تقوم بمسح الروابط وتقول: "مهلاً، هذا التفاعل المحدد مهم! لنستخدم الكاميرا عالية الجودة لهذا الجزء".
  • النتيجة: يتم حساب 95% من العمل في الوضع الباهت والسريع، و5% فقط في الوضع عالي الجودة والبطيء.

لماذا يهم هذا الأمر؟

اختبرت الورقة البحثية هذا الأسلوب على سياقات طويلة جداً (تصل إلى 131,000 كلمة) باستخدام نماذج ذكاء اصطناعي مختلفة. وإليكم ما وجدوه:

  • السرعة: إنه سريع تقريباً مثل طريقة (FP4) التي تعتمد على التغبيش الكامل.
  • الجودة: يستعيد حوالي 89% من الجودة التي كنت ستحصل عليها لو استخدمت الطريقة عالية الجودة والبطيئة لكل شيء.
  • النقطة المثالية: كلما طال النص، زادت فعالية هذه الطريقة. في الكتب الطويلة جداً، تفشل طريقة "التغبيش" فشلاً ذريعاً، لكن ThriftAttention يحافظ على جودة عالية لأنه يركز ميزانية "الدقة العالية" المحدودة لديه بالضبط حيث تشتد الحاجة إليها.

باختًاصار

ThthriftAttention يشبه امتلاك ميزانية لمشاهدة "الدقة العالية". فبدلاً من محاولة مشاهدة الفيلم بأكمله بدقة عالية (وهو أمر بطيء جداً) أو مشاهدته بأكمله بدقة منخفضة (وهو أمر باهت جداً)، فإنه ينتقل بذكاء إلى الدقة العالية فقط في المشاهد الأكثر درامية. هذا يسمح للذكاء الاصطناعي بقراءة الكتب الضخمة بسرعة دون أن يفقد تركيزه، مما يقدم إجابات شبه مثالية بسرعة البرق.

ملاحظة: تركز الورقة البحثية حصرياً على جعل عملية استنتاج الذكاء الاصطناعي (قراءة/توليد النصوص) أسرع وأكثر دقة. وهي لا تدعي أنها تعمل لتدريب نماذج جديدة أو للتطبيقات الطبية/السريرية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →