← أحدث الأبحاث
🤖 machine learning

FairyFuse: Multiplication-Free LLM Inference on CPUs via Fused Ternary Kernels

يُعد FairyFuse نظام استدلال يعتمد على وحدة المعالجة المركزية (CPU) يحقق تنفيذاً خالياً من عمليات الضرب وتسريعاً في النواة بمقدار 29.6 ضعفاً عبر دمج عمليات الأوزان الثلاثية في حلقة AVX-512 واحدة، مما يتيح توليد نماذج لغوية كبيرة (LLMs) عالي الإنتاجية وشبه خالٍ من الفقد على الأجهزة الشائعة دون عمليات ضرب للأعداد العائمة.

المؤلفون الأصليون: Fei Zuo, Xiaoyan Xi, Quanyi Zeng, Feiyu Wang, Ho Fai Leung

نُشر 2026-04-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Fei Zuo, Xiaoyan Xi, Quanyi Zeng, Feiyu Wang, Ho Fai Leung

البحث الأصلي مُهدى إلى الملك العام بموجب CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). ✨ هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح ورقة FairyFuse البحثية، مترجمة إلى لغة بسيطة مع تشبيهات إبداعية.

المشكلة الكبرى: "الازدحام المروري" في حاسوبك

تخيل أنك تحاول قيادة شاحنة ضخمة (نموذج لغوي كبير - LLM) عبر مدينة. الشاحنة مليئة بحمولة ثقيلة (أوزان النموذج أو معرفته).

في معظم الحواسيب، يكون المحرك (CPU) قوياً، لكن الطرق (نطاق عرض الذاكرة - Memory Bandwidth) ضيقة ومزدحمة. في كل مرة تحتاج فيها الشاحنة لاتخاذ قرار (توليد كلمة)، يتعين عليها التوقف عند مستودع، لتفريغ صندوق ثقيل، ثم حمله إلى المحرك، وإجراء بعض العمليات الحسابية، ثم إعادته مكانه.

المشكلة هي أن العمليات الحسابية ثقيلة جداً. تقضي الشاحنة وقتاً في انتظار وصول الحمولة أكثر مما تقضيه في القيادة الفعلية. لهذا السبب يكون تشغيل الذكاء الاصطناعي على لابتوب عادي أو خادم (Server) بطيئاً في كثير الغالب؛ فالحاسوب عالق في ازدحام مروري ناتج عن نقل الكثير من البيانات.

الحل القديم: "إلغاء التكميم" (فك الصناديق)

سابقاً، لجعل هذه النماذج أصغر حجماً، استخدم الباحثون تقنية التكميم (Quantization). فكر في هذا الأمر كأنك تقوم بتعبئة الحمولة الثقيلة في صناديق أصغر وأخف وزناً.

  • العائق: رغم أن الصناديق أصبحت أصغر، إلا أن الحاسوب لا يزال مضطراً لفكها إلى شكلها الأصلي الثقيل قبل أن يتمكن من إجراء العمليات الحسابية. الأمر يشبه شراء رف كتب جاهز للتركيب (Flat-pack): أنت توفر مساحة أثناء الشحن، لكنك لا تزال بحاجة لقضاء وقت في "تجميعه" قبل أن تتمكن من استخدامه.
  • النتيجة: أنت توفر المساحة، لكنك لا توفر الكثير من الوقت لأن عملية "التجميع" (فك الصناديق وضرب الأرقام) لا تزال تستغرق وقتاً طويلاً جداً.

الفكرة الجديدة: "الأوزان الثلاثية" (المفتاح السحري)

تقدم الورقة نموذجاً يسمى Fairy2i يستخدم الأوزان الثلاثية (Ternary Weights).
بدلاً من وجود أرقام مثل 3.14 أو -2.5، تكون هذه الأوزان ثلاثة أشياء فقط: +1، أو -1، أو 0.

  • التشبيه: تخيل أنك تطبخ.
    • الحساب العادي: عليك قياس 3.14 أكواب من الدقيق بدقة. هذا يتطلب ميزاناً وآلة حاسبة (عملية الضرب).
    • الحساب الثلاثي: لديك ثلاثة خيارات فقط: "أضف كوباً"، "اطرح كوباً"، أو "لا تفعل شيئاً".
    • الفائدة: لم تعد بحاجة إلى ميزان أو آلة حاسبة بعد الآن. أنت فقط تقلب مفتاحاً. إذا كان (+1)، فأنت تضيف. إذا كان (-1)، فأنت تطرح. وإذا كان (0)، فأنت تتجاهله. لقد ألغيت الحاجة إلى عملية الضرب تماماً.

الابتكار: "FairyFuse" (خط التجميع)

هذا هو الجزء المعقد. يستخدم النموذج بنية "خطية واسعة" (widely-linear)، مما يعني أنه لكل عملية حسابية واحدة، يتعين على الحاسوب في الواقع القيام بـ ثماني عمليات فرعية صغيرة.

إذا أخبرت الحاسوب للقيام بهذه الخطوات الثمانية واحدة تلو الأخرى، فسيكون الأمر بطيئاً لأنه سيستمر في الذهاب والعودة إلى المستودع لجلب نفس المكونات (البيانات) مراراً وتكراراً.

FairyFuse هو خط التجميع العبقري الذي يحل هذه المشكلة:

  1. الدمج (Fusion): بدلاً من إرسال الشاحنة 8 مرات، يقوم بتحميل الشاحنة مرة واحدة ويقوم بالعمليات الثماني كلها في حلقة واحدة فائقة السرعة.
  2. العمليات المقنعة (Masked Operations): يستخدم تعليمات خاصة للمعالج (مثل المفتاح الرئيسي) ليخبر الحاسوب: "أضف المكونات فقط حيث يكون المفتاح في وضع التشغيل (ON)، واطرح حيث يكون في وضع الإيقاف (OFF)".
  3. لا يوجد فك للطرود: لا يقوم أبداً بفك الصناديق. بل يبقيها في حالتها الصغيرة والمضغوطة ويعالجها مباشرة.

النتائج: لماذا يغير هذا كل شيء؟

اختبر المؤلفون هذا على خادم Intel قياسي (معالج عام - Commodity CPU، أي حاسوب عادي وليس شريحة ذكاء اصطناعي باهظة الثمن).

  • السرعة: إنه أسرع بـ 30 مرة من الطريقة القديمة لإجراء العمليات الحسابية على المعالج (CPU).
  • المقارنة: يتفوق على المعيار الصناعي الحالي (llama.cpp) بمقدار 1.24 ضعفاً، رغم أنه يستخدم ذاكرة أقل.
  • الجودة: الذكاء الاصطناعي ذكي تماماً مثل النسخة الكاملة. لم يصبح "أغبى" بسبب الضغط.
  • المفاجأة: من المثير للدهشة أن هذا يعمل بشكل أفضل على المعالجات (CPUs) مقارنة بمعالجات الرسوميات (GPUs).
    • لماذا؟ معالجات الرسوميات (GPUs) تشبه الطرق السريعة ذات النطاق العريض الضخم؛ فهي لا تهتم كثيراً بالازدحام المروري. أما المعالجات (CPUs) فهي مثل شوارع المدينة الضيقة. ومن خلال جعل "الصناديق" أصغر جداً وإزالة خطوة "التجميع"، يقوم FairyFuse بتفريغ الازدحام المروري في المعالج (CPU) بشكل مثالي. أما في معالج الرسومي (GPU)، فإن الطريق سريع بالفعل لدرجة أن تصغير حجم الصناديخ لا يساعد كثيراً، كما أن تعليمات "قلب المفتاح" الخاصة ليست بنفس الكفاءة هناك.

الملخص

FairyFuse هو طريقة جديدة لتشغيل الذكاء الاصطناعي على الحواسيب العادية. يأخذ نموذجاً، ويختصر العمليات الحسابية إلى خطوات بسيطة هي "أضف، اطرح، أو تجاهل"، ويبني خط تجميع فائق الكفاءة لمعالجتها دون القيام بعمليات ضرب معقدة أبداً.

التشبيه:

  • الطريقة القديمة: سائق توصيل يتوقف عند كل منزل لوزن الطرد، وحساب الضريبة، ثم تسليمه. (حسابات ثقيلة وبطيئة).
  • FairyFuse: سائق توصيل يعرف بالضبط أي المنازل تحتاج إلى طرد، وأيها يحتاج إلى إرجاع، وأيها لا يحتاج لشيء. يقود عبر الحي بأقصى سرعة، يضع الطرود أو يستلمها بناءً على قائمة بسيطة، دون أن يتوقف أبداً للقيام بأي عمليات حسابية.

هذا يسمح لنا بتشغيل مساعدين أذكياء بقدرات هائلة على أجهزة اللابتوب والخوادم الخاصة بنا دون الحاجة إلى حواسيب فائقة ضخمة وباهظة الثمن.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →