← أحدث الأبحاث
💬 NLP

Mix-Quant: Quantized Prefilling, Precise Decoding for Agentic LLMs

يُعد Mix-Quant إطار عمل للكمية (quantization) مدركاً للمراحل، يعمل على تسريع استنتاج النماذج اللغوية الكبيرة الوكيلية (agentic LLM) عبر تطبيق كمية NVFP4 عالية الإنتاجية على مرحلة التعبئة المسبقة (prefilling) كثيفة الحوسبة، مع الحفاظ على دقة BF16 لمرحلة فك الترميز (decoding)، مما يحقق تسريعاً يصل إلى 3 أضعاف دون تدهور كبير في الأداء.

المؤلفون الأصليون: Haiquan Lu, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang

نُشر 2026-05-21
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Haiquan Lu, Zigeng Chen, Gongfan Fang, Xinyin Ma, Xinchao Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مساعداً ذكياً للغاية (عميل ذكاء اصطنا-ي) يساعدك في حل المشكلات المعقدة. وللقيام بعمله، لا يكتفي هذا المساعد بالدردشة فحسب؛ بل يقرأ أدلة ضخمة، ويبحث في الويب، ويتذكر المحادثات السابقة، ويستخدم أدوات مثل الآلات الحاسبة أو محررات الأكواد.

تعالج ورقة بحثية بعنوان "Mix-Quant" مشكلة محددة: هذا المساعد يغرق في كمية القراءة الهائلة التي يتعين عليه القيام بها قبل أن يبدأ في التحدث.

إليك التفاصيل باستخدام تشبيهات بسيطة:

1. المشكلة: عدم التوازن بين "القراءة والكتابة"

فكر في عمل الذكاء الاصطناعي كعملية مكونة من خطوتين:

  • الخطوة أ (التحضير - Prefilling): "مرحلة القراءة". يقرأ الذكاء الاصطناعي كومة ضخمة من المستندات والتعليمات والتاريخ دفعة واحدة لفهم السياق. هذا يشبه طالباً يقرأ كتاباً مدرسياً من 500 صفحة قبل الامتحان. يتطلب هذا الكثير من القدرة الذهنية (الحوسبة) ولكنه يحدث دفعة واحدة.
  • الخطوة ب (التوليد - Decoding): "مرحلة الكتابة". يقوم الذكاء الاصطناعي بتوليد الإجابة، كلمة بكلمة. هذا يشبه الطالب الذي يكتب مقالاً. يحدث هذا ببطء، كلمة تلو الأخرى، ويعتمد بشكل كبير على الذاكرة.

عنق الزجاجة: في المهام "الوكيلية" (حيث يستخدم الذكاء الاصطناعي الأدوات ويتذكر الأشياء)، تكون "مرحلة القراءة" (الخطوة أ) غالباً أطول بمئات المرات من "مرحلة الكتابة" (الخطوة ب). يقضي الذكاء الاصطناعي معظم وقته في مجرد قراءة النص، مما يجعل هذا الجزء هو الجزء البطيء من العملية.

2. الحل الفاشل: "نظارات القراءة السريعة"

حاول الباحثون جعل الذكاء الاصطناعي أسرع عن طريق وضع "نظارات قراءة سريعة" عليه (وهي تقنية تسمى الكمية - Quantization). يتضمن ذلك تبسيط الأرقام التي يستخدمها الذكاء الاصطنا-ي للتفكير، وتحويل الرياضيات عالية الدقة إلى رياضيات منخفضة الدقة.

  • النهج الموحد: حاولوا وضع هذه النظارات على الذكاء الاصطنا-ي لكل من القراءة والكتابة.
  • النتيجة: بينما أصبح الذكاء الاصطنا-ي أسرع في القراءة، بدأ يرتكب أخطاءً سخيفة أثناء الكتابة. نظرًا لأن الذكاء الاصطنا-ي يكتب كلمة بكلمة، فإن خطأً صغيراً في الكلمة الأولى يمكن أن يتراكم ليصبح إجابة خاطئة تماماً في النهاها. كان الأمر يشبه طالباً قرأ الكتاب بسرعة ولكنه نسي التفاصيل، مما أدى إلى مقال سيء.

3. الحل الجديد: "Mix-Quant" (استراتيجية هجينة)

أدرك المؤلفون أن المرحلتين لهما احتياجات مختلفة. اقترحوا Mix-Quant، الذي يعامل المرحلتين بشكل مختلف:

  • بالنسبة لـ "مرحلة القراءة" (التحضير - Prefilling): يستخدمون "نظارات القراءة السريعة" (NVFP4).
    • لماذا؟ الذكاء الاصطنا-ي يقوم فقط بمعالجة كتلة ثابتة من النص. حتى لو كانت الرياضيات مبسطة قليلاً، فإن الأخطاء لا "تتراكم" لأن النص لا يتغير. يمكن للذكاء الاصطنا-ي قراءة السياق الضخم بشكل أسرع بكثير دون فقدان الكثير من الدقة.
  • بالنسبة لـ "مرحلة الكتابة" (التوليد - Decoding): ينزعون النظارات ويحتفظون بـ "الرؤية عالية الدقة" (BF16).
    • لماذا؟ عندما يقوم الذكاء الاصطنا-ي بتوليد الكلمات واحدة تلو الأخرى، فإنه يحتاج إلى الدقة. خطأ صغير هنا يغير الكلمة التالية، والتي تغير الكلمة التي تليها، وهكذا. الحفاظ على الدقة في هذه المرحلة يضمن أن تكون الإجابة النهائية صحيحة ومستقرة.

4. التشبيه: طاقم البناء

تخيل طاقم بناء يبني منزلاً:

  • "القراءة" (التحضير) هي الفريق الذي يعاين الأرض ويقرأ المخططات. هذا عمل شاق. تقول Mix-Quant: "لنستخدم رافعة ضخمة وسريعة الحركة (NVFP4) لنقل جميع المخططات والمواد بسرعة. لا يهم إذا كانت الرافعة أقل دقة قليلاً، طالما أن المواد تصل بسرعة".
  • "الكتابة" (التوليد) هي فريق وضع الطوب فعلياً. تقول Mix-Quant: "الآن، انتقلوا إلى البنّاء الماهر ذو الأيدي الثابتة (BF16). نحن بحاجة إلى دقة مثالية هنا. إذا كانت الطوبة مائلة قليلاً، فقد ينهار الجدار بأكمله".

5. النتائج

من خلال دمج هذين النهجين، تزعم الورقة البحثية ما يلي:

  • السرعة: أصبحت مرحلة "القراءة" أسرع بمقدار 2 إلى 3 مرات.
  • الدقة: لا يزال الذكاء الاصطنا-ي يعمل بشكل جيد تقريباً مثل النسخة الأصلية البطيئة وعالية الدقة. لم يفقد "ذكاءه" أو يبدأ في اتخاذ قرارات سيئة.
  • الكفاءة: لقد حل مشكلة عنق الزجاجة في المهام الطويلة والمعقدة دون كسر قدرة الذكاء الاصطنا-ي على التفكير بوضوح.

باختصار: Mix-Quant هي طريقة ذكية لتسريع وكلاء الذكاء الاصطنا-ي من خلال السماح لهم بـ "القراءة السريعة" للسياق الضخم الذي يحتاجون لفهمه، مع إجبارهم على "الإبطاء والتدقيق" عندما يقومون بالفعل بتوليد الإجابة. هذا يحافظ عليهم سريعين دون جعلهم أغبياء.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →