← أحدث الأبحاث
🤖 AI

Qrita: High-performance Top-k and Top-p using Pivot-based Truncation and Selection

تقدم الورقة البحثية Qrita، وهو خوارزمية عالية الأداء وحتمية لأخذ عينات Top-k وTop-p للمفردات الكبيرة، تستخدم تقنيات التقطيع والاختيار القائمة على المحور لتحقيق تحسن في الإنتاجية يصل إلى 1.4 ضعفاً وتقليلاً في الذاكرة بنسبة 50% مقارنة بنواة وحدات معالجة الرسومات الحالية، مما أدى إلى اعتماده كأداة أخذ العينات الافتراضية في vLLM.

المؤلفون الأصليون: Jongseok Park, Sunga Kim, Alvin Cheung, Ion Stoica

نُشر 2026-05-27
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Jongseok Park, Sunga Kim, Alvin Cheung, Ion Stoica

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك طاهٍ يدير مطبخاً ضخماً (نموذج لغوي كبير) يحتوي على مخزن به 100,000 مكون مختلف (المفردات). في كل مرة تحتاج فيها إلى طهي طبق ما (توليد كلمة)، يتعين عليك اختيار أفضل بضعة مكونات من هذا المخزن العملاق لضمان أن الوجبة ستكون لذيذة ولكن ليست مملة.

في عالم الذكاء الاصطناعي، تسمى عملية الاختيار هذه Top-k (اختيار أفضل k من المكونات) و Top-p (اختيار أصغر مجموعة من المكونات التي تشكل "درجة نكهة" معينة).

المشكلة: المطبخ البطيء والمزدحم

حالياً، تتعامل معظم المطابخ مع هذا الأمر عن طريق سكب جميع المكونات الـ 100,000 على طاولة ضخمة، ثم ترتيبها حسب "درجة الطعم" من الأفضل إلى الأسوأ، ثم التقاط المكونات الأعلى جودة.

  • المشكلة: ترتيب 100,000 عنصر هو أمر بطيء وفوضوي. إنه يستهلك مساحة هائلة من سطح العمل (الذاكرة) ويجعل يدي الطاهي تتعبان (العبء الحسابي).
  • البديل: يحاول بعض الطهاة فقط التقاط حفنة عشوائية من المكونات التي قد تكون جيدة. لكن هذا أمر محفوف بالمخاطر؛ فأحياناً قد تفوتك أفضل المكونات، وأحياناً أخرى قد تخرج الطبخة بشكل مختلف في كل مرة تطبخ فيها (غير حتمي)، وهذا أمر سيء إذا كنت بحاجة لتكرار وصفة بدقة.

الحل: Qrita (مساعد الطاهي الذكي)

يقدم البحث Qrita، وهو طريقة جديدة عالية السرعة لاختيار المكونات. فكر في Qrita كمساعد طاهٍ ذكي للغاية يستخدم خدعتين بارعتين لتجنب عملية الفرز الفوضوية تماماً.

الخدعة الأولى: "التقليم الغاوسي لسيجما" (مرشح الضجيج)

تخيل أنه في مخزن المكونات الذي يحتوي على 100,000 عنصر، هناك 99,000 عنصر هي مجرد "ضجيج" (مثل الملح والسكر والدقيق، وكلها لها طعم باهت متشابه تقريباً). هناك فقط بضع مئات من "المكونات النجمية" (مثل الزعفران أو الكمأة).

بدلاً من النظر في كل جرة على حدة، يقوم Qrita باختبار شم سريع. يحسب متوسط الطعم و"درجة التوابل" (الانحراف المعياري) للمخزن. ثم يرسم خطاً: "أي شيء تحت هذا الخط هو مجرد ضجيج؛ لا نحتاج للنظر إليه."

  • النتيجة: يتخلص فوراً من 99% من المخزن، تاركاً حوالي 200 جرة مثيرة للاهتمام فقط. يحدث هذا في تمريرة واحدة سريعة كالبرق.

الخدعة الثانية: "البحث الرباعي المحوري" (التقسيم الرباعي)

الآن، أصبح لدى الطاهي كومة صغيرة تضم 200 مكون مثير للاهتمام. لا يزال يتعين عليه العثور على أفضل 50 بالضبط.

  • الطريقة القديمة: التحقق واحداً تلو الآخر (بطيء جداً) أو تقسيم الكومة إلى نصفين (البحث الثنائي).
  • طريقة Qrita: بدلاً من تقسيم الكومة إلى نصفين، يقوم Qrita بتقسيمها إلى أربعة أقسام في آن واحد. يسأل: "هل أفضل مكون موجود في الربع الأول، أم الثاني، أم الثالث، أم الرابع؟"
  • الميزة الإضافية: لديه أيضاً قاعدة خاصة لـ المكونات المتكررة. إذا كانت ثلاث جرات من "الزعفران" لها نفس الدرجة تماماً، فإن Qrita يعرف بالضبط عدد الجرات التي يجب الاحتفاظ بها لضمان أن الوصفة متطابقة في كل مرة (حتمي). هذا يمنع الطاهي من العلق في حلقة مفرغة أثناء محاولة اتخاذ قرار بين جرات متطابقة.

لماذا يهم هذا الأمر (النتائج)

قام المؤلفون ببناء Qrita باستخدام أداة متخصصة تسمى Triton (لغة لبرمجة بطاقات الرسوميات/GPUs) واختبروه مقابل أفضل الطرق الحالية المستخدمة في محركات الذكاء الاصطنا_ي الكبرى مثل vLLM و SGLang.

  • السرعة: Qrita أسرع بمقدار يصل إلى 1.4 مرة في سيناريوهات الخدمة الواقعية، وما يصل إلى مرتين في اختبارات السرعة الخام.
  • الذاكرة: يستخدم نصف الذاكرة لأنه لا يحتاج لتخزين القائمة المرتبة بالكامل لـ 100,000 عنصر.
  • الدقة: على عكس بعض الطرق السريعة التي تعتمد على التخمين، يعطيك Qrita نفس النتيجة تماماً التي تعطيها طريقة الترتيب البطيئة والمثالية. إنه لا يغير المخرجات؛ بل يجدها فقط بشكل أسرع بكثير.

الخلاصة

Qrita يشبه الترقية من طاهٍ يقوم بفرز كل توابل العالم يدوياً إلى مساعد ذكي يتجاهل الأشياء المملة فوراً، ويقسم الأشياء المثيرة للاهتمام إلى أربع كومات في آن واحد، ويتعامل مع المكونات المتكررة بشكل مثالي. إنه يجعل توليد الذكاء الاصطناعي أسرع وأكثر كفاءة دون تغيير جودة الإجابات.

ملاحظة: يذكر البحث أن Qrita أصبح الآن الطريقة الافتراضية لمسار وحدة معالجة الرسومات (GPU) في vLLM، وهي أداة شهيرة لتشغيل نماذج الذكاء الاصطناعي، والكود متاح للآخرين لاستخدامه.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →