← أحدث الأبحاث
🤖 machine learning

OrpQuant: Geometric Orthogonal Residual Projection for Multiplier-Free Power-of-Two Transformer Quantization

تقدم هذه الورقة البحثية OrpQuant، وهو إطار عمل للكمية من نوع "قوى العدد اثنين" (Power-of-Two) خالٍ من عمليات الضرب، يستخدم "إسقاط المتبقي المتعامد الهندسي" للتغلب على انخفاض الدقة الزاوية للشبكات اللوغاريتمية، مما يتيح النشر الفعال وعالي الدقة للنماذج اللغوية الكبيرة (LLMs) والنماذج الرؤيوية المحولة (ViTs) على الأجهزة الطرفية مع تقليل وقت المعايرة والتعقيد العتادي بشكل كبير.

المؤلفون الأصليون: Maoyang Xiang, Bo Wang, Tao Luo

نُشر 2026-05-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Maoyang Xiang, Bo Wang, Tao Luo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول وضع منحوتة ثلاثية الأبعاد ضخمة ومعقدة (نموذج ذكاء اصطناعي عملاق) داخل صندوق كرتوني صغير ومسطح (جهاز طرفي مثل هاتف ذكي أو طائرة بدون طيار). المشكلة هي أن المنحوتة كبيرة جداً، والأدوات التي تستخدمها عادةً لتقليص حجمها (العمليات الرياضية القياسية) ثقيلة وبطيئة جداً بالنسبة لهذا الصندوق الصغير.

تقدم هذه الورقة البحثية طريقة جديدة تسمى ORP (الإسقاط المتبقي المتعامد - Orthogonal Residual Projection) لحل هذه المشكلة. إليك كيف تعمل، مشروحة من خلال تشبيهات بسيطة:

1. المشكلة: "المسطرة" مكسورة

تستخدم معظم نماذج الذكاء الاصطناعي الكثير من عمليات الضرب الثقيلة (مثل آلة حاسبة معقدة) لتعمل. ولجعل هذه النماذج تتناسب مع الأجهزة الصغيرة، يحاول العلماء "تكميمها" (Quantization) — أي ببساطة تقريب الأرقام لجعلها أبسط.

تجادل الورقة بأن الطريقة الحالية لجعل هذه الأرقام بسيطة (المعروفة باسم القوى لعدد 2 أو PoT) تشبه استخدام مسطرة لا تحتوي إلا على علامات عند 1، 2، 4، 8، و16.

  • العيب: إذا حاولت قياس شيء قيمته "3"، فستضطر لتقريبه إلى 2 أو 4. وإذا حاولت قياس شيء قيمته "6"، فستقربه إلى 4 أو 8.
  • النتيجة: في الفضاء عالي الأبعاد (حيث يعيش الذكاء الاصطناعي)، يخلق هذا "فجوات" ضخمة في الاتجاه. الأمر يشبه محاولة تحديد اتجاه البوصلة باستخدام الشمال والشرق والجنوب والغرب فقط؛ إذا كنت بحاجة للتوجه نحو الشمال الشرقي، فستضطر للتخمين وستخطئ في الاتجاه. تسمي الورقة هذا بـ "نظام دقة الزوايا المنخفضة". هنا يفقد الذكاء الاصطناعي إحساسه بالاتجاه، وتنخفض درجة ذكائه.

2. الحل: خريطة "الخطوتين"

بدلاً من محاولة حشر المنحوتة في مسطرة واحدة مكسورة، يستخدم ORP خريطة ذكية مكونة من خطوتين.

  • الخطوة 1: المرساة الرئيسية (الأساس الأولي): يختار أقرب علامة قياسية على المسطرة المكسورة (على سبيل المثال "4").
  • الخطوة 2: التصحيح (المتبقي): يدرك قائلاً: "مهلاً، الرقم الحقيقي كان 4.5". بدلاً من الاستسلام، يقوم بحساب الفرق (المتبقي) ويجد اتجاهاً ثانياً متعامداً لوصف هذا الجزء المفقود.
  • السحر: من خلال الجمع بين المرساة الرئيسية واتجاه "التصحيح" الثاني، يمكنه وصف الرقم بدقة أعلى بكثير، رغم أنه لا يزال يستخدم نفس قواعد "القوى لعدد 2" البسيطة.

فكر في الأمر كإعطاء التعليمات:

  • الطريقة القديمة: "اذهب شمالاً". (قد تخطئ هدفك إذا كنت بحاجة للذهاب نحو الشمال-الشمال الشرقي).
  • طريقة ORP: "اذهب شمالاً، ثم خذ خطوة صغيرة شرقاً". لقد استخدمت فقط اتجاهات بسيطة، لكن الجمع بينهما يجعلك أقرب بكلاً إلى الهدف.

3. الأجهزة (Hardware): لا عمل شاق

عادةً، لإصلاح أخطاء التقريب هذه، تحتاج الحواسيب إلى عمليات رياضية معقدة (الضرب) وهي بطيئة وتستهلك الكثير من البطارية.

  • خدعة ORP: نظرًا لأنه يستخدم أرقام "القوى لعدد 2"، لا يحتاج الكمبيوتر إلى الضرب على الإطلاق. يحتاج فقط إلى إزاحة البتات (تحريكها يساراً أو يميناً) وجمعها.
  • التشبيه: تخيل مصنعاً. الطريقة القديمة تستخدم رافعة ضخمة وثقيلة (المُضاعِف) لتحريك كل صندوق، وهي عملية بطيئة وتأخذ مساحة. يستبدل ORP الرافعة بسير ناقل بسيط وإنسان يدفع الصناديق (الإزاحة والجمع). إنه أسرع، ويستهلك طاقة أقل، ويناسب غرفة أصغر.

4. النتائج: سريعة ودقيقة

اختبر المؤلفون هذه الطريقة على نوعين من الذكاء الاصطناعي:

  • نماذج اللغة (LLMs): مثل نموذج LLaMA-2 الشهير.
  • نماذج الرؤية (ViTs): الذكاء الاصطناعي الذي يرى الصور.

ما وجدوه:

  • سرعة الإعداد: عادةً، يستغرق إصلاح هذه النماذج ساعات من "المعايرة" (التدريب). أما ORP فيقوم بذلك في حوالي 15 دقيقة. إنه يشبه حل لغز فوراً بدلاً من قضاء اليوم بأكم له.
  • الدقة: حتى مع الدقة المنخفضة جداً (3 بت أو 4 بت)، يحافظ ORP على ذكاء النموذج. فهو يعمل بشكل يقارب الطرق الثقيلة والبطيئة، ولكن دون الحاجة إلى أجهزة معقدة.
  • سرعة الأجهزة: عندما قاموا بمحاكاة تصميم الشريحة، وجدوا أنه بسبب إزالة أجزاء "المُضاعِف" الثقلة، يمكن للشريحة أن تعمل بسرعة أكبر بكثير (2.85 جيجاهرتز) دون ارتفاع في درجة الحرارة أو حدوث اختناقات في تدفق البيانات.

ملخص

ORP هو طريقة جديدة لتقليص أحجام نماذج الذكاء الاصطناعي الضخمة لتعمل على الأجهزة الصغيرة. بدلاً من استخدام رياضيات ثقيلة وبطيئة، يستخدم خدعة هندسية تجمع بين اتجاهين بسيطين للحصول على إجابة دقيقة. هذا يجعل الذكاء الاصطناعي أسرع، وأكثر كفاءة في استهلاك الطاقة، وأسرع بكثير في الإعداد، وكل ذلك دون الحاجة إلى أجهزة معقدة للمضاعفة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →