← أحدث الأبحاث
💻 computer science

Unlocking the Edge deployment and ondevice acceleration of multi-LoRA enabled one-for-all foundational LLM

تقدم هذه الورقة إطار عمل مدركاً للعتاد يتيح النشر الفعال لنماذج LLaMA التأسيسية المدعومة بـ multi-LoRA على أجهزة Samsung Galaxy S24/S25 عبر دمج تبديل المهام الديناميكي، وفك التشفير متعدد المسارات، وفك التشفير الذاتي التخميني الديناميكي (Dynamic Self-Speculative Decoding) لتحقيق انخماثات كبيرة في الذاكرة وزمن الاستجابة مع الحفاظ على الدقة عبر لغات ومهام متعددة.

المؤلفون الأصليون: Sravanth Kodavanti, Sowmya Vajrala, Srinivas Miriyala, Utsav Tiwari, Uttam Kumar, Utkarsh Kumar Mahawar, Achal Pratap Singh, Arya D, Narendra Mutyala, Vikram Nelvoy Rajendiran, Sharan Kumar Allur, Eun
نُشر 2026-04-22
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Sravanth Kodavanti, Sowmya Vajrala, Srinivas Miriyala, Utsav Tiwari, Uttam Kumar, Utkarsh Kumar Mahawar, Achal Pratap Singh, Arya D, Narendra Mutyala, Vikram Nelvoy Rajendiran, Sharan Kumar Allur, Euntaik Lee, Dohyoung Kim, HyeonSu Lee, Gyusung Cho, JungBae Kim

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك عقل روبوت فائق الذكاء ومتعدد اللغات (نموذج لغوي كبير أو LLM) يعيش في السحابة. إنه عبقري، لكنه ضخم، وبطيء الاستدعاء، ويتطلب اتصالاً بالإنترنت. الآن، تخيل تقليص حجم ذلك العقل ليناسب هاتفك الذكي، مما يجعله يعمل فوراً، وبخصوصية، ودون الحاجة لشبكة Wi-Fi. هذا هو التحدي الهندسي الهائل الذي تحله هذه الورقة البحثية.

لقد توصل الباحثون في سامسونج إلى كيفية حشر ذكاء اصطناعي يشبه "السكين السويسري" داخل هاتفك (تحديداً في Galaxy S24 وS25) يمكنه التعامل مع مهام مختلفة في وقت واحد، والتبديل بينها فوراً، وحتى الكتابة بـ "شخصيات" مختلفة في آن واحد.

إليك كيف فعلوا ذلك، مشروحاً من خلال تشبيهات بسيطة:

1. مشكلة "عقل واحد، قبعات متعددة"

عادةً، إذا أردت من روبوت أن يتحدث الفرنسية، ويكتب قصيدة، ويدقق قواعدك اللغوية، فقد تحتاج إلى ثلاثة روبوتات مختلفة أو ثلاث نسخ مختلفة من نفس الروبوت. هذا يستهلك مساحة كبيرة من هاتفك.

الحل: قاموا ببناء "عقل واحد ثابت" (النموذج الأساسي) وصنعوا ثماني "قبعات" مختلفة (تسمى LoRAs) يمكن ارتداؤها وخلعها فوراً.

  • الطريقة القديمة: لتبديل القبعات، كان عليك إيقاف الروبوت، وإخراج العقل بالكامل، واستبداله بآخر، ثم البدء من جديد.
  • الطريقة الجديدة: يحتفظ الروبوت بنفس العقل. أنت فقط تعطيه "قبعة" مختلفة (ملف بيانات صغير) أثناء تشغيله. سيعرف الروبوت فوراً: "أوه، أنا أرتدي قبعة 'الأسلوب المهذب' الآن"، أو "الآن أنا أرتدي قبعة 'مدقق القواعد'". لا إعادة تشغيل ولا إعادة تحميل.

2. "المطبخ المتوازي" (فك التشفير متعدد المسارات - Multi-Stream Decoding)

تخ den أنك طباخ (الذكاء الاصطناعي) وطلب منك زبون وصفة ما. لكنه يريد رؤية ثلاث نسخ في وقت واحد: واحدة "رسمية"، وواحدة "ودية"، وواحدة "مرحة".

  • الطريقة القديمة: يطبخ الطباخ النسخة الرسمية، ثم يقدمها. ثم ينظف مكان العمل ويطبخ النسخة الودية. ثم النسخة المرحة. هذا يستغرق وقتاً طويلاً.
  • الطريقة الجديدة: يدرك الطباخ أن الخطوة الأولى لجميع الوصفات هي نفسها (تقطيع البصل). لذا، يقطع البصل مرة واحدة، ولكن بعد ذلك يقسم الطبخ إلى ثلاث مقالي متوازية. يطبخ جميع الأساليب الثلاثة في نفس الوقت في تمريرة واحدة.
  • النتيجة: بدلاً من الانتظار 8 ثوانٍ للحصول على 8 أساليب مختلفة، تحصل عليها جميعها في ثانية واحدة. تسمي الورقة البحثية هذا "فك التشفير متعدد المسارات"، وهو ما يجعل الذكاء الاصطناعي أسرع بـ 6 مرات لهذه المهام.

3. لعبة التخمين بـ "الكرة البلورية" (فك التشفير التخميني - Speculative Decoding)

عندما يكتب الذكاء الاصطناعي جملة، فإنه عادة يكتب كلمة بكلمة، ويراجع عمله بعد كل كلمة. هذا بطيء، مثل كاتب يتوقف بعد كل كلمة ليفحص القاموس.

  • الطريقة الجديدة: أعطى الباحثون الذكاء الاصطناعي "كرة بلورية" (تقنية تسمى Dynamic Self-Speculative Decoding). ينظر الذكاء الاصطناعي للأمام ويخمن الكلمتين أو الثلاث القادمة فوراً.
  • العملية: يكتب كتلة الكلمات كاملة بسرعة. ثم يقوم بـ "فحص سريع" ليرى ما إذا كانت التخمينات صحيحة. إذا كانت كذلك، فهذا رائع! يستمر في العمل. إذا لم تكن كذلك، فإنه يصحح الكلمات الخاطئة فقط.
  • النتيجة: الأمر يشبه الكتابة باستخدام نص تنبؤي جيد جداً لدرجة أنه يكتب جملًا كاملة نيابة عنك، وأنت فقط تتحقق منها. هذا جعل الذكاء الاصطناعي أسرع بمقدار 2.3 مرة في توليد النصوص.

4. "تعبئة الحقيبة" (الكمية والتحسين - Quantization & Optimization)

نموذج الذكاء الاصطناعي الكامل يشبه حقيبة سفر ضخمة وثقيلة لا تتسع في حقيبة يد صغيرة (ذاكرة هاتفك).

  • الحيلة: لم يرمِ الباحثون الملابس (الذكاء)؛ بل قاموا فقط بطيها بشكل أكثر إحكاماً. لقد ضغطوا ذاكرة النموذج من تنسيق "32-بت" الثقيل إلى تنسيق "4-بت" خفيف الوزن (مثل تحويل معطف صوفي إلى طبقة حرارية رقيقة وعالية التقنية).
  • الأجهزة: قاموا أيضاً بإعادة ترتيب "المطبخ" داخل معالج الهاتف (NPU) بحيث يمكن للذكاء الاصطناعي استخدام أدوات الهاتف الموجودة (التي تُستخدم عادةً للصور) للقيام بالعمليات الحسابية بشكل أسرع بكثير.

الخلا الخط النهائي

من خلال الجمع بين هذه الحيل، تمكن الفريق من:

  1. توفير المساحة: يتناسب الذكاء الاصطناعي مع هاتفك دون استهلاك كل مساحة التخزين لديك.
  2. توفير الوقت: يستجيب فوراً، حتى عند التبديل بين اللغات أو المهام.
  3. العمل دون اتصال: لا تحتاج إلى الإنترنت لاستخدام هذه الميزات الذكية.

باختصار: لقد حولوا سوبر كمبيوتر ضخماً، بطيئاً، ومعتمداً على السحابة، إلى مساعد رشيق، فوري، بحجم الجيب، يمكنه ارتداء العديد من القبعات والتحدث بلغات عديدة في آن واحد. هذه هي التقنية التي تدعم ميزات "Galaxy AI" في أحدث هواتف سامسونج.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →