← أحدث الأبحاث
🤖 AI

Silicon Showdown: Performance, Efficiency, and Ecosystem Barriers in Consumer-Grade LLM Inference

تقدم هذه الورقة تحليلاً تجريبياً منهجياً يقارن بين معالجات "إنفيديا بلاك ويل" (Nvidia Blackwell) و"أبل سيليكون" (Apple Silicon لاستنتاج النماذج اللغوية الكبيرة الموجهة للمستهلكين، كاشفةً أنه في حين توفر "إنفيديا" إنتاجية فائقة عبر تقنيات التكميم المتقدمة على حساب قيود وقت التشغيل المعقدة ومحدودية ذاكرة الوصول العشوائي للفيديو (VRAM)، فإن بنية الذاكرة الموحدة من "أبل" تتيح التنفيذ الفعال للنماذج الضخمة بكفاءة طاقة وقابلية توسع أفضل بشكل ملحوظ.

المؤلفون الأصليون: Allan Kazakov, Abdurrahman Javat

نُشر 2026-05-04
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Allan Kazakov, Abdurrahman Javat

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تريد تشغيل عقل ذكاء اصطناعي ضخم وذكي للغاية (نموذج لغوي كبير) على جهاز الكمبيوتر الخاص بك في المنزل. قبل بضع سنوات، كانت هذه العقول الاصطناعية صغيرة وسهلة الحجم بحيث يمكن وضعها في حقيبة ظهر. ولكن اليوم، نمت لتصبح مثل ناطحات السحاب، حيث تزن ما يصل إلى 70 أو حتى 80 مليار "عصبون".

هذه الورقة البحثية هي "مواجهة" بين أكبر لاعبين في مجال الأجهزة الاستهلاكية: Nvidia (ملوك السرعة الخام) و Apple (أسياد سعة الذاكرة). اختبر المؤلفون هذه الأنظمة لمعرفة من يمكنه تشغيل هذه العقول الاصطناعية العملاقة فعليًا دون أن تتعطل، أو تتباطأ، أو تتسبب في صهر جهاز الكمبيوتر الخاص بك.

إليك تفصيل نتائجهم باستخدام تشبيهات بسيطة:

1. النهجان المختلفان: سيارة السباق مقابل شاحنة النقل

فكر في بنيات الأجهزة المختلفة كنوعين من المركبات المصممة لحمل حمولة ثقيلة (نموذج الذكاء الاصطناعي).

  • Nvidia (سيارة السباق): بطاقات الرسوميات من Nvidia (مثل RTX 5090 الجديدة) تشبه سيارات السباق عالية الأداء. لديها محركات ضخمة (قدرة حوسبية) ويمكنها الانطلاق بسرعة هائلة. ومع ذلك، فإن صندوق أمتعتها صغير جدًا (VRAM). إذا كان نموذج الذكاء الاصطناعي الخاص بك كبيرًا جدًا بحيث لا يتسع في ذلك الصندوق، فسيتعين عليك ترك أجزاء منه في المرآب (ذاكرة الكمبيوتر الرئيسية) والعودة ذهابًا وإيابًا للحصول عليها. هذا "الذهاب والإياب" (إرسال البيانات عبر ناقل PCIe) بطيء للغاية ويقتل سرعتك.
  • Apple (شاحنة النقل): رقائق Apple (سلسلة M) تشبه شاحنة نقل ضخمة ذات مستودع بضائع موحد. المحرك والتخزين موجودان في مكان واحد. لا يوجد "ذهاب وإياب". إذا كان لديك شاحنة كبيرة (مثل M3 Ultra بذاكرة 96 جيجابايت)، يمكنك تحميل كامل العقل الاصطناعي داخل الشاحنة دفعة واحدة. قد لا تكون سيارة سباق، لكنها تستطيع حمل الحمولة كاملة دون توقف.

2. "جدار الـ VRAM": الخيار المدمر

وجدت الورقة أنه بالنسبة لمستخدمي Nvidia، فإن تشغيل نموذج ذكاء اصطناعي ضخم يضعك في سيناريو "اختر سمّك" المروع، وهو ما يسميه المؤلفون جدار الـ VRAM:

  • الخيار (أ): النسخة "الغبية". تقوم بتقليص نموذج الذكاء الاصطناعي كثيرًا (باستخدام ضغط شديد) لكي يتسع تمامًا في الصندوق الصغير. يعمل بسرعة، لكن الذكاء الاصطناعي يصبح "أغبى" ويرتكب المزيد من الأخطاء لأنك سحقت دماغه ليناسب المساحة.
  • الخيار (ب): النسخة "البطيئة". تحافظ على ذكاء النموذج (ضغط أقل)، ولكن بما أنه لا يتسع، يتعين عليك ترك أجزاء منه في المرآب. يجب على الكمبيوتر نقل البيانات باستمرار ذهابًا وإيابًا. النتيجة؟ يعمل الذكاء الاصطناعي أبطأ بنسبة 90%. الأمر يشبه محاولة الجري في ماراثون وأنت تحمل حقيبة ظهر مليئة بالطوب.

حل Apple: نظرًا لأن "شاحنة النقل" الخاصة بـ Apple كبيرة جدًا، يمكنك تحميل النسخة الذكية وغير المضغوطة من العقل الاصطناعي بالكامل داخل الشاحنة. لا يوجد نقل للبيانات ذهابًا وإيابًا، ولا "تقليل للذكاء". إنه يعمل ببساطة، رغم أنه ليس بسرعة سيارة السباق عندما تكون الحمولة صغيرة.

3. "ثنائية الخلفية": فخ البرمجيات

اكتشفت الورقة مشكلة برمجية مربكة في جانب Nvidia، والتي يسمونها ثنائية الخلفية (Backend Dichotomy).

تخيل أنك اشتريت محركًا جديدًا فائق السرعة (تنسيق NVFP4 الجديد من Nvidia). تتوقع أن يكون أسرع بمقدار 1.6 مرة من المحرك القديم.

  • الخبر الجيد: إذا استخدمت برنامج التشغيل "PyTorch"، فإنه يعمل! ستحصل على تلك الزيادة الهائلة في السرعة.
  • الخبر السيئ: إذا استخدمت برنامج التشغيل "C++" (الذي وثق به الكثيرون سابقًا)، فإن المحرك الجديد لا يعمل تقريبًا. في الواقع، هو أبطأ من الإعداد القديم.

الأمر يشبه شراء سيارة فيراري ثم تكتشف أنك إذا لم تستخدم مفتاحًا محددًا وجديدًا تمامًا، فلن تعمل السيارة بشكل صحيح. هذا يخلق "احتكاكًا في النظام البيئي"؛ حيث يتعين على المستخدمين القيام بجهد إضافي فقط لجعل الأجهزة تعمل كما هو معلن عنها.

4. مفاجأة "كفاءة الطاقة"

عندما نظر المؤلفون في كمية الكهرباء المستخدمة لتوليد كلمة واحدة (token)، فازت Apple بفارق هائل.

  • Nvidia: للحصول على الكثير من الكلمات، تستهلك سيارة السباق الكثير من الوقود. إنها قوية ولكنها شرهة.
  • Apple: شاحنة النقل هذه فعالة بشكل مثير للدهشة. وجدت الورقة أن M3 Ultra من Apple أكثر كفاءة في استهلاك الطاقة بمقدار 23 مرة من RTX 5090 من Nvidia.

هذا يعني إذا كنت تريد تشغيل ذكاء اصطناعي على جهاز لاب توب طوال اليوم دون استنزاف البطارية أو الحاجة إلى مروحة تبريد ضخمة، فإن Apple هي الفائز الواضح.

5. خلل "نضج البرمجيات"

من المثير للاهتمام أن الورقة وجدت أن أحدث أجهزة Nvidia (RTX 5090) كانت في الواقع أبطأ في بدء التشغيل من الطراز الأقدم (RTX 4090).

فكر في الأمر كسيارة رياضية جديدة عالية التقنية لديها نظام تشغيل معقد. السيارة القديمة البسيطة تعمل فورًا. أما السيارة الجديدة فتستغرق وقتًا أطول لـ "تسخن" لأن البرامج (التعريفات) لم تتعلم بعد كيفية التعامل مع المحرك الجديد. الأجهزة جاهزة، لكن البرمجيات لا تزال تحاول اللحاق بها.

الحكم النهائي: من يفوز؟

تخلص الورقة إلى أنه لا يوجد جهاز واحد "أفضل". الأمر يعتمد على ما تحتاجه:

  • اختر Nvidia إذا كنت: تحتاج إلى سرعة خام للنماذج الأصغر (أقل من 30 مليار بارامتر) وكنت مستعدًا لتعقيد إدارة تعريفات البرامج وحدود الذاكرة. إنها "ملك السرعة".
  • اختر Apple إذا كنت: تريد تشغيل أكبر نماذج الذكاء الاصطناعي وأكثرها ذكاءً (70B إلى 80B بارامتر) محليًا دون أن تتعطل أو تتباطأ. إنها "ملك السعة" و"ملك الكفاءة".

باختصار: Nvidia هي لمن يريد الانطلاق بسرعة في مضمار صغير. Apple هي لمن يحتاج إلى حمل حمولة ضخمة عبر البلاد دون نفاد الوقود.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →