← أحدث الأبحاث
⚛️ quantum physics

Qupertino: Pure MLX Array Kernels versus Hand-Tuned Metal Shaders for Quantum Circuit Simulation on Apple Silicon

تقدم الورقة البحثية Qupertino، وهو محاكي لدوائر الكم مفتوح المصدر مخصص لمعالجات Apple Silicon، والذي يوضح كيف تتفوق مظللات Metal المصممة يدويًا بشكل كبير على عمليات مصفوفات MLX البحتة، محققةً تسريعًا يصل إلى 95 ضعفًا مقارنة بالمحاكيات الحالية القائمة على المعالجات المركزية (CPU) ومعالجات الرسوميات (GPU)، مع الحفاظ على الدقة التامة عبر مختلف أعباء العمل الكمومية المتنوعة.

المؤلفون الأصليون: Shlomo Kashani

نُشر 2026-09-18
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Shlomo Kashani

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

لفهم العمل المعروض هنا، يجب على المرء أولاً أن يستوعب طبيعة التحدي الذي يواجه الحوسبة الكمومية الحديثة. الحواسيب الكمومية ليست مجرد نسخ أسرع من الآلات التي نستخدمها اليوم؛ فهي تعمل وفق مجموعة مختلفة تماماً من القواعد الفيزيائية، حيث تعالج المعلومات بطريقة تسمح لها باستكشاف احتمالات كثيرة في آن واحد. ولأن هذه الآلات لا تزال في مراحلها الأولى، وهي عرضة للأخطاء ومحدودة الحجم، يعتمد العلماء بشكل كبير على الحواسيب الكلاسيكية لمحاكاة كيفية سلوكها. وتعد هذه المحاكاة أداة بالغة الأهمية لاختبار الخوارزميات ومعايرة الأجهزة الحقيقية. ومع ذلك، فإن محاكاة نظام كمومي أمر صعب للغاية لأن كمية المعلومات المطلوبة لوصفه تنمو بشكل انفجاري مع كل جسيم مضاف. فالمحاكاة لنظام يتكون من خمسة وعشرين جسيماً فقط تتطلب من الحاسوب تتبع مجموعة هائلة من الأرقام، وهي مهمة تدفع حتى أقوى الحواسيب الفائقة إلى أقصى حدودها. وقد ظل السؤال قائماً لفترة طويلة عما إذا كانت الجيل الأحدث من الحواسيب الاستهلاكية، وتحديداً تلك التي تستخدم رقائق آبل المخصصة، يمكنها التعامل مع هذا العبء بكفاءة، وإذا كان الأمر كذلك، فما مقدار تلك القوة النابعة من البرمجيات الذكية مقابل هندسة الأجهزة الخام.

لقد عالج أحد الباحثين هذا الأمر ببناء أداة محاكاة جديدة تسمى "كيوبرتينو" (Qupertino)، مصممة خصيصاً لمعالجات "آبل سيليكون" (Apple Silicon). وتتميز هذه المعالجات بأنها تستخدم بنية ذاكرة موحدة، مما يعني أن المعالج المركزي ومعالج الرسوميات يتشاركان نفس حوض الذاكرة دون الحاجة إلى نسخ البيانات ذهاباً وإياباً بينهما. هذا التصميم يزيل عقبة كبيرة توجد في الحواسيب التقليدية، حيث يؤدي نقل كميات كبيرة من البيانات بين بنوك ذاكرة منفصلة إلى إبطاء كل شيء. أراد الباحث معرفة المدى الذي يمكنهم الوصول إليه باستخدام الأدوات البرمجية القياسية عالية المستوى المتاحة على هذه الرقائق فقط، وكم من الأداء الإضافي يمكن اكتسابه من خلال كتابة كود برمجي مخصص ومنخفض المستوى مصمم خصيصاً لاستغلال أقصى قدرات معالج الرسوميات. وقد وضع نصب عينيه مقارنة نهجين: أحدهما يعتمد كلياً على عمليات المصفوفات القياسية، والآخر يدمج تعليمات مصممة يدوياً لاستخراج كل قطرة سرعة من الأجهزة.

كشفت الدراسة أن النهج القياسي، رغم كونه مثيراً للإعجاب، يترك قدراً كبيراً من الأداء دون استغلال. فعندما قام الباحث بتشغيل عمليات المحاكاة الخاصة به باستخدام عمليات المصفوفات القياسية فقط، كان البرنامج بالفعل أسرع من الأدوات الموجودة التي تعمل على المعالجات المركزية. ومع ذلك، عندما قام بتمكين المستوى الثاني من نظامه — وهو استخدام تعليمات مخصصة ومصقولة يدوياً لمعالج الرسوميات — زادت السرعة بشكل هائل. ففي بعض المهام المعقدة، مثل محاكاة تحويل فورييه المستخدم في العديد من الخوارزميات الكمومية، كان النسخة المصقولة يدوياً أسرع بنحو خمسة وتسعين ضعفاً من الأدوات القياسية القائمة على المعالج، وأسرع بنحو مئة ضعف من برنامج المحاكاة "بيني لين" (PennyLane). وفي سيناريوهات أخرى، مثل محاكاة تطور الأنظمة المغناطيسية، كان النهج المخصص لا يزال أسرع بأكثر من ثلاثين ضعفاً. وقد قام الباحث بقياس هذه النتائج بعناية، من خلال تشغيل نفس الاختبارات مراراً وتكراراً على نفس الجهاز لضمان أن الاختلافات حقيقية وليست مجرد تقلبات عشوائية. ووجد أن النهج المصقول يدوياً كان الأسرع من حيث متوسط وقت التشغيل في جميع خلايا المقارنة الثمانية عشر، وإن كان في دوائر معينة قليلة الكثافة مثل "بحث غروفر" عند 25 كيوبت، فقد تعادل إحصائياً مع خط الأساس الخاص بالمعالج المركزي، وفي أصغر الدوائر قليلة البوابات عند 15 كيوبت، ظلت خطوط الأساس الخاصة بالمعالج المركزي أسرع.

يكمن مفتاح فجوة الأداء هذه في كيفية تعامل البرمجيات مع هيكل الدوائر الكمومية. يتعامل النهج القياسي مع كل بوابة، أو عملية، بطريقة عامة نوعاً ما، حتى عندما تتبع العديد من تلك البوابات نمطاً يمكن التنبؤ به. أما النهج المصقول يدوياً، فيتعرف على هذه الأنماط. فعلى سبيل المثال، عندما تقوم سلسلة من العمليات بمجرد تدوير طور الحالة الكمومية، يقوم الكود المخصص بحساب ذلك في مسار واحد انسيابي بدلاً من معالجة كل خطوة على حدة. وبالمثل، عندما تتضمن المحاكاة تبديل مواقع الجسيمات أو تطبيق نوع معين من التحويلات الرياضية، يقوم الكود المخصص بتجميع هذه الإجراءات معاً لتنفيذها ككتلة واحدة موحدة. يشبه هذا الأمر سائق توصيل، بدلاً من التوقف عند كل منزل في الشارع لإسقاط طرد واحد، يقوم بتحميل جميع الطرود الخاصة بهذا الشارع ويقوم بتوصيلها في رحلة واحدة فعالة. ومن خلال التعرف على هذه الأنماط واستغلالها، يقلل الكود المخصص من عدد المرات التي يتعين فيها على الحاسوب الوصول إلى ذاكرته، وهو الجزء الأكثر استهلاكاً للوقت في العملية.

وعلى الرغم من مكاسب السرعة الهائلة هذه، فقد حرص الباحث على ضمان أن الكود المخصص لا يغير النتائج. لقد بنى نظاماً يكتشف تلقائياً متى تتوافق الدائرة مع نمط يمكن تحسينه ويوجهها إلى الكود المخصص، بينما يترك كل شيء آخر ليعمل على المسار القياسي. وقد تحقق من أن نتائج الكود المخصص تطابق الكود القياسي تماماً، حتى أصغر علامة عشرية. وهذا يعني أن المستخدمين يمكنهم الحصول على سرعة الكود المخصص دون التضحية بالدقة. كما تدعم الأداة مجموعة واسعة من الخوارزميات الكمومية، بما في ذلك تلك المستخدمة في التحسين، والبحث، ومحاكاة التفاعلات الكيميائية. بل إنها تتضمن طريقة لمحاكاة أنظمة تصل إلى مئة وخمسين جسيماً، بشرط ألا تكون تلك الأنظمة شديدة التشابك، وهو إنجاز سيكون مستحيلاً باستخدام النهج القياسي على نفس الأجهزة.

تشير النتائج إلى أنه بينما تعتبر الأجهزة الاستهلاكية الحديثة قوية بما يكفي لتشغيل عمليات محاكاة كمومية متطورة، إلا أن البرمجيات التي تعمل عليها يجب أن تكون متطورة بنفس القدر لإطلاق كامل إمكاناتها. توفر الذاكرة الموحدة في "آبل سيليكون" أساساً متيناً، حيث تلغي الحاجة إلى نسخ البيانات، ولكن السرعة الحقيقية تأتي من كتابة كود يفهم الهيكل المحدد للمشكلة. لقد أثبت الباحث أن المحاكي المكتوب بالعمليات القياسية البحتة هو أداة قابلة للتطبيق، ولكنه يترك فجوة في الأداء تتراوح بين خمسة وعشرين إلى ثلاثة وثلاثين ضعفاً مقارنة بالنسخة التي تستخدم التعليمات المصقولة يدوياً. وهذه الفجوة ليست فشلاً في الأجهزة، بل هي تذكير بأنه في عالم الحوسبة عالية الأداء، غالباً ما يتطلب المسار الأكثر كفاءة فهماً عميقاً لبنية الآلة. يوفر هذا العمل خارطة طريق واضحة لكيفية بناء محاكيات أسرع للجيل القادم من التجارب الكمومية، موضحاً أن الجمع بين الذاكرة الموحدة والكود المصاغ بعناية يمكن أن يدفع حدود ما هو ممكن على جهاز كمبيوتر مكتبي واحد.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →