Divide et Impera quantum neural networks for modular hybrid computing architectures
تقترح هذه الورقة بروتوكول تدريب جديداً يعتمد على مبدأ "فرق تسد" للشبكات العصبية الكمومية، يقوم بتفكيكها إلى مكونات أصغر قابلة للتحسين للتغلب على القيود الحالية للأجهزة، مما يثبت فعاليته في مهام التنبؤ بالطاقة والبيئة الواقعية ضمن بنى حوسبة هجينة نمطية.
المؤلفون الأصليون:Emanuele Casciaro, Fabio Mascherpa, Alfonso Amendola, Filippo Caruso
يواجه العالم حالياً مفارقة في مجال الحوسبة. فمن ناحية، لدينا أجهزة حاسوب فائقة القدرة تستهلك طاقة هائلة وأنظمة ذكاء اصطناعي أصبحت صعبة الاستدامة بشكل متزايد. ومن ناحية أخرى، انفتحت آفاق جديدة مع الحوسبة الكمومية، وهي تقنية تعد بحل مشكلات لا تستطيع الآلات الكلاسيكية لمسها. ومع ذلك، فإن الحواسيب الكمومية المتاحة اليوم لا تزال في مهدها؛ فهي هشة، وعرضة للأخطاء الناتجة عن الضوضاء البيئية، ولا يمكنها استيعاب إلا كمية ضئيلة جداً من المعلومات في آن واحد. وهذا يخلق عنق زجاجة: فالخوارزميات الكمومية الأكثر قوة غالباً ما تتطلب أجهزة أكثر استقراراً وذاكرة أكبر مما هو موجود حالياً. ويجد الباحثون أنفسهم يتساءلون كيف يمكن تسخير إمكانات ميكانيكا الكم للمهام الواقعية، مثل التنبؤ بحركة المرور أو مراقبة البيئة، دون انتظار أجهزة مثالية قد يستغرق وصولها سنوات. وتكمن الإجابة ليس في انتظار آلات أفضل، بل في تغيير كيفية استخدامنا لما نملكه بالفعل.
اقترح فريق من الباحثين من جامعة فلورنسا وشركة إيني (Eni S.p.A) طريقة جديدة لتدريب هذه الأنظمة الكمومية الهشة، وهي استراتيجية يسمونها "فرق تسد". فبدلاً من محاولة إجبار حاسوب كمومي واحد ضخم على حل مشكلة معقدة دفعة واحدة — وهو أمر غالباً ما يؤدي إلى الفشل بسبب الضوضاء ومحدودية الذاكرة — يقومون بتفكيك المشكلة إلى قطع أصغر يمكن إدارتها. تخيل أنك تحاول حمل أريكة ثقيلة وغير متناسقة عبر درج ضيق؛ سيكون من المستحيل تقريباً القيام بذلك كقطعة واحدة. ولكن إذا استطعت تفكيك الأريكة إلى أجزائها الفردية، وحمل كل جزء على حدة، ثم إعادة تجميعها في الأعلى، فستصبح المهمة ممكنة. هذا هو جوهر نهجهم. فهم يأخذون مجموعة بيانات كبيرة، مثل المعلومات المتعلقة بمحطات شحن المركبات الكهربائية أو جودة الهواء العالمية، ويقسمونها إلى مجموعات فرعية أصغر. تتم معالجة كل مجموعة فرعية بواسطة دائرة كمومية صغيرة وبسيطة تكون أقل عرضة لارتكاب الأخطاء. تعمل هذه الدوائر الصغيرة في حساباتها بشكل مستقل، ثم يتم دمج نتائجها بواسطة حاسوب كلاسيكي قياسي لتشكيل تنبؤ نهائي.
اختبر الباحثون هذه الطريقة على تحديين متميزين من واقع الحياة. تضمن التحدي الأول التنبؤ بحالة 91 محطة لشحن المركبات الكهربائية في باريس. تضمنت البيانات الوقت من اليوم، واليوم من الأسبوع، والموقع المحدد للمحطة، والعدد الحالي للمقابس المستخدمة. أما التحدي الثاني فكان التنبؤ بمؤشر جودة الهواء العالمي لست مدن مختلفة، باستخدام قياسات لملوثات متنوعة مثل أول أكسيد الكربون والأوزون. وفي كلتا الحالتين، قارن الفريق نموذجهم الكمومي القائم على استراتيجية "فرق تسد" ضد النماذج الكلاسيكية التقليدية وضد نموذج كمومي واحد كبير يحاول معالجة جميع البيانات دفعة واحدة. وكانت النتائج كاشفة. ففي حالة محطات الشحن، تفوق نهج التقسيم على تطبيقات كلاسيكية محددة، بما في ذلك نموذج "ترانسفورمر" (transformer) تسلسلي والنموذج الكلاسيكي القياسي، مع استخدام عدد أقل بكثير من المعلمات (parameters)، مما يعني أنه كان أقل عرضة لـ "الفرط في التخصيص" (overfitting) للبيانات. كما أثبت أنه أكثر استقراراً من النموذج الكمومي الواحد الكبير، الذي عانى في إيجاد مسار واضح عبر البيانات. وحتى عندما قام الباحثون بمحاكاة ظروف الضوضاء في الأجهزة الكمومية الحقيقية، أظهر النموذج المجزأ قدرة على الصمود، رغم حدوث تدهور ملحوظ في الأداء: فبينما حقق النموذج المثالي الخالي من الضوضاء درجة 53.86، أدت إضافة ضوضاء قلب البت (bit-flip noise) إلى رفع درجة الخطأ إلى 68، بينما رفعت ضوضاء إزالة الاستقطاب (depolarizing noise) الدرجة إلى 60.8. ورغم هذا الانخفاض، ظل أداء النموذج المجزأ قابلاً للمقارنة مع الحلول الخالية من الضوضاء والكلاسيكية، مما أظهر درجة من التخفيف من حدة الأخطاء.
قدمت تجربة جودة الهواء عقبة مختلفة. نظرًا لأن البيانات كانت معقدة للغاية والميزات كانت متشابكة بعمق، لم يستطع الباحثون ببساطة تقسيم البيانات دون فقدان معناها. ولحل ذلك، استخدموا أولاً تقنية رياضية لإعادة ترتيب البيانات في تنسيق جديد حيث تكون العوامل المختلفة مستقلة عن بعضها البعض. وبمجرد إعادة تنظيم البيانات، طبقوا استراتيجية التقسيم الخاصة بهم. وعلى الرغم من أن النماذج الكمومية في هذه المهمة المحددة لم تتفوق على أفضل النماذج الكلاسيكية، إلا أن التجربة أثبتت أن الطريقة يمكن تطبيقها على مشكلات كان يُعتقد سابقاً أنها صعبة التفكيك. وهذا يشير إلى أن النهج مرن بما يكفي للتعامل مع أنواع مختلفة من البيانات، بشرما تم تجهيز البيانات بشكل صحيح. وتشير الدراسة إلى أن هذا التصميم المعياري يعد مساراً قابلاً للتطبيق في تعلم الآلة الكمومي، مما يسمح للباحثين بمعالجة مشكلات أكبر وأكثر تعقيداً اليوم دون الحاجة لانتظار الجيل القادم من المعالجات الكمومية.
تمتد آثار هذا العمل إلى ما هو أبعد من مجرد الأرقام المحققة في التجارب. فمن خلال إثبات أن مهمة كبيرة يمكن توزيعها عبر دوائر كمومية صغيرة متعددة، أظهر الباحثون طريقة لتجاوز القيود الحالية لعدد الكيوبتات (qubits) والضوضاء. يسمح هذا النهج بمشاركة العمل الحسابي، مما قد يمكّن معالجات كمومية مختلفة من العمل بالتوازي، متصلة بروابط عالية السرعة. إنه ينقل التركيز من بناء آلة واحدة ضخمة يمكنها فعل كل شيء، إلى بناء شبكة من الوحدات الأصغر والمتخصصة التي تعمل معاً. لا تدعي الدراسة أنها حلت مشكلة الضوضاء الكمومية أو أنها ابتكرت خواروارزمية مثالية، بل إنها تقدم مبدأ تصميم عملي: من خلال إبقاء الدوائر الكمومية صغيرة وبسيطة، وترك المهمة الثقيلة للحواسيب الكلاسيكية في دمج النتائج، يمكننا جعل تعلم الآلة الكمومي حقيقة واقعة الآن. يشير هذا النهج إلى أن مستقبل الحوسبة الهجينة قد لا يتعلق بجعل الحواسيب الكمومية أكبر، بل بجعلها تعمل معاً بطرق أكثر ذكاءً ومعيارية.
تواجه التعلم الآلي الكمومي (QML) عقبات كبيرة في عصر الأجهزة الكمومية ذات المقياس المتوسط المشوبة بالضجيج (NISQ). وبينما تقدم النماذج الهجينة (الكمومية-الكلاسيكية) وعوداً، إلا أنها مقيدة بالقيود المادية، وتحديداً الضجيج وعدد محدود من الكيوبتات. غالباً ما يؤدي تدريب الدوائر الكمومية التباينية (VQC) الكبيرة إلى ظاهرة "الهضاب القاحلة" (barren plateaus)، حيث تتلاشى التدرجات بشكل أسي مع زيادة عدد الكيوبتات، مما يجعل التحسين غير فعال. علاوة على على ذلك، تتناسب تكاليف التدريب خطياً مع عدد المعلمات بسبب الحاجة إلى تقييمات متعددة للدوائر لحساب التدرج. تعتمد الحلول الحالية غالباً على افتراضات محددة لهيكل الدائرة أو تقلل من أبعاد المشكلة عبر اختيار الميزات، مما قد يؤدي إلى فقدان مفرط للمعلومات. هناك نقص في الطرق العامة والقابلة للتوسع لتدريب الشبكات العصبية الكمومية الهجينة على مشكلات أكبر دون تدهور أداء النموذج أو طلب سجلات كمومية ضخمة بشكل باهظ.
المنهجية
يقترح المؤلفون بروتوكول تدريب يعتمد على مبدأ "فرق تسد" (divide-et-impera) للشبكات العصبية الكمومية الهجينة (QNNs). يقوم هذا النهج بتفكيك مهمة تعلم كمومية كبيرة إلى مشكلات فرعية أصغر يمكن إدارتها ومعالجتها بواسطة دوائر كمومية تباينية (VQC) مستقلة وأصغر حجماً.
البنية الأساسية
تفكيك الميزات: يتم تقسيم متجه المدخلات x∈RN إلى k من المجموعات الفرعية بناءً على مجموعات الفهارس {Ij}.
المعالجة الكمومية المتوازية: تتم معالجة كل مجموعة فرعية xIj بواسطة VQCj مخصص وأصغر حجماً مع عدد أقل من الكيوبتات (qi<Q). وهذا يتجنب التركيز الأسي للتدرجات المرتبط بالدوائر الكبيرة.
إعادة البناء: يتم دمج المخرجات (التضمينات الكمومية) من جميع الدوائر الفرعية.
المعالجة الكلاسيكية اللاحقة: يقوم "مدرك متعدد الطبقات" (MLP) كلاسيكي ضحل بمعالجة التضمينات المدمجة لإنتاج التنبؤ النهائي y^.
التعامل مع البيانات غير القابلة للتفكيك
بالنسبة لمجموعات البيانات التي لا يمكن فصل ميزاتها بشكل طبيعي (مثل الميزات العالمية عالية الارتباط)، يقدم المؤلفون خطوة معالجة مسبقة باستخدام تحليل المكونات الرئيسية (PCA). يقوم PCA بتحويل البيانات إلى فضاء جديد تكون فيه الميزات مستقلة خطياً، مما يسمح باستخدام اختيار "النافذة المنزلقة" للمجموعات الفرعية لتغذية الدوائر الفرعية. يتيح هذا النهج التطبيق في الإعدادات العامة، وإن كان ذلك على حساب عبء معالجة مسبقة طفيف.
تصميم الدائرة
الترميز: يُستخدم ترميز الزاوية (Angle encoding) لربط بيانات المدخلات بالحالات الكمومية.
المنهج (Ansatz): تستخدم الطبقات التباينية دورات بزاوية واحدة لكل كيوبت مع بوابات CNOT للجيران الأقرب لإنشاء التشابك.
إعادة رفع البيانات: تتبع الدوائر مخطط إعادة رفع البيانات (على غرار الوصلات القافزة في الشبكات العصبية الكلاسيكية) لتعزيز القدرة التعبيرية.
القياس: يتم قياس القيمة المتوقعة ⟨Z⟩ لكل كيوبت لتوليد التضمين.
الإعداد التجريبي
تم اختبار المنهجية في مهمتين للتنبؤ من واقع الحياة باستخدام PennyLane وPyTorch:
حالة محطات شحن المركبات الكهربائية (EV):
المهمة: التنبؤ بحالة الإشغال لـ 91 محطة شحن في باريس بناءً على التاريخ السابق، والزمن، وبيانات الموقع.
التفكيك: تم تقسيم الميزات طبيعياً إلى تاريخ الحالة، والاتجاهات الزمنية، والإحداثيات المكانية.
التقييم: استخدمت دالة تسجيل مركبة (معيار L1) لتقييم التنبؤات على مستويات المحطة، والمنطقة، والمدينة. كما تم اختبار القدرة على تحمل الضجيج باستخدام قنوات التحلل (depolarizing) وقلب البت (bit-flip) لمحاكاة معدلات الخطأ في معالجات IBM QPU.
التنبؤ العالمي لمؤشر جودة الهواء (AQI):
المهمة: التنبؤ بجودة الهواء في أوروبا بناءً على تركيزات الملوثات (CO, CO2, NO2, SO2, O3, PM2.5, PM10) عبر ست مدن.
التفكيك: نظراً لتعقيد الميزات العالي، تم تطبيق PCA لإنشاء مجموعات ميزات مستقلة للدوائر الفرعية.
التقييم: تم استخدام متوسط الخطأ المطلق (MAE) للمقارنة مع نماذج MLP القياسية ونماذج QNN الموحدة.
النتائج الرئيسية
محطات شحن المركبات الكهربائية
الأداء: حقق نموذج "فرق تسد" الهجين المقترح درجة 53.86، متفوقاً على كل من نموذج المحولات الكلاسيكي المتسلسل (57.58) والنموذج الكلاسيكي القياسي (65.03).
الكفاءة: استخدم النموذج الكمومي عدداً أقل بكثير من المعلمات (≈4⋅104) مقارنة بالنموذج الكلاسيكي المتسلسل (≈3⋅106)، مما قلل من مخاطر الإفراط في التخصيص (overfitting).
القدرة على تحمل الضجيج: في الأنظمة المشوبة بالضجيج، أظهر النموذج متانة. وبينما تدهور الأداء (درجات 60.8 للضجيج التحللي و68 لضجيج قلب البت)، ظلت النتائج قابلة للمقارنة مع الحلول الخالية من الضجيج والكلاسيكية، مما يشير إلى أن استراتيجية التفكيك توفر درجة من تخفيف الخطأ.
المقارنة: تفوق النهج المفكك على متغيرات "الحالة الموحدة" (Unified State) والمتغيرات "المتسلسلة" (Sequential) الكمومية، مما يشير إلى أن عزل المعلومات الزمنية في دوائر متميزة ينتج تمثيلات أكثر مرونة.
جودة الهواء العالمية
الأداء: في هذا الإعداد المعقد وغير القابل للتفكيك، تراجعت الحلول القائمة على الكم خلف الحلول الكلاسيكية.
دور PCA: تم تحديد تطبيق معالجة PCA المسبقة كعامل تمكين حاسم، مما سمح بتطبيق نهج "فرق تسد" في الإعدادات العامة حيث يستحيل الفصل المباشر للميزات. وقد أثبت هذا مدى مرونة الطريقة، وإن كان ذلك مع عبء معالجة مسبقة طفيف.
الأهمية والادعاءات
يزعم البحث المساهمة في تقديم مبدأ تصميم قابل للتعميم للتعلم الآلي الكمومي (QML) يعالج مشكلات القابلية للتوسع والتدريب في أجهزة NISQ الحالية.
القابلية للتوسع: من خلال توزيع الحوسبة عبر دوائر أصغر، تسمح هذه الطريقة بتدريب النماذح على مشكلات أكبر دون الحاجة إلى سجل كمومي واحد وضخم.
كفاءة الموارد: يقلل هذا النهج من عمق وعرض الدوائر الكمومية، مما يخفف من تراكم الضجيج وآثار الهضاب القاحلة دون تقييد فئات الدوائر القابلة للتنفيذ.
النمطية: صُممت البنية لـ الحوسبة الهجينة النمطية، حيث يمكن توزيع العمليات الكمومية عبر استدعاءات متعددة لـ QPU أو بنيات كمومية مترابطة في المستقبل.
الواقعية: يؤكد المؤلفون أن هذه الطريقة تمكن من اختبار خوارزميات QML على معالجات متطورة لمهام واقعية (مثل مراقبة الطاقة والبيئة) كانت غير ممكنة سابقاً بسبب قيود الأجهزة.
يظل المؤلفون متواضعين بشأن نتائج جودة الهواء، حيث أقروا بأنه بينما تمكن الطريقة من التطبيق في إعدادات عامة، فإن النماذج الكلاسيكية لا تزال تمتلك ميزة في الأداء التنبئي الخام لذلك النوع من البيانات. علاوة على ذلك، أشاروا إلى أن الضجيج يسبب تدهوراً في الأداء، رغم أن استراتيجية التفكيك تساعد في احتواء هذا التدهور وتقليل تكاليف التدريب والمتطلبات العتادية دون التسبب في تدهور كبير للنموذج في السيناريوهات المثالية أو الخالية من الضجيج التي تم اختبارها.