Quantum Reinforcement Learning for Cost and Delay Tradeoffs in Quantum Cloud Orchestration
تقترح هذه الورقة البحثية إطار عمل QRLQ، وهو إطار للتعلم التعزيزي الكمي يدمج الدوائر الكمية ذات المعلمات مع شبكة Q العميقة المزدوجة والمبارزة (dueling double deep Q-network) لتحسين المقايضات بين التكلفة والتأخير في تنسيق السحابة الكمية، مما يظهر أداءً فائقاً على النماذج الاستدلالية المرجعية ونتائج مماثلة للتعلم التعزيزي العميق الكلاسيكي مع عدد أقل بكثير من المعلمات القابلة للتدريب.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل عالماً لا تتركز فيه أقوى الحواسيب على وجه الأرض في غرفة واحدة، بل تنتشر في جميع أنحاء المعمورة، بحيث يمكن لأي شخص لديه اتصال بالإنترنت الوصول إليها. هذه هي الحواسيب الكمومية، وهي آلات تستخدم القواعد الغريبة للفيزياء لحل مشكلات قد تستغرق الحواسيب العادية آلاف السنين لإنهائها. واليوم، يعمل العلماء على بناء "سحابة" لهذه الآلات، وهو نظام يمكن من خلاله للناس استئجار وقت عليها لتشغيل تجاربهم الخاصة. ومع ذلك، تماماً مثل استئجار سيارة أو غرفة في فندق، هناك ثمن مرتبط بذلك. وفي هذا السوق الرقمي، غالباً ما ترتبط التكلفة مباشرة بمدة تشغيل الحاسوب. والمشكلة تكمكمن في أن هذه الآلات الكمومية ليست جميعها متشابهة؛ فبعضها سريع ولكنه باهظ الثمن، بينما البعض الآخر أبطأ ولكنه أرخص، وبعضها أفضل في التعامل مع أنواع محددة من المهام الصعبة. فإذا اخترت ببساطة الآلة الأرخص، فقد تستغرق مهمتك وقتاً طويلاً جداً لدرجة أن الفاتورة ستصبح ضخمة. وإذا اخترت الآلة الأسرع، فقد تضطر للانتظار في طابور طويل لأن الجميع يريدها أيضاً. إن إيجاد التوازن المثالي بين توفير المال والانتهاء بسرعة هو لغز حيّر الباحثين حتى الآن.
لقد تصدى فريق من العلماء لهذا اللغز عبر ابتكار نوع جديد من المديرين الرقميين، وهو نظام مصمم لتقرير أي حاسوب كمومي يجب أن ينفذ أي مهمة. وقد أطلقوا على ابتكارهم اسم QRLQ. وبدلاً من استخدام البرمجيات الضخمة المعتادة التي تدير عادةً أنظمة اتخاذ القرار هذه، قاموا ببناء مديرهم باستخدام نهج هجين يمزج بين الحوسبة التقليدية ودائرة كمومية صغيرة ومتخصصة للغاية. فكر في هذه الدائرة الكمومية كدماغ مدمج وعالي الكفاءة يمكنه التعلم من الخبرة دون الحاجة لأن يكون ضخماً. لقد درب الباحثون هذا النظام ليتطلع إلى مهمة جديدة، ويفحص حالة جميع الآلات الكمومية المتاحة، ويقرر فوراً أين يرسل العمل. كان الهدف هو تقليل شيئين في آن واحد: الوقت الذي تقضيه المهمة في الانتظار في الطابور، والوقت الذي تقضيه في التشغيل الفعلي، وهو ما يحدد التكلفة مباشرة.
ولاختبار مدى نجاح هذه الفكرة، أجرى الباحثون آلاف عمليات المحاكاة على حاسوب تقليدي قوي، يحاكي سحابة كمومية مزدحمة تحتوي على خمسة أنواع مختلفة من الآلات. وقد غذوا نظامهم بتدفق مستمر من المهام المعقدة، على غرار تلك المستخدمة في الأبحاث العلمية في العالم الحقيقي، وراقبوا أداءه مقابل استراتيجيات أخرى شائعة. كانت بعض هذه الاستراتيجيات المنافسة عبارة عن قواعد بسيطة، مثل اختيار الآلة المتفرغة حالياً دائماً، أو اختيار أسرع آلة متاحة دائماً. كما كانت هناك استراتيجيات أكثر تقدماً تستخدم الذكاء الاصطناعي التقليدي لتعلم أفضل التحركات. وأظهرت النتائج أن المدير الجديد المدعوم كمومياً كان فعالاً بشكل ملحوظ؛ فقد تمكن من خفض متوسط تكلفة تشغيل المهام بنسبة تترا-وح بين 5 و11 بالمائة مقارنة بالطرق القائمة على القواعد البسيطة. والأكثر إثارة للإعجاب هو أنه قلل متوسط وقت الانتظار بنسبة 17 بالمائة مقارنة بأفضل قاعدة تقليدية في الأداء، وبنسبة هائلة بلغت 82 بالمائ@ة مقارنة بأضعف قاعدة.
وما يجعل هذا الاكتشاف هاماً بشكل خاص ليس فقط كونه ناجحاً، بل في مدى كفاءته في تحقيق ذلك. فالأنظمة التقليدية للذكاء الاصطناعي التي تحاول حل هذا النوع من المشكلات غالباً ما تتطلب آلاف الإعدادات القابلة للضبط، أو ما يعرف بالمعلمات (parameters)، لكي تتعلم بفعالية. وهذه الأنظمة الضخمة يمكن أن تكون بطيئة في التدريب وصعبة التشغيل. وفي المق المقابل، حقق نظام QRLQ الجديد نتائج مماثلة، وفي بعض الحالات أفضل، مع استخدام عدد أقل بنحو 72 بالمائة من الإعدادات القابلة للضبط. وكأن الباحثين وجدوا طريقة للحصول على نفس المستوى من الذكاء من محرك أصغر وأكثر انسيابية. كما أثبت النظام متانته؛ فحتى عندما أدخل الباحثون كميات صغيرة من الضجيج العشوائي لمحاكاة الظروف غير المثالية للأجهزة الكمومية الحقيقية، ظل أداء النظام مستقراً، محافظاً على انخفاض أوقات الانتظار والتكاليف.
كما بحثت الدراسة في جودة النتائج التي تنتجها الحواسيب الكمومية. ففي العصر الحالي لتكنولوجيا الكم، تميل الآلات إلى ارتكاب الأخطاء، وغالباً ما يكون الحصول على إجابة صحيحة هو الهدف الأهم. ووجد الباحثون أن نظام الجدولة الجديد الخاص بهم لم يضحِّ بالدقة من أجل السرعة. فقد اكتملت المهام التي جدولةها النظام بمعدل نجاح يكاد يكون متطابقاً مع أفضل استراتيجية ممكنة، وهي الاستراتيجية التي تختار ببساطة الآلة ذات أدنى معدل خطأ. وهذا يشير إلى أن النظام ذكي بما يكفي ليعرف متى يكون الخيار لآلة أبطأ قليلاً هو الخيار الأفضل لأنه أكثر موثوقية، أو متى يستحق الانتظار آلة أسرع لأنها أقل عرضة للفشل.
ورغم أن هذه النتائج واعدة، إلا أن الباحثين يشيرون بحذر إلى أنها تعتمد على عمليات المحاكاة. فهم لم يختبروا هذا النظام بعد على شبكة حقيقية ومادية من الحواسيب الكمومية. ومع ذلك، فإن النتائج تشير إلى مسار واضح للمضي قدماً. فمن خلال استخدام نماذج التعلم المدمجة والمعززة كمومياً، قد يصبح من الممكن قريباً إدارة التعقيد المتزايد للسحابة الكمومية دون الحاجة إلى حواسيب ضخمة ومستهلكة للطاقة للقيام بعملية الإدارة. وبينما يتحرك القطاع الكمومي نحو مستقبل تصبح فيه هذه الآلات أكثر شيوعاً وقوة، سيكون امتلاك وسيلة ذكية وفعالة لتنظيمها أمراً ضرورياً. يوضح هذا العمل أننا لسنا بحاجة لانتظار آلات مثالية وخالية من الأخطاء للبدء في تحسين كيفية استخدام ما نملكه اليوم؛ بل بدلاً من ذلك، ومن خلال الجمع بين قدرة التعلم للذكاء الاصطناعي والكفاءة الفريدة للدوائر الكمومية، يمكننا بالفعل البدء في حل التحديات اللوجستية المعقدة للعصر الكمومي.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.