← أحدث الأبحاث
⚛️ quantum physics

Scalable Quantum Reinforcement Learning on NISQ Devices with Dynamic-Circuit Qubit Reuse and Grover Optimization

تقدم هذه الورقة إطار عمل للتعلم التعزيزي الكمي قابل للتوسع وفعال في استهلاك الموارد، يستخدم إعادة استخدام الكيوبتات عبر الدوائر الديناميكية وتضخيم السعة القائم على خوارزمية غروفر لتقليل تعقيد الكيوبتات لعمليات ماركوف لاتخاذ القرار الكمية متعددة الخطوات من التعقيد الخطي إلى التعقيد الثابت مع الحفاظ على دقة المسار على أجهزة الحوسبة الكمية ذات القدرة المحدودة (NISQ).

المؤلفون الأصليون: Thet Htar Su, Shaswot Shresthamali, Masaaki Kondo

نُشر 2026-04-23
📖 4 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Thet Htar Su, Shaswot Shresthamali, Masaaki Kondo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

إليك شرح للورقة البحثية باستخدام لغة بسيطة وتشبيهات إبداعية.

المشكلة الكبرى: معضلة "الغرف الكثيرة جدًا"

تخيل أنك تحاول تعليم روبوت كيفية التنقل في متاهة. في عالم التعلم التعزيزي الكمي (QRL)، لا يكتفي الروبوت بالمشي عبر المتاهة فحسب؛ بل يستكشف كل المسارات الممكنة في نفس الوقت باستخدام القوى الغريبة لميكانيكا الكم (مثل التراكب الكمي).

ومع ذلك، كانت هناك عقبة رئيسية. في الطرق السابقة، إذا أردت من الروبوت أن يخطط لـ 10 خطوات للأمام، فستحتاج إلى 10 مجموعات منفصلة من "الغرف" الكمية (الكيوبتات) لتخزين موقع الروبوت في كل خطوة. وإذا أردت التخطيط لـ 1,000 خطوة، فستحتاج إلى 1,000 مجموعة من الغرف.

التشبيه: فكر في هذا الأمر كأنه موقع تصوير فيلم. في الطريقة القديمة، لتصوير مشهد يسير فيه شخص عبر ممر لمدة 10 ثوانٍ، كان عليك بناء 10 ممرات متطابقة ومنفصلة في موقع التصوير، واحد لكل ثانية. إذا كان الفيلم طويلاً، فستنفد مساحة الاستوديو فوراً. يُسمى هذا النمو الخطي (Linear Scaling). وبما أن أجهزة الكمبيوتر الكمية الحالية (المعروفة بأجهزة NISQ) صغيرة ومليئة بالضجيج، فهي ببساطة لا تملك مساحة "استوديو" (كيوبتات) كافية لتصوير أفلام طويلة.

الحل: خدعة "الغرفة المعاد تدويرها"

قدم مؤلفو هذه الورقة طريقة جديدة وذكية لتصوير الفيلم. بدلاً من بناء 10 ممرات منفصلة، قاموا ببناء ممر واحد واستخدموا "زر إعادة ضبط سحري".

  1. الإجراء: يتخذ الروبوت خطوة.
  2. اللقطة: يأخذ الكمبيوتر صورة لمكان وجود الروبوت (القياس).
  3. إعادة الضبط: يتم نقل الروبوت فوراً عبر الانتقال الآني إلى خط البداية في ذلك الممر المحدد، ولكن يتم حفظ ذاكرة المكان الذي انتهى إليه في دفتر ملاحظات (ذاكرة كلاسيكية).
  4. إعادة الاستخدام: أصبح الممر نفسه الآن جاهزاً للخطوة التالية.

التشبيه: تخيل أنك تلعب لعبة لوحية. بدلاً من شراء لوحة جديدة لكل دور تقوم به، أنت تلعب على لوحة واحدة. بعد تحريك قطعتك، تكتب موقعك الجديد في بطاقة تسجيل، ثم تعيد قطعتك إلى مربع البداية لتتمكن من القيام بحركتك التالية. أنت تحتاج فقط إلى لوحة واحدة بغض النظر عن طول اللعبة.

يُسمى هذا إعادة استخدام الكيوبتات في الدوائر الديناميكية (Dynamic Circuit Qubit Reuse). إنه يغير الحسابات من الحاجة إلى NN من الغرف لـ NN من الخطوات إلى الحاجة إلى غرفة واحدة فقط لـ NN من الخطوات.

السلاح السري: بحث "غروفر" الفائق

بمجرد أن يلعب الروبوت عبر اللعبة ويولد العديد من المسارات الممكنة (المسارات)، يحتاج الكمبيوتر إلى إيجاد أفضل مسار (المسار الذي يحتوي على أكبر عدد من النقاط/المكافآت).

في الكمبيوتر الكلاسيكي، سيتعين عليك فحص كل مسار على حدة، مثل البحث عن إبرة في كومة قش.

استخدم المؤلفون خوارزمية غروفر (Grover's Algorithm)، والتي تشبه جهاز كشف المعادن السحري.

  • البحث الكلاسيكي: تمشي عبر كومة القش، وتفحص كل قطعة من القش.
  • بحث غروفر: تلوح بعصا سحرية، فتبدأ الإبرة فوراً بالتوهج والاهتزاز، وتخرج من القش بنفسها.

في هذه الورقة، دمجوا خدعة "الغرفة المعاد تدويرها" مع هذا "العصا السحرية". لقد تركوا الكمبيوتر الكمي يولد جميع المسارات باستخدام الكيوبتات المعاد تدويرها، ثم استخدموا خوارزمية غروفر لزيادة احتمالية المسار الأفضل فوراً، مما يجعل العثور عليه أكثر احتمالاً عند النظر إليه أخيراً.

ماذا فعلوا بالفعل؟

  1. بناء الإطار العملي: أنشأوا نظاماً يتفاعل فيه وكيل كمي مع بيئة كمية، ولكن بدلاً من استخدام كيوبتات جديدة لكل ثانية من الوقت، يقومون بقياس، وإعادة ضبط، وإعادة استخدام نفس الـ 7 كيوبتات مراراً وتكراراً.
  2. إثبات نجاح الطريقة: قاموا بمحاكاة ذلك على جهاز كمبيوتر وأظهروا أن هذه الطريقة تعطي نفس النتائج تماماً مثل الطريقة القدة المستهلكة للمساحة، ولكن باستخدام عدد أقل من الكيوبتات بنسبة 66%.
  3. الاختبار على أجهزة حقيقية: قاموا بتشغيل هذا على كمبيوتر كمي حقيقي مليء بالضجيج (معالج IBM Heron). وعلى الرغم من أن الكمبيوتر كان "صاخباً" (عرضة للأخطاء)، إلا أن النظام نجح في إيجال المسار الأمثل، مما يثبت أن هذه الطريقة تعمل على الأجهزة الواقعية اليوم.

لماذا يهم هذا الأمر؟

قبل هذه الورقة، كان التعلم التعزيزي الكمي بالكامل عالقاً في "مرحلة الألعاب البسيطة". كان بإمكانك فقط حل المشكلات البسيطة والقصيرة جداً لأنك تنفد من الكيوبتات بسرعة كبيرة.

هذه الورقة تكسر هذا الحاجز. فهي تظهر أنه يمكننا الآن تعليم الوكلاء الكميينين التخطيط لـ مستقبلات أطول وأكثر تعقيداً دون الحاجة إلى كمبيوتر كمي بحجم مدينة. إنها تحول "المستحيل" إلى "ممكن" على أجهزة الكمبيوتر الكمية الصغيرة وغير المثالية التي نمتلكها الآن.

باختصار: لقد عرفوا كيف يجعلون الكمبيوتر الكمي يلعب مباراة شطرنج طويلة عن طريق إعادة استخدام نفس المربعات السبعة على اللوحة بدلاً من الحاجة إلى لوحة جديدة لكل حركة، ثم استخدموا تعويذة بحث سحرية للعثور فوراً على استراتيجية الفوز.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →