CoQui: A Coordinate-Conditioned Quantum Implicit Generative Adversarial Network for End-to-End Image Generation
تقدم الورقة البحثية Coqui، وهي شبكة خصومة توليدية كمية ضمنية مشروطة بالإحداثيات، تتغلب على قيود القابلية للتوسع والتحكم في شبكات QGAN الحالية القائمة على السعة، وذلك من خلال توليد الصور عبر دائرة كمية تباينية يتم استعلامها عند إحداثيات مكانية، مما يؤدي إلى فصل الدقة عن متطلبات الكيوبت وتحقيق أداء بصري وكمي متفوق بموارد أقل.
تخيل عالماً لا تكتفي فيه الحواسيب بمعالجة الأرقام فحسب، بل ترقص مع نسيج الواقع ذاته. هذا هو مجال الحوسبة الكمومية، وهو مجال يستخدم القواعد الغريبة وغير البديهية للجسيمات دون الذرية لحل مشكلات قد تستغرق الحواسيب الفائقة التقليدية دهراً لحلها. أحد أكثر تطبيقات هذه التكنولوجيا إثارة هو "الذكاء الاصطناعي التوليدي"، حيث تتعلم الحواسيب ابتكار أشياء جديدة، مثل الفن أو الموسيقى، بدلاً من مجرد تحليل ما هو موجود بالفعل. وللقيام بذلك، يستخدم العلماء لعبة ذكية تسمى "الشبكة التنافسية التوليدية" (GAN). فكر في الأمر كعلاقة بين مُزور ومحقق: يحاول المزور إنشاء صور مزيفة مثالية لدرجة أن المحقق لا يستطيع التمييز بينها وبين الصور الحقيقية. ومع استمرارهم في لعب هذه اللعبة مراراً وتكراراً، يصبح المزور بارعاً للغاية في صنع الفن. والآن، تخيل منح هذا المزور قوة خارقة كمومية. هذا هو هدف "الشبكات التنافسية التوليدية الكمومية" (Quantum GANs)—استخدام الحواسيب الكمومية لتوليد الصور. لكن العائق يكمن في أن الحواسيب الكمومية الحالية صغيرة وهشة، والطرق القديمة لجعلها ترسم الصور تشبه محاولة رسم جدارية ضخمة باستخدام فرشاة واحدة صغيرة فقط، تنسد إذا حاولت رسم الكثير من البكسلات في وقت واحد.
هنا يأتي دور CoQui، وهو نهج جديد يغير قواعد اللعبة. فبدلاً من إجبار الحاسوب الكمومي على موازنة جميع بكسلات الصورة في وقت واحد، يعامل CoQui الصورة كأنها مشهد طبيعي سحري ومستمر. تخيل أن لديك فرشاة رسم سحرية يمكنها أن تخبرك فوراً بلون أي نقطة على اللوحة بمجرد سؤالها: "ما هو اللون عند الإحداثي (س، ص)؟" أنت لا تحتاج لطلاء الصورة بأكملها دفعة واحدة؛ بل تزور كل نقطة بمفردها، واحدة تلو الأخرى، وتسأل الفرشاة عن لونها. هذا هو ما يفعله CoQui. فهو يعيد صياغة توليد الصور كـ "مهمة مشروطة بالإحداثيات". فبدلاً من ربط "سعات" الحالة الكمومية (وهي طريقة تقنية لقول احتمالية وجود جسيم في حالة معينة) مباشرة بسطوع البكسل، يقوم CoQui بتغذية الحاسوب الكمومي بموقع محدد (إحداثيات) ورمز سري (متغير كامن). ثم يعمل الحاسوب الكمومي كآلة حاسبة متطورة، ليخرج درجة السطوع الدقيقة لتلك البقعة تحديداً.
تشير الورقة البحثية إلى أن هذه الطريقة تحل مشكلتين رئيسيتين في مولدات الصور الكمومية السابقة. أولاً، كانت الطرق القديمة تتطلب نمو عدد البتات الكمومية (qubits) كلما زاد حجم الصورة، مثل الحاجة إلى دلو أكبر فأكبر لاحتواء المزيد من الماء. لكن CoQui يكسر هذا الارتباط؛ إذ يمكنك توليد صورة عالية الدقة دون الحاجة إلى حاسوب كمومي ضخم. ثانياً، كانت الطرق القديمة تجعل البكسلات "تتصارع" على الكتلة الاحتمالية، مما يعني أنه إذا أصبح أحد البكسلات ساطعاً جداً، وجب على بكسل آخر أن يصبح مظلماً جداً. أما CoQui فيسمح بقياس كل بكسل بشكل مستقل، بحيث لا يضطرون للتنافس. اختبر الباحثون هذه الفكرة في محاكاة حاسوبية باستخدام مجموعات بيانات صور قياسية (MNIST و Fashion-MNIST). ووجدوا أن CoQui يمكنه إنشاء صور أكثر وضوحاً وحدة من الطرق الكمومية السابقة مع استخدام موارد أقل بكثير—تحديداً، 5 بتات كمومية فقط (واحد للون وأربعة للميزات) ودائرة كمومية واحدة، مقارنة بطرق احتاجت إلى 192 بت كمومي أو تجميع معقد قطعة بقطعة.
كما صمم الفريق بنية "دائرة كمومية" خاصة تعمل كمرشح ذكي، مما يسمح لميزات الصورة بالتحكم في مخرجات اللون بطريقة منظمة للغاية. وفي عمليات المحاكاة التي أجروها، ساعد هذا التصميم النموذج على التعلم بشكل أفضل وإنتاج صور أقل ضبابية وأكثر تفصيلاً. ورغم أن النتائج واعدة، إلا أن المؤلفين يلاحظون بحذر أن هذه هي عمليات محاكاة أُجريت على حواسيب كلاسيكية، وليست اختبارات على أجهزة كمومية حقيقية مليئة بالضجيج. وهم يقترحون أن هذا النهج القائم على الإحداثيات يوفر مساراً أكثر مرونة وكفاءة نحو الأمام، مما قد يسمح للأجهزة الكمومية المستقبلية بإنشاء صور معقدة دون الحاجة إلى ملايين البتات الكمومية. إنها خطوة نحو مستقبل يمكن فيه لشريحة كمومية صغيرة أن ترسم لوحة فنية رائعة، بكسلاً تلو الآخر.
تعتمد شبكات الخصومة التوليدية الكمومية (QGANs) الحالية لتوليد الصور بشكل أساس-ي على نموذج يتم فيه ربط شدة البكسل مباشرة بسعات الحالة الكمومية. وقد حدد المؤلفون عيبين حرجين في هذا النهج:
مشكلات القابلية للتوسع: يؤدي ترميز مواقع البكسل عبر مؤشرات القاعدة الحسابية أو الكيوبتات الخاصة بالعناوين إلى نمو أبعاد الحالة الكمومية أو عدد الكيوبتات خطياً مع دقة الصورة.
اقتران البكسل والتحكم: تقوم الطرق الحالية بفك تشفير عدة بكسلات بشكل مشترك من حالة كمومية واحدة أو حالات قليلة. وهذا يجبر البكسلات على التنافس على الكتلة الاحتمالية، مما يجعل من الصعب التحكم في قيم البكسل الفردية بدقة. وغالباً ما يؤدي ذلك إلى صور مولدة ذات سطوع إجمالي أقل مقارنة بتوزيعات البيانات الحقيقية وتوزيعات سعة غير متساوية.
علاوة على ذلك، تستخدم العديد من الأساليب الحالية الدوائر الكمومية فقط لنمذجة تمثيلات كلاسيكية مضغوطة، بدلاً من القيام بالتوليد المباشر على مستوى البكسل.
المنهجية: إطار عمل Coqui
لمعالجة هذه القيود، يقترح البحث CoQui (الشبكة الخصومية الكمومية الضمنية المشروطة بالإحداثيات)، والتي تعيد صياغة توليد الصور كمسألة تعلم دالة ضمنية مشروطة بالإحداثيات. فبدلاً من ربط السعات بالبكسلات، يتعلم CoQui خريطة مستمرة من الإحداثيات المكانية إلى قيم الإشارة.
1. البنية الأساسية
يعمل إطار العمل كما يلي:
المدخلات: يأخذ المولد الإحداثيات المكانية c=(x,y) ومتغيراً كامناً z كمدخلات.
الترميز الكلاسيكي: تقوم شبكة عصبية كلاسيكية Γ بمعالجة الترميز الموضعي المدمج لـ c و z. وهي تخرج معاملات تحدد زوايا الدوران لدائرة كمومية ذات معاملات (PQC).
المولد الكمومي: تقوم الدائرة (PQC) بتقييم الصورة عند مواقع إحداثية محددة.
تخصيص الكيوبتات: تستخدم الدائرة Nq=Nf+1 من الكيوبتات. يعمل كيوبت واحد (q0) كـ كيوبت اللون لقراءة البكسل، بينما تعمل الكيوبتات الـ Nf المتبقية كـ كيوبتات ميزة لترميز الميزات المكانية الضمنية.
هيكل الدائرة: تتكون الدائرة من L من الطبقات المتكررة التي تحتوي على:
تهيئة سطوع كيوبت اللون: دوران RY قابل للتدريب لضبط متوسط السطوع الأولي.
إعادة رفع البيانات الموزونة: معاملات خاصة بكل طبة (Scale and Bias) تعدل زوايا المدخلات، مما يسمح لكل طبقة بتعزيز أو إضعاف إشارات الإحداثيات والمدخلات الكامنة.
كتابة الميزة إلى اللون: تقوم بوابات Controlled-RY بنقل المعلومات من كيوبتات الميزة إلى كيوبت اللون، مما يجعل مخرج اللون يعتمد صراحة على تمثيل الميزة.
تحديث بقايا اللون: تسمات دورات إضافية قابلة للتدريب على كيوبت اللون تسمح بتحسين شدة البكسل عبر الطبقات.
قراءة البكسل: لا يتم اشتقاق شدة البكسل من سعات الحالة، بل تُقرأ مباشرة كقيمة توقع لمؤثر Pauli-Z على كيوبت اللون: G(c,z)=(1−⟨Z0⟩)/2.
تخليق الصورة: يتم توليد صورة كاملة عن طريق استعلام المولد عند جميع الإحداثيات المكانية (i/W,j/H).
2. هدف التدريب
يتم تدريب Coqui باستخدام هدف Wasserstein GAN مع عقوبة التدرج (WGAN-GP)، باستخدام مميز (ناقد) كلاسيكي للتمييز بين الصور الحقيقية والمولدة.
المساهمات الرئيسية
يوضح البحث ثلاث مساهمات رئيسية:
النموذج المشروط بالإحداثيات: يقوم Coqui بفصل عدد الكيوبتات عن دقة الصورة عبر معاملة التوليد كخريطة مستمرة من الإحداثيات إلى شدة البكسل. وهذا يلغي التنافس بين البكسلات على الكتلة الاحتمالية المتأصل في طرق رسم السعة.
دائرة كمومية ذات انحياز هيكلي: صمم المؤلفون دائرة (PQC) متخصصة ذات انحياز استقرائي هيكلي. ومن خلال استخدام كيوبتات الميزة لتعديل كيوبت لون مخصص بشكل محكم، يعزز النموذج قدرته على التوليد الشرطي للبكسل ويحسن القدرة التعبيرية.
الأداء التجريبي: تظهر المحاكاة المنهجية أن Coqui يحقق جودة بصرية وأداءً كمياً متفوقاً مقارنة بنماذج رسم السعة (PQWGAN و Jäger et al.'s Quantum Wasserstein QGAN) مع استخدام عدد أقل بكثير من الكيوبتات. كما أظهر أداءً تنافسياً ضد نموذج كلاسيكي مرجعي ذي مقياس بارامتر مماثل.
النتائج التجريبية
أُجريت التجارب على مجموعات بيانات MNIST و Fashion-MNIST (بدقة 28×28) باستخدام بيئة محاكاة (إطار عمل JAX).
كفاءة الموارد: يولد Coqui صوراً كاملة باستخدام 5 كيوبتات فقط (1 لون + 4 ميزات) ودائرة كمومية واحدة. في المقابل، تتطلب نماذج رسم السامة موارد أكثر بكثير (على سبيل المثال، يتطلب PQWGAN 192 كيوبت و32 دائرة لنفس المهمة).
الأداء الكمي:
حقق Coqui أفضل أو أفضل نتيجة مرتبطة في درجات مسافة Fréchet Inception Distance (FID) في 4 من أصل 10 فئات لـ MNIST و7 من أصل 10 فئات لـ Fashion-MNIST مقارنة بـ Classical INR-GAN.
تفوق على PQWWAN وعلى الإعداد القياسي لـ Quantum Wasserstein QGAN في كل من الجودة البصرية ودرجات FID على مجموعات البيانات الكاملة المكونة من 10 فئات.
أظهر Coqui إحصائيات بصرية منخفضة المستوى أفضل (السطوع واتساق حواف Sobel) مقارنة بطرق رسم السعة التي أنتجت عينات أكثر ضبابية بسبب اقتران البكسل.
دراسات الاستئصال (Ablation Studies):
بنية الدائرة: تفوقت الدائرة الهيكلية المقترحة (تعديل الميزة إلى اللون) على الـ ansatz عالي الكفاءة من حيث FID و JSD وإحصائيات الحواف.
المكونات: تسبب إزالة إعادة رفع البيانات الموزونة في أكبر تدهور في الأداء (ارتفاع FID من ~40 إلى ~56)، مما يسلط الضوء على أهمية توسيع المدخلات على مستوى الطبقة.
السعة: أدت زيادة كيوبتات الميزة إلى أكثر من 4 أو عمق الدائرة إلى أكثر من 20 طبقة إلى عوائد متناقصة أو تدهور طفيف، مما يشير إلى أن الدوائر ذات العمق الضحل إلى المتوسط كافية لهذه المهمة.
الأهمية والادعاءات
يزعم البحث أن Coqui يمثل خطوة مهمة للأمام في توليد الصور الكمومية من البداية إلى النهاية. ومن خلال الانتقال من رسم السعة إلى التعلم الضمني المشروط بالإحداثيات، يعالج الأسلوب مشكلة القابلية للتوسع الأساسية في QGANs، مما يسمح بتوليد صور عالية الدقة دون زيادة تناسبية في عدد الكيوبتات.
يؤكد المؤلفون أن نهجهم يوفر مساراً أكثر مرونة لنمذجة توزيعات الصور، مما يتيح تحكماً دقيقاً في قيم البكسل الفردية دون قيود التطبيع الاحتمالي العالمي. وبينما يقتصر التقييم الحالي على المحاكاة الكلاسيكية على معايير التدرج الرمادي بدون ضجيج الأجهزة، فإن العمل يضع أساساً للنشر المستقبلي على أجهزة كمومية حقيقية، مع إمكانيات التوسع إلى دقات أعلى وتوليد صور ملونة.