Shot saturation and evidence limits in quantum-AI hardware benchmarks
تعيد هذه الورقة تحليل معايير أداء أجهزة الحوسبة الكمية والذكاء الاصطناعي المؤرشفة لتوضيح كيف يؤثر تشبع العينات (shot saturation) وعدم اكتمال معالجة البيانات بشكل كبير على إعادة بناء الخطأ وتفسير القيم المرصودة، مع تسليط الضوء على أوجه القصور في معايير التقارير الحالية في التمييز بين القيم المقاسة وتلك المفروضة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي لبحث مسبق لم يخضع لمراجعة الأقران. وهو ليس نصيحة طبية. لا تتخذ أي قرارات تتعلق بصحتك بناءً على هذا المحتوى. اقرأ إخلاء المسؤولية الكامل
في السباق لبناء آلات تفكر، برزت حدود جديدة حيث يلتقي عالم الفيزياء مع منطق الذكاء الاصطناعي. يختبر العلماء معالجات دقيقة وهشة تعمل وفق مبادئ ميكانيكا الكم، آملين أن تتمكن من حل مشكلات قد تستغرق الحواسيب الفائقة اليوم قروناً لفك شفرتها. ولمعرفة ما إذا كانت هذه الآلات تعمل، يتعين على الباحثين قياس كميات محددة، مثل مدى تطابق نمطين من البيانات أو مدى جودة قدرة الدائرة على إيجاد الحل الأمثل للغز ما. ومع ذلك، فإن هذه القياسات لا تُؤخذ مرة واحدة؛ بل تُكرر آلاف المرات لبناء صورة موثوقة، تماماً مثل رمي عملة معدنية مرات عديدة لمعرفة ما إذا كانت عادلة. ويكمن التحدي في حقيقة أن آلات الكم هذه صاخبة وغير كاملة، وأن الطريقة التي يعد بها الباحثون محاولاتهم، أو "الطلقات" (shots)، يمكن أن تغير بشكل جذري ما تبدو عليه الأرقام. فإذا كانت طريقة العد معيبة أو إذا كانت البيانات غير مكتملة، فقد تبدو النتائج واعدة بينما هي في الواقع مضللة، مما يجعل من الصب الصعب معرفة ما إذا كانت الآلة تتعلم حقاً أم أنها مجرد تتخبط وسط الضجيج.
أجرى دراسة حديثة قام بها فيكرام ليكس من شركة KarLex AI نظرة نقدية صارمة على مجموعة من التجارب السابقة التي أجريت على هذه المعالجات الكمومية. لم يقم الباحث بإجراء اختبارات جديدة على الأجهزة نفسها، بل عاد إلى الأرشيفات الرقمية لحملة سابقة استخدمت حواسيب كمومية قائمة على السحابة من مزودين مثل Rigetti وIonQ. كان هدفه هو إعادة فحص الملخصات الخام لتلك التجارب ليرى ما إذا كانت الاستنتاجات المستخلصة منها ستصمد تحت مجهر أكثر صرامة وشفافية. وقد ركز على ثلاثة أنواع من المهام: قياس التشابه بين المتجهات، واختبار نوع معين من المصفوفات الرياضية المستخدمة في تعلم الآلة، وتشغيل خوارزمية مصممة لحل مشكلات الرسوم البيانية (graph problems). ومن خلال البحث في تفاصيل كيفية تسجيل البيانات، وجد أن الطريقة التي أُعدت بها التجارب وأُبلغ عنها غالباً ما حجبت الأداء الحقيقي للآلات.
تناول الجزء الأول من التحقيق كيف أثرت زيادة عدد محاولات القياس على دقة النتالئج. في هذه التجارب، قام الباحثون بتشغيل دائلة وتسجيل النتيجة آلاف المرات، ثم قاموا بحساب متوسط النتائج للحصول على رقم واحد. أعادت الدراسة تحليل البيانات حيث تم رفع عدد المحاولات لكل دفعة من 256 إلى 2,048. كان التوقع هو أن مجرد زيادة عدد الطلقات سيؤدي إلى تنعيم الأخطاء وتقريب النتيجة من القيمة الحقيقية. ومع ذلك، كشف إعادة التحليل عن قصة مختلفة. فبينما انخفضت التقلبات العشوائية في البيانات قليلاً مع إضافة المزيد من الطلقات، ظل الخطأ الإجمالي مرتفعاً بشكل مستعصٍ. لم يكن المصدر الأساسي للخطأ هو نقص البيانات، بل كان انحرافاً ثابتاً في القيمة المتوسطة نفسها. فحتى مع 2,048 طلقة، كانت النتيجة المتوسطة لا تزال مختلفة بشكل كبير عما كان ينبغي أن تنتجه آلة مثالية ومثالية. وهذا يشير إلى أن مجرد مطالبة الآلة بالبذل بجهد أكبر أو المحاولة بشكل متكرر لن يصلح المشكلة؛ إذ إن المشكلة تكمن في الإعداد الأساسي للقياس أو في سلوك الأجهزة، والذي ظل دون تغيير بغض النظر عن عدد مرات تكرار الاختبار.
ركز المجال الثاني على بنية رياضية تُعرف باسم "النواة" (kernel)، وهي في الأساس جدول من الأرقام يمثل كيفية ارتباط نقاط البيانات المختلفة ببعضها البعض. في الجدول الكامل والمفيد، يجب أن يكون لكل زوج ممكن من نقاط البيانات قيمة مقاسة. وفي البيانات المؤرشفة من أحد المزودين، وهو Rigetti، تم قياس جميع الأزواج الـ 45 الممكنة. ومع ذلك، في البيانات من مزود آخر، وهو IonQ، تم قياس 18 زوجاً فقط بنجاح قبل أن تنفد أرصدة الحوسبة المتاحة للتجربة، وبقيت الأزواج الـ 27 المتبقية فارغة. وسلطت الدراسة الضوء على خلل حرج في كيفية التعامل مع هذه البيانات الناقصة. فعندما عوملت المدخلات المفقودة كأصفار، انخفض متوسط قيمة الجدول بأكمله بشكل كبير، من قيمة تقارب 0.22 إلى 0.09. هذا التحول الهائل أظهر أن الاستنتاج النهائي يعتمد كلياً على كيفية ملء الأرقام المفقودة. علاوة على ذلك، وجدت الدراسة أن المزودين لم يختبرا بالضبط نفس مدخلات البيانات، مما جعل من المستحيل إجراء مقارنة عادلة بين أداء أجهزتهما. وبدون معرفة أي نقاط بيانات استُخدمت بالضبط وضمان قياس كل مدخل، تصبح أي مقارنة بين هاتين الآلتين غير صالحة علمياً.
فحص القسم الأخير نتائج خوارزمية تسمى QAOA، وهي مصممة لإيجاد أفضل طريقة لتقسيم شبكة من الاتصالات إلى مجموعتين. وقد أبلغ الباحثون عن نجاحهم كنسبة، حيث قارنوا جودة التقسيم الذي وجدوه بالعدد الإجمالي للاتصالات في الشبكة. وكشف إعادة التحليل أن المزودين المختلفين كانوا يستخدمون تعريفات مختلفة للمقام في هذه النسبة. فقام أحد المزودين بقسمة النتيجة على إجمالي عدد الحواف (edges) في الرسم البياني، بينما قام آخر بالقسمة على أفضل نتيجة نظرية ممكنة. وهذا يعني أن درجة 0.5 من آلة ما و0.6 من آلة أخرى لا تعني بالضرورة أن الثانية أفضل؛ بل يعني أنهما ببساً يستخدمان مساطر مختلفة لقياس الشيء نفسه. بالإضافة إلى ذلك، افتقرت البيانات إلى السجلات التفصيلية اللازمة للتحقق مما إذا كانت الآلات تحل المشكلة بالفعل كما هو مقصود، أم أن النتائج كانت مجرد نتاج لكيفية معالجة البيانات. وخلصت الدراسة إلى أنه بدون وجود طريقة معيارية للإبلاغ عن هذه الأرقام والوصول الكامل إلى البيانات الخام، فمن المستحيل تحديد أي الأجهزة هي الأفضل حقاً.
في نهاية المطاف، يعد إعادة التحليل هذا بمثابة درس تحذيري لمجال الذكاء الاصطنال الكمومي. فهو يوضح أن امتلاك كمية كبيرة من البيانات أو عدداً عالياً من محاولات القياس لا يضمن إجابة صحيحة إذا كانت التعريفات الأساسية غير واضحة أو إذا كانت البيانات ناقصة. ووجدت الدراسة أن الأخطاء المهيمنة في هذه التجارب لم تكن ضوضاء عشوائية يمكن إصلاحها عبر إجراء المزيد من الاختبارات، بل كانت مشكلات منهجية تتعلق بكيفية تصميم التجارب والإبلاغ عنها. وشدد الباحثون على أنه للمضي قدماً، يحتاج المجتمع إلى وضع معايير صارمة لما يجب تسجيله من بيانات، وكيفية التعامل مع المعلومات المفقودة، وكيفية مقارنة النتائج. وحتى يتم حل هذه القضايا التأسيسية، ستظل الادعاءات حول أداء الأجهزة الكمومية صعبة التحقق، وسيظل الإمكان الحقيقي لهذه الآلات مخفياً خلف حجاب من الأدلة غير المكتملة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.