When Error Mitigation Makes Things Worse: Budget-Aware Evaluation, Extrapolation Failure, and the Calibration Trust Boundary
تُظهر هذه الورقة أن تقنيات تخفيف الخطأ، ولا سيما الاستقراء غير المقيد للضجيج الصفري والمصححات العصبية، يمكن أن تضاعف الأخطاء بشكل كبير وتفشل في اكتشاف مخاطر الذيل في ظل سوء المعايرة أو قيود الميزانية، مما يكشف عن ثغرات حرجة في خطوط معالجة التعلم الكمي قصيرة المدى فيما يتعلق بسلامة المعايرة ومنهجيات التقييم.
المؤلفون الأصليون:Guilin Zhang (Workday AI Research), Kai Zhao (Workday AI Research), Xiquan Cui (Workday AI Research), Henry Heng (Workday AI Research), Xu Chu (Workday AI Research), Aletta Johanna Blanken (Workday AIGuilin Zhang (Workday AI Research), Kai Zhao (Workday AI Research), Xiquan Cui (Workday AI Research), Henry Heng (Workday AI Research), Xu Chu (Workday AI Research), Aletta Johanna Blanken (Workday AI Research)
المؤلفون الأصليون: Guilin Zhang (Workday AI Research), Kai Zhao (Workday AI Research), Xiquan Cui (Workday AI Research), Henry Heng (Workday AI Research), Xu Chu (Workday AI Research), Aletta Johanna Blanken (Workday AI Research)
في المختبرات الهادئة وشديدة البرودة حيث تُبنى الأجيال القادمة من الحواسيب، يصارع العلماء مشكلة جوهرية: الضجيج. هذه الآلات، المعروفة باسم الحواسيب الكمومية، مصممة لحل مشكلات معقدة عبر التحكم في الحالات الغريبة للجسيمات دون الذرية. ومع ذلك، فإن الأجهزة هشة للغاية؛ فحتى أدنى اهتزاز أو تغير في درجة الحرارة يتسبب في جعل الجسيمات تتصرف بشكل غير متوقع، مما يؤدي إلى إفساد البيانات قبل إمكانية استخدامها. ولإصلاح ذلك، طور الباحثون مجموعة من التقنيات تسمى "تخفيف الخطأ". والهدف بسيط: أخذ المخرجات الفوضوية والمشوشة من الآلة وتنظيفها رياضياً للكشف عن الإجابة الحقيقية الكامنة تحتها. إنه الفرق بين الاستماع إلى محطة راديو عبر عاصفة من التشويش وبين سماع الموسيقى بوضوح. ولكي يتقدم هذا المجال، يجب على العلماء أن يثقوا في أن طرق التنظيف هذه تعمل بالفعل ولا تجعل الإشارة أسوأ.
تتحدى دراسة حديثة من "Workday AI Research" هذه الثقة، كاشفةً أن طريقة التنظيف الأكثر شيوعاً يمكن أن تؤدي أحياناً إلى تضخيم الأخطاء التي وُجدت لإزالتها. فقد ركز الباحثون على تقنية تسمى "الاستقراء الصفري للضجيج" (zero-noise extrapolation)، والتي تعمل عبر جعل الحاسوب أكثر ضجيجاً بشكل متعمد عبر خطوات مدروسة، ثم تخمين ما كانت ستكون عليه النتيجة لو كان الضجيج صفراً. الأمر يشبه محاولة تخمين وزن شخص عبر وزنه وهو يحمل حقائب ظهر تزداد ثقلاً تدريجياً، ثم العودة بالنتائج إلى الوراء. وجدت الدراسة أنه عندما تكون الإعدادات الداخلية للحاسوب غير دقيقة تماماً -وهي حالة تُعرف باسم "سوء المعايرة"- فإن لعبة التخمين هذه تفشل فشلاً ذريعاً. ففي عمليات المحاكاة، أنتجت هذه الطريقة نتائج أسوأ من عدم فعل أي شيء على الإطلاق في ما بين 38 و63 بالمائة من الحالات. والأمر الأكثر إثارة للقلق هو أنه عندما كانت تفشل، لم تكن الأخطاء مجرد انحراف طفيف؛ بل كانت قصوى، حيث أنتجت أرقاماً أكبر بمئات المرات من الخطأ الفعلي.
اختبر الباحثون هذه النتائج على حاسوب كمومي حقيقي صغير مقدم من شركة IBM، وكانت المحاكاة صحيحة. ففي هذا الجهاز الفعلي، جعلت طريقة تخفيف الخطأ النتائج أسوأ في 80 إلى 88 بالمائة من التجارب. وأصبح متوسط الخطأ أكبر بثلاث إلى أربع مرات من البيانات الخام غير المصححة. يشير هذا إلى أن الطريقة هشة؛ فهي تعتمد على افتراض أن ضجيج الآلة يتصرف بطريقة سلسة وقابلة للتنبؤ. وعندما تمتلك الآلة انحيازاً ثابتاً وخفياً -مثل ميزان يخطئ دائماً ببضعة غرامات- فإن التخمين الرياضي للطريقة يضل طريقه بشكل جامح. كما لاحظت الدراسة أنه إذا نظر العلماء فقط إلى النتيجة "الوسطى"، أو الوسيط، فإنهم سيغفلون عن هذه الإخفاقات تماماً؛ إذ سيبدو متوسط الخطأ سيئاً للغاية، لكن القيمة الوسطى ستظهر طبيعية، مما يخفي حقيقة أن النظام ينتج قيمًا شاذة خطيرة.
ولمعالجة هذه المشكلات، استكشف الفريق نهجاً مختلفاً باستخدام نوع من الذكاء الاصطناعي، وتحديداً "الشبكة العصبية"، لتعلم كيفية تصحيح الأخطاء. لقد قاموا بتدريب هذا البرنامج الحاسوبي على آلاف الأمثلة المحاكاتية، وتعليمه كيفية التعرف على أنماط الضجيج وطرحها. ومن الأهمية بمكان أنهم قارنوا هذه الطالة الجديدة بالطريقة القديمة باستخدام نفس الحد الصارم على عدد المرات التي يمكن فيها سؤال الحاسوب الكمومي لإجراء عملية حسابية. هذا "الميزانية" هي قيد حاسم لأن تشغيل هذه الآلات مكلف ويستغرق وقتاً طويلاً. ووجدت الدراسة أنه بمجرد دفع تكلفة تدريب الذكاء الاصطناعي، أدت الشبكة العصبية أداءً جيداً جداً عند الميزانيات المنخفضة، متفوقة على الطريقة التقليدية. ومع ذلك، كان للذكاء الاصطناعي حدوده الخاصة؛ فلم يستطع نقل معرفته بشكل مثالي إلى الأجهزة الحقيقية دون مزيد من الضبط، وكان يعتمد بشدة على المعلومات المقدمة من الشركة المصنعة حول حالته الراهنة.
فتح اعتماد هذه الطريقة على بيانات الشركة المصنعة باباً جديداً لمخاطر أمنية محتملة. فقد عامل الباحثون بيانات المعايرة المقدمة من الخدمة السحابية كـ "حد ثقة"، مما يعني أن المستخدم يجب أن يأخذ كلام المزود على محمل التصديق دون القدرة على التحقق منه بنفسه. وقد أظهروا أنه إذا تمكن مهاجم من تغيير بيانات المعايرة هذه ببراعة -ربما عبر تغيير رقم يصف كيفية ضبط عناصر التحكم في الآلة- فإن تصحيح الذكاء الاصطناعي سيذهب في الاتجاه الخاطئ. في أحد الاختبارات، أدى تغيير طفيف ومحسوب في هذه البيانات الوصفية إلى زيادة الخطأ بأكثر من ثماني مرات. لقد وثق الذكاء الاصطناعي بالمعلومات الخاطئة، وجعل البيانات أسوأ بدلاً من تحسينها. يسلط هذا الضوء على ثغرة في النظام الحالي: سلامة الحساب تعتمد على نزاهة تدفق البيانات القادم من المزود، وهي حالياً غير محمية ضد التلاعب.
تخلص الدراسة إلى أن هذا المجال يحتاج إلى طريقة أكثر صدقاً لتقييم أدوات تصحيح الخطأ هذه. يجب على العلماء النظر إلى الصورة الكاملة، بما في ذلك تكلفة تشغيل الطريقة، وخطر الأخطاء القصوى، وأمن مدخلات البيانات. إن الطريقة التقليدية المتمثلة في مجرد تخمين الإجابة بناءً على مقياس الضجيج ليست حلاً سحرياً؛ إذ يمكن أن تفشل بصمت وبشكل كارثي. وبينما تظهر الأساليب القائمة على التعلم وعوداً، إلا أنها ليست مشكلة محلولة بعد، خاصة عند الانتقال من المحاكاة إلى الآلات الحقيقية. ويتطلب المسار المستقبلي اختباراً صارماً يأخذ في الاعتبار حقيقة أن هذه الآلات غير كاملة، وأن إعداداتها يمكن أن تنحرف، وأن البيانات التي تصفها يمكن التلاعب بها. وإلى أن يتم فهم هذه العوامل وتأمينها بالكامل، يجب التعامل مع الأرقام الخارجة من هذه الحواسيب القوية بقدر من الشك الصحي.
ملخص تقني: عندما تؤدي معالجة الأخطاء إلى نتائج أسوأ
بيان المشكلة
تعد معالجة الأخطاء مكونًا حاسمًا في مسارات تعلم الآلة الكمي (QML) في المرحلة القريبة، حيث تهدف إلى تحويل مخرجات الأجهزة الصاخبة إلى تقديرات قيم متوقعة قابلة للاستخدام دون تحمل التكلفة العالية للتصحيح الكامل للأخطاء. ومع ذلك، غالبًا ما تحجب ممارسات التقييم الحالية ثغرات حرجة تتعلق بالموثوقية والأمن. وتحديدًا، يتم مقارنة الطرق بشكل متكرر عند ميزانيات ثابتة وسخية من عدد "الطلقات" (shots) لكل تنفيذ دائرة، متجاهلة حقيقة أن التقنيات المختلفة (مثل استقراء الضوضاء الصفرية ZNE مقابل الطرق القائمة على التعلم) تتطلب أعدادًا متفاوتة تمامًا من تنفيذات الدائرة لكل تقدير. علاوة على ذلك، فإن سلامة بيانات المعايرة التي يقدمها المزود — وهي مدخل ضروري للعديد من استراتيجيات المعالجة — غالبًا ما تُعامل كحقيقة موثوقة بدلاً من كونها سطحًا محتملاً للهجوم.
يتقصى هذا البحث فجوتين رئيسيتين:
الموثوقية: هل الإجابة المصححة تحسن حقًا التقدير الخام ضمن ميزانية "طلقات" عبر الإنترنت ثابتة، وكيف تفشل الطرق بشدة عندما تنهار افتراضاتها الأساسية (مثل سلاسة مقياس الضوضاء)؟
الأمن: ما هي المعلومات التي تثق بها طبقة المعالجة، وكيف يمكن للمهاجم التلاعب بالبيانات الوصفية غير المتحقق منها (بيانات المعايرة) لتقليل الأداء؟
المنهجية
التصميم التجريبي
تقيم الدراسة أربعة مسارات للمعالجة تحت بروتوكول ميزانية متساوية عبر الإنترنت (equal-online-budget). تشترك جميع الطرق في نفس ميزانية الطلقات الإجمالية B لكل تقييم، حيث يتم توزيع التكاليف وفقًا لمتطلبات التنفيذ الخاصة بكل منها:
غير المعالجة (Unmitigated): تنفيذ واحد.
معالجة الخطأ العصبية (NEM): تنفيذ واحد (تكلفة التدريب خارج الإنترنت يتم الإبلاغ عنها بشكل منفصل).
استقراء الضوضاء الصفرية (ZNE): من 3 إلى 4 تنفيذات (اعتمادًا على المصنع).
انحدار بيانات كليفورد (CDR): 32 تنفيذًا (لكل دائرة مستهدفة).
يمتد التقييم عبر ثلاثة أنظمة ضوضاء:
ضوضاء الجهاز العشوائية: أخطاء إزالة الاستقطاب، والاسترخاء الحراري، وعدم تماثل القراءة.
البنية: شبكة عصبية متعددة الطبقات (MLP) متبقية مع مشفرين (ميزات الدائرة وميزات الضوضاء/المعايرة) وشبكة مخرجات.
المدخلات: القياس الصاخب، ميزات الدائرة (عدد الكيوبتات، الطبقات، المعلمات)، ميزات الضوضاء (أخطاء البوابة، عدم تماثل القراءة)، ومقياس ضوضاء الطلقات (1/S).
التدريب: تم التدريب خارج الإنترنت على بيانات محاكاة (4,400 زوج لكل نظام) باستخدام خسارة هوبر (Huber loss). النموذج مشروط بعدد الطلقات للتعميم عبر الميزانيات دون إعادة تدريب.
آلية السلامة: يتم استخدام مجموعة (ensemble) من ثلاثة بذور (seeds)؛ إذا اختلفوا بما يتجاوز عتبة معايرة، يلجأ النظام إلى التقدير الخام.
نموذج التهديد
تعامل الورقة المعايرة المقدمة من المزود كـ حد ثقة (trust boundary). نظرًا لأنه لا يمكن للمستخدمين ربط البيانات الوصفية للمعايرة تشفيرًا بحالة التنفيذ المحددة، تحاكي الدراسة:
حقن الانحياز المتماسك (A2): تلاعب المهاجم في إزاحات التحكم δ لتعظيم الخطأ بعد المعالجة.
اختبار جهد البيانات الوصفية: هجوم انحدار التدرج المتجه (PGD) "صندوق أبيض" على ميزات المعايرة.
النتائج الرئيسية
1. التقييم الواعي بالميزانية وفشل ZNE
تحت سوء المعايرة المتماسك، يعمل ZNE غالبًا على تضخيم الخطأ بدلاً من تقليله.
الأداء: في المحاكاة، ينتج ZNE نتائج أسوأ من التقدير الخام في 38-63% من الحالات. وفي دراسة صغيرة على أجهزة حقيقية (IBM Heron)، كان ZNE أسوأ في 80-88% من الحالات، مع متوسط أخطاء بلغ 3.0-4.1 ضعف الخطأ الخام.
مخاطر الذيل (Tail Risk): بينما يظل وسيط الخطأ في ZNE قريبًا من الخط المرجعي الخام (مما يخفي الفشل في المراقبة القياسية)، فإن المتوسط ينحرف بشكل كبير بسبب أخطاء الذيل المتطرفة. وصلت إحدى الحالات إلى خطأ يعادل 371 ضعف أكبر خطأ خام، مما يوضح أن الاستقراء غير المقيد يمكن أن ينتج قيمًا متطرفة كارثية.
التحقق من الأجهزة: تم تكرار نمط الفشل الملاحظ في المحاكاة (التدهور في غالبية الحالات مع وجود ذيول ثقيلة) على أجهزة حقيقية، وإن كانت الدراسة محدودة الحجم.
2. أداء المصحح العصبي (NEM)
حد الدقة والتكلفة: بعد استهلاك تكاليف التدريب خارج الإنترنت، يشغل NEM الطرف المنخفض الميزانية في حدود الدقة والتكلفة. تحت سوء المعايرة المتماسك، قلل NEM متوسط الخطأ بنسبة 72-81% عبر مختلف الميزانيات، متفوقًا على ZNE بشكل كبير.
المقارنة مع CDR: يظل CDR أكثر دقة عندما تكون ميزانيته العالية عبر الإنترنت (32 تنفيذًا) متاحة. ومع ذلك، عند عدد كيوبتات n=16 و n=20، يطابق NEM دقة CDR تحديدًا تحت سوء المعايرة بـ 1/32 من التكلفة الكمية، مما يجعله متفوقًا في سيناريوهات الميزانية المنخفضة أو إعادة الاستخدام العالي في هذا النظام المحدد.
المتانة: قللت آلية التراجع القائمة على اختلاف المجموعة (ensemble disagreement) من معدل "الأسوأ من الخام" من 7% إلى 5% في حالات ممثلة.
3. الأمن وهجمات البيانات الوصفية
الثغرة: يعتمد المصحح العصبي بشدة على ميزات المعايرة. يؤدي حذف هذه الميزات إلى مضاعفة متوسط الخطأ المطلق (MAE) ثلاث مرات.
نجاح الهجوم: أدى هجوم PGD "صندوق أبيض" على ميزات المعايرة (ضمن نطاق التدريب) إلى زيادة متوسط خطأ المصحح بمقدار 8.1 ضعف (من 0.008 إلى 0.067) وجعل كل حالة تصحيح أسوأ.
حدود الكشف: اكتشف مراقب اختلاف المجموعة 50% فقط من الحالات التي ساءت تحت الهجوم، مما يسلط الضوء على أن الضمانات الحالية تجريبية وليست ضمانات قوية.
الادعاءات والأهمية
تقدم الورقة الادعاءات المتواضعة التالية فيما يتعلق بإسهاماتها:
إعادة تقييم الموثوقية: توضح الدراسة أن معالجة الأخطاء القياسية، وخاصة ZNE، يمكن أن تضخم الخطأ تحت عدم تطابق المعايرة الواقعي. والأهم من ذلك، المراقبة المعتمدة على الوسيط فقط غير كافية لاكتشاف هذه الإخفاقات لأن توزيع الأخطاء يصبح ذا ذيول ثقيلة بينما يظل الوسيط مستقرًا.
المقارنة الواعية بالميزانية: يضع المؤلفون إطار عمل "الميزانية المتساوية عبر الإنترنت" للمقارنة بين الطرق. وتحت هذا الحساب، تصبح الطرق القائمة على التعلم (مثل NEM) قابلة للتطبيق ومتفوقة في الميزانيات المنخفضة، بينما تفوز الطرق الكلاسيكية مثل CDR فقط عندما تكون تكلفة التنفيذ العالية متاحة.
نزاهة المعايرة كحد أمني: تصيغ الورقة المعايرة المقدمة من المزود كمدخل غير متحقق منه. وتثبت أن هذه البيانات الوصفية تشكل سطح هجوم ملموس حيث يمكن للاضطرابات الصغيرة ضمن النطاق أن تؤدي إلى تدهور أداء المعالجة بشكل كبير، حتى مع التهرب من مراقبات الاختلاف البسيطة.
قيود انتقال الأجهزة: تشير الدراسة صراحة إلى أن النموذج المدرب في المحاكاة لا ينتقل إلى الأجهزة الحقيقية دون تكيف على الجهاز. دراسة الأجهزة المقدمة تهدف أساسًا للتحقق من أنماط فشل ZNE، وليس للمطالبة بالقدرة الفورية على نشر المصحح العصبي على الأجهزة الحالية.
الخلاصة: تجادل الورقة بأن مسارات تعلم الآلة الكمية في المرحلة القريبة يجب أن تتطور للإبلاغ عن التكلفة، ومخاطر الذيل، ونزاهة المعايرة في آن واحد. وتحذر من أنه بدون هذه الاعتبارات، قد تؤدي معالجة الأخطاء دون قصد إلى إدخال مخاطر ذيل كارثية أو ثغرات أمنية، مما يحول الحل إلى مصدر لتضخيم الخطأ.