Learnt Attacks on Quantum Key Distribution under Channel Noise and Device Drift
تصيغ هذه الورقة البحثية عملية التنصت التكيفي على توزيع المفاتيح الكمومية في ظل ضوضاء القناة وانحراف الأجهزة كعملية ماركوف لاتخاذ القرار المقيد، مما يثبت أن التعلم المعزز يمكنه اكتشاف دوائر هجوم مدمجة تتفوق بشكل كبير على الاستراتيجيات الثابتة وتقترب من الحدود العليا النظرية في كل من سيناريوهات الأجهزة المعتمدة وغير المعتمدة.
المؤلفون الأصليون:Marcel Mordarski, Benjamin Gras, Abdelrahman Shehata, Daniel Budina, Roberto Bondesan
تعد توزيع المفاتيح الكمومية طريقة لإرسال الرسائل السرية تعتمد على قوانين الفيزياء الغريبة بدلاً من الرياضيات المعقدة. في هذا النظام، يتشارك شخصان، يُطلق عليهما تقليدياً أليس وبوب، تدفقاً من جزيئات الضوء الصغيرة لتوليد رمز سري مشترك. وإذا حاول طرف ثالث، يُدعى إيف (Eve)، التلصص، فإن قوانين ميكانيكا الكم تضمن أن تترك مداخلتها أثراً يمكن كشفه، مثل بصمة على نافذة. وبسبب ذلك، يمكن لخبراء الأمن إثبات رياضياً أنه إذا كان الأثر صغيراً بما يكفي، فإن الرسالة تظل آمنة. لسنوات، بنى المهندسون هذه الأنظمة بافتراض أن البيئة مستقرة تماماً، أو على الأقل أن أي تغييرات تحدث ببطء كافٍ ليتم رصدها بواسطة عمليات فحص عادية. لقد وضعوا هوامش أمان بناءً على فكرة أن الضجيج في النظام ثابت، معتبرين القناة طريقاً ثابتاً لا يتغير أثناء قيادتهم عليه.
ومع ذلك، في العالم الحقيقي، لا تكون المعدات التي ترسل وتستقبل هذه الجزيئات مستقرة تماماً. فالليزر وأجهزة الكشف تنحرف بمرور الوقت، كما أن الهواء أو كابلات الألياف الضوئية التي تسلكها تتقلب. تتعامل ممارسات الأمن الحالية مع هذا الأمر من خلال إعادة معايرة الآلات بشكل متكرر وإضافة هامش أمان واسع لتغطية أي انحراف محتمل. هذا النهج آمن، ولكنه أيضاً مكلف وغير فعال، وغالباً ما يجبر النظام على التوقف عن نقل البيانات لمجرد الأمان، حتى عندما لا يكون هناك أحد يستمع بالفعل. والسؤال الكبير الذي ظل بلا إجابة هو: هل يمكن لمهاجم ذكي أن يستغل حقيقة انحراف النظام؟ هل يمكن لمتنصت، غير مسموح له بتغيير الضجيج بنفسه ولكن يمكنه مراقبة كيفية تغيره، أن يتعلم التكيف مع استراتيجية الاستماع الخاصة به في الوقت الفعلي لسرقة معلومات أكثر مما كان يُعتقد سابقاً؟
لقد أجاب فريق من الباحثين في إمبريال كوليدج لندن على هذا السؤال من خلال التعامل مع المتنصت ليس كتهديد ثابت، بل كمتعلم. فقد بنوا محاكاة حاسوبية حيث يواجه المتنصت قناة تتغير مستويات الضجيج فيها بمرور الوقت، متبعةً نمطاً يشبه الطريقة التي قد يترنح بها شخص مخمور ذهاباً وإياباً نحو نقطة مركزية. في هذه المحاكاة، لا يكتفي المتنصت باختيار جهاز استماع واحد والتمسك به، بل لديه مكتبة من استراتيجيات الاستماع المختلفة، كل منها مصمم للعمل بشكل أفضل في ظروف ضجيج محددة. وهدفها هو اختيار الاستراتيجية المناسبة للحظة المناسبة، مع الموازنة بين الحاجة إلى سرقة المعلومات وخطر التعرض للكشف. فإذا سرقت الكثير، سيرتفع معدل الخطأ في النظام، وتقوم أليس وبوب بإلغاء الاتصال. وقد استخدم الباحثون نوعاً من الذكاء الاصطناعي، يُعرف باسم التعلم التعزيزي، لتعليم المتنصت كيفية التنقل في هذا المشهد المتغير.
تكشف النتائج عن ثغرة كبيرة في كيفية تجهيز الأنظمة الحالية. فعندما اختبر الباحثون هذا المهاجم التكيفي ضد بروتوكول قياسي يسمى BB84، وجدوا أن المتنصت يمكنه استخراج معلومات أكثر بشكل ملحوظ مما لو كان مجبراً على استخدام استراتيجية واحدة ثابتة. وتحديداً، من خلال التكيف مع الانحراف، زادت نسبة نجاحها بهامش صغير ولكنه حاسم، لتصل إلى مستوى من المعلومات يقارب 9% من الحد الأقصى النظري الذي تسمح به قوانين الفيزياء. وفي بروتوكول أكثر تعقيداً ومستقلاً عن الأجهزة يسمى E91، كانت الميزة أكثر دراماتيكية؛ حيث تمكن المهاجم التكيفي من مضاعفة كمية المعلومات التي يمكنه سرقتها بمعامل يصل إلى حوالي 2.6 مقارم بأفضل استراتيجية ثابتة، كل ذلك مع الحفاظ على معدل كشف صفري. وهذا يعني أنه بمجرد مراقبة انحراف الضجيج وتعديل نهجها، يمكنها مضاعفة حصيلتها ثلاث مرات تقريباً دون أن يدرك المستخدمون الشرعيون وجودها.
كما أوضحت الدراسة كيف يؤثر أسلوب قياس الأخطاء على الأمن. ووجد الباحثون أنه إذا نظرت أليس وبوب فقط إلى متوسط الخطأ عبر جميع أنواع الإشارات، يمكن للمهاجم غير المتماثل اكتساب ميزة طفيفة. ومع ذلك، إذا فحصوا معدل الخطأ لكل نوع من أنواع الإشارات بشكل منفصل، فإن ميزة المهاجم تتلاشى أو حتى تنعكس. وهذا يشير إلى أن الممارسة الحالية لمراقبة معدلات الخطأ المحددة ليست مجرد تفصيل تقني، بل هي آلية دفاع حاسمة تعمل على تشديد الهامش الأمني بشكل كبير. وأكد الباحثون أن عملهم لا يكسر البراهين الأمنية الأساسية للتشفير الكمومي؛ فهذه البراهين لا تزال قائمة لأنها تفترض السيناريو الأسوأ حيث يكون كل الضجيج ناتجاً عن مهاجم. بدلاً من ذلك، يقيس هذا العمل مدى "تحفظ" هوامش الأمان الحالية. فهو يوضح أن افتراض أن الضجيج ثابت يجعل المشغلين يتركون فجوة في أمنهم يمكن للمهاجم التكيفي استغلالها، مما يؤدي إما إلى عمليات إعادة معايرة متكررة غير ضرورية أو، في بعض الحالات، تسريب خفي للمعلومات.
في نهاية المطاف، يوفر هذا البحث أداة جديدة لمشغلي الشبكات لفهم التكلفة الحقيقية للانحراف. فمن خلال تحديد كمية المعلومات الإضافية التي يمكن لمهاجم تكيفي الحصول عليها بدقة، فإنه يسمح للمهندسين بحساب ما إذا كانت هوامش الأمان الحالية واسعة جداً، مما يهدر وقت النقل الثمين، أو ضيقة جداً، مما يخاطر بتسريب المعلومات. وتثبت الدراسة أن الفجوة بين التحليل الأمني الثابت والواقع الديناميكي هي فجوة قابلة للقياس وكبيرة. وللمرة الأولى، هناك طريقة لترجمة المفهوم المجرد للقناة المنحرفة إلى رقم ملموس يخبرنا بالضبط كم يمكن أن يكون النظام أكثر أماناً إذا أخذنا في الاعتبار مهاجماً يتعلم ويتكيف. وهذا ينقل النقاش من مجرد افتراض الأسوأ إلى فهم الديناميكيات المحددة للتهديد، مما يمهد الطريق لشبكات اتصالات كمومية أكثر كفاءة ومتانة.
ملخص تقني: الهجمات المتعلمة على توزيع المفاتيح الكمومية في ظل ضجيج القناة وانزياح الأجهزة
بيان المشكلة تفترض براهين أمن توزيع المفاتيح الكمومية (QKD) عادةً قنوات ثابتة بين عمليات إعادة معايرة الأجهزة. ومن الناحية العملية، يجب على الأطراف الشرعية (أليس وبوب) توفير هوامش تشغيل لاستيعاب انزياح الأجهزة وضجيج القناة. يتم تحديد هذه الهوامش حاليًا بناءً على توصيف الأجهزة بدلاً من تحليل ما يمكن للمتسمع (إيف) كسبه من خلال تكييف استراتيجيتها مع انزياح القناة. وبينما تستخدم الطرق العددية الثابتة (مثل الاسترخاء شبه المحدد) حدودًا لمعلومات "إيف" لمستوى ضجيج ثابت، إلا أنها لا تعالج مشكلة اتخاذ القرار المتسلسل التي يفرضها القناة المنزاحة. وتحديدًا، لم يتم قياس ما إذا كان بإمكان مهاجم، مقيد بالعملية الفيزيائية للضجيج التي لا يمكنه تغييرها، استخراج معلومات أكثر بكثير من خلال تكييف استراتيجية الهجوم الخاصة به جولة بجولة مقارنة باستخدام استراتيجية واحدة ثابتة.
المنهجية قام المؤلفون بتوسيع إطار "الهجوم المتعلم" الخاص بـ Decker وآخرون [13] لمعالجة قصورين رئيسيين: قوالب الدوائر الثابتة والقنوات غير المستقرة.
البحث المشترك عن الطوبولوجيا والمعاملات: بدلاً من تحسين زوايا الدوران فقط ضمن قالب دائرة محدد مسبقًا، يعامل المؤلفون بنية البوابة (الطوبولوجيا) وزوايا الدوران كمتغيرات مجهولة. وقد استخدموا حلقة خارجية تطورية لاقتراح تسلسلات البوابات (باستخدام {RX,RY,RZ,CNOT}) وحلقة داخلية (باستخدام محسّنات خالية من التدرج مثل CMA-ES أو SPSA) لضبط الزوايا. يسمح هذا باكتشاف دوائر مدمجة (4-9 بوابات) مناسبة لمجموعات الإجراءات المنفصلة، وهي قابلة للتطبيق حتى في نماذج الضجيج التي تفتقر إلى قوالب تحليلية معروفة (مثل تخميد السعة).
التنصت التكيفي كعملية قرار ماركوف مقيدة (MDP): تم نمذجة القناة المنزاحة كعملية "أورنستين-أولينبيك" (Ornstein–Uhlenbeck). وقد صيغت مشكلة المهاجم كعملية قرار ماركوف مقيدة.
الحالة: يراقب المهاجم مستوى الضجيج الحالي، والتاريخ الأخير، والإحصائيات المتراكمة.
الإجراء: اختيار دائرة من مكتبة متعلمة مسبقًا.
القيد: يجب ألا يتجاوز متوسط الإحصاء المراقب (مثل الوفاء FAB أو قيمة CHSH أو S) عتبة الإيقاف عبر كتلة من الجولات.
الهدف: تعظيم المعلومات المتوقعة (كمية هوليفو χ أو الوفاء FAE) مع تجنب الكشف.
إطار التقييم: يتم تحديد قيمة التكيف من خلال مقارنة وكيل التعلم التعزيزي (RL) مع:
أفضل دائرة ثابتة (الأساس الاستاتيكي). la أوراكل الجشع (Greedy Oracle) الذي يختار أفضل إجراء آمن بشكل انتهازي.
حد البرمجة الديناميكية (DP) الأعلى، والذي يحل عملية ماركوف (MDP) بشكل أمثل عبر المكتبة لتحديد الحد الأقصى النظري لمجموعة الإجراءات المعطاة.
المساهمات الرئيسية
رسم خرائط المعلومات القابلة للتحقيق: رسم المؤلفون خريطة لأقصى قدر من المعلومات يمكن للمهاجم استخراجها في القنوات ذات الضجيج الثابت عبر عائلات ضجيج مختلفة (باولي وتخميد الساملة) واتفاقيات المراقبة. كما قاموا بقياس الفجوة بين حد النسخ "عديم الضجيج" النظري والحد القابل للتحقيق فعليًا تحت اتفاقيات الضجيج الموثوق.
عدم تماثل الأساس واتفاقيات المراقبة: أظهرت الدراسة أن إشارة مكسب المهاجم من عدم تماثل الأساس تعتمد على اتفاقية المراقبة. ففي ظل قيد معدل الخطأ المتوسط للأساس، يؤدي عدم التماثل إلى مكسب إيجابي صغير؛ أما تحت قيود لكل أساس، فإن المكسب ينعكس في الإشارة ويزداد بشكل كبير في المقدار.
الضجيج الثنائي في بروتوكولات قائمة على التشابك: بالنسبة لبروتوكول E91 المستقل عن الجهاز، استنتج المؤلفون أن ضجيج إلغاء الاستقطاب الثنائي يؤثر على قيمة CHSH بشكل تربيعي ((1−p)2)، بينما قد يقدر نموذج النظام الفرعي الواحد التدهور بشكل خطي خاطئ. وهذا يحدد عتبة ضجيج محددة (pcliff≈0.074) يتجاوزها حتى الرابط غير المضطرب أي مفتاح.
قياس قيمة التكيف: من خلال حل عملية ماركوف المقيدة (MDP)، أظهر المؤلفون أن الاستراتيجيات التكيفية تتفوق بشكل كبير على الاستراتيجيات الثابتة:
E91 (المستقل عن الجهاز): يزيد المهاجم التكيفي من معلومات هوليفو من 0.135 (أفضل دائرة ثابتة) إلى 0.348 (وكيل RL التكيفي) عند صفر كشف، ليصل إلى 98% من الحد الأعلى للبرمجة الديناميكية (DP). ويمثل هذا زيادة بنحو 2.6 ضعف في المعلومات المستخرجة.
BB84: يتجاوز الوكيل التكيفي قاعدة محافظة تعتمد على مؤشر الضجيج بمقدار 0.024 في الوفاء، مستخلصًا حوالي 75% من المساحة النظرية المتاحة حتى حد البرمجة الديناميكية.
التحقق من الصحة: يستعيد إجراء البحث النتائج التحليلية المعروفة (مثل النسخ المثلى لضجيج باولي، ومعدلات الهجوم الجماعي) ويلبي الحد الأدنى من هدف Winick–Lütkenhaus–Coles من الأعلى، مما يؤكد صحة منهجية البحث.
النتائج
الضجيج الثابت: بالنسبة للقنوات الثابتة، يؤكد البحث أن اتفاقية "الضجيج الموثوق" (حيث لا يمكن للمهاجم تغيير ضجيج القناة) تؤدي إلى هامش محافظ. وتكبر الفجوة بين الحد النظري عديم الضجيج والحد القابل للتحقيق مع مستويات الضجيج.
الضجيج المنزاح:
في حالة BB84 مع قناة قلب البت المنزاحة، يحقق الوكيل التكيفي FAE=0.7434 (صفر كشف تمامًا)، وهو ما يطابق أوراكل الجشع ويحقق 99% من الحد الأعلى للبرمجة الديناميكية ($0.7527$).
في حالة E91 مع ضجيج إلغاء الاستقطاب الثنائي، يحقق الوكيل التكيفي χ≈0.348 (صفر كشف)، مقارنة بـ 0.135 لأفضل دائرة ثابتة. ويصل الوكيل إلى 98% من الحد الأعلى للبرمجة الديناميكية ($0.356$).
تشير النتائج إلى أن "قيمة التكيف" جوهرية، خاصة في البروتوكولات المستقلة عن الجهاز حيث تكون هندسة الضجيج أكثر تقييدًا.
تحمل الكشف: إن السماح بمعدل كشف صغير (مثل 4% في BB84) لا يحقق مكاسب كبيرة مقارنة باستراتيجيات صفر كشف، مما يشير إلى أن الميزة الأساسية تأتي من التكيف نفسه وليس من القدرة على تحمل المخاطر.
الأهمية والادعاءات يزعم البحث أنه يقدم أول قياس للميزة التي يكتسبها المتسمت من خلال التكيف مع انزياح القناة عندما يكون مقيدًا بعملية الضجيج الفيزيائية. ويذكر المؤلفون أن هذا العمل لا يبطل براهين الأمن الحالية (التي تظل صالحة بموجب حجج تراكم الإنتروبيا) ولكنه يوضح "هامش التشغيل" بين حد الأمن المثبت والمعلومات المتاحة فعليًا لمهاجم مقيد فيزيائيًا.
تكمن الأهمية في ترجمة التهديدات الديناميكية إلى كميات قابلة للقياس والتحسين. وهذا يسمح لمشغلي الشبكات من المحتمل تمديد فترات إعادة المعايرة وتعظيم الإنتاجية دون المساس بالأمن، مما يعالج عائقًا اقتصاديًا رئيسيًا أمام الاعتماد التجاري لـ QKD. ويؤكد المؤلفون أن نتائجهم هي حدود دنيا بنائية لقوة المهاجم؛ فهي تكمل، ولا تحل محل، براهين الأمن الرسمية التي توفر الحدود العليا الضرورية. يسلط العمل الضوء على أن الافتراضات الاستاتيكية الحالية قد تؤدي إلى الإفراط في التخصيص (خسارة في معدل المفتاح) أو التقليل من تقدير المخاطر في البيئات المنزاحة.