← أحدث الأبحاث
💻 computer science

Privacy-Aware Split Inference with Speculative Decoding for Large Language Models over Wide-Area Networks

تقدم هذه الورقة نظام استدلال مجزأً يراعي الخصوصية للنماذج اللغوية الكبيرة عبر الشبكات واسعة النطاق، والذي يجمع بين تقسيم الطبقات غير المتماثل لإبقاء الرموز الخام محلياً وبين فك التشفيد الاستباقي للتنبؤ (speculative lookahead decoding) لتقليل أثر زمن انتقال الشبكة، محققاً مخرجات مطابقة للرموز، وخصوصية قابلة للضبط ضد هجمات عكس البيانات، وإنتاجية عالية على نماذج تصل إلى 12 مليار معلمة مع متطلبات دنيا من ذاكرة الوصول العشوائي للفيديو (VRAM) المحلية.

المؤلفون الأصليون: Michael Cunningham

نُشر 2026-02-20
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Michael Cunningham

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك عقل روبوت ذكي وقوي للغاية (نموذج لغوي كبير) يعيش في مركز بيانات ضخم وآمن في السحابة. تريد استخدام هذا العقل لكتابة رسائل البريد الإلكتروني، أو الأكواد البرمجية، أو الوثائق القانونية، ولكنك تعمل في مجال حساس للغاية (مثل الرعاية الصحية أو القانون) حيث لا يمكنك إرسال نصوصك الخام إلى السحابة. إذا أرسلت النص، فقد يتعرض للسرقة أو التسريب.

عادةً، يكون أمامك خياران سيئان:

  1. إرسال النص إلى السحابة: سريع وقوي، ولكنه ينطوي على مخاطر تتعلق بخصوصيتك.
  2. تشغيل العقل على حاسوبك المحمول الخاص: آمن، لكن حاسوبك ضعيف جداً للتعامل مع النماذج الأكثر ذكاءً، لذا ستكون النتائج غبية.

تقدم هذه الورقة البحثية خياراً ثالثاً ذكياً: نظام "العقل المنقسم" (Split Brain) الذي يتيح لك استخدام عقل السحابة القوي دون إرسال كلماتك الخام أبداً إلى السحابة.

إليك كيف يعمل الأمر، مشروحاً من خلال تشبيهات بسيطة:

1. "المصافحة السرية" (الاستدلال المنقسم - Split Inference)

تخيل أنك تلعب لعبة "الهاتف المكسور" مع صديق، لكنك تريد إبقاء الرسالة الأولى سراً.

  • الطريقة القديمة: تهمس بالرسالة كاملة لصديقك، وهو يهمس بها للشخص التالي، وهكذا. إذا كان الصديق غير موثوق، فسيسمع سرك.
  • الطريقة الجديدة (الاستدلال المنقسم): تقوم بأول الخطوات القليلة من الرسالة بنفسك. تحول كلماتك السرية إلى إشارة مجردة مشفرة (مثل تحويل كلمة "تفاحة" إلى درجة معينة من اللون الأزرق). ترسل فقط تلك الإشارة الزرقاء إلى صديقك. يقوم هو بمعالجتها، ويضيف سحره الخاص، ثم يرسل إليك إشارة مختلفة. أنت تقوم بالخطوات الأخيرة وتحول الإشارة النهائية مرة أخرى إلى كلمات.

النتيجة: صديقك (السحابة) لا يرى كلمة "تفاحة" أبداً. هو لا يرى سوى رقم عشري عائم (درجة من اللون الأزرق). وبدون "حلقة فك التشفير" السرية (مصفوفة التضمين - embedding matrix) التي تحتفظ بها على حاسوبك الخاص، لا يمكنه معرفة الكلمة الأصلية.

2. مشكلة "ساعي البريد البطيء" (تأخر الشبكة - Network Lag)

هناك عقبة. في كل مرة ترسل فيها تلك "الإشارة الزرقاء" إلى السحابة وتنتظر الإجابة، يستغرق الأمر وقتاً. في عالم الإنترنت، يسمى هذا "زمن الاستجابة" (Latency أو Ping).

  • إذا أرسلت إشارة واحدة، وانتظرت، ثم حصلت على إجابة، ثم أرسلت التالية، فستكون مقيداً بسرعة ركض ساعي البريد.
  • في العالم الحقيقي، هذا الساعي بطيء (حوالي 80 مللي ثانية لكل رحلة). إذا طلبت كلمة واحدة في كل مرة، فلن تتمكن إلا من الحصول على حوالي 8 كلمات في الثانية. وهذا بطيء جداً لإجراء محادثة حقيقية.

3. خدعة "البلورة السحرية" (التشفير الاستشرافي - Lookahead Decoding)

هذا هو الابتكار الأكبر في الورقة البحثية. بدلاً من طلب كلمة واحدة في كل مرة من السحابة، يستخدم النظام تقنية "البلورة السحرية" المسماة التشفير الاستشرافي (Lookahead Decoding).

تخيل أنك تكتب قصة. أنت تعلم أنه بعد جملة "القط جلس على الـ..." فإن الكلمة التالية هي بالتأكيد "سجادة".

  • الطريقة القديمة: تسأل السحابة، "ماذا يأتي بعد ذلك؟" السحابة تقول "سجادة". تسأل، "ماذا يأ after سجادة؟" السح "النقطة".
  • الطريقة الجديدة (الاستشراف): تخمن الكلمات الثلاث أو الأربع التالية بنفسك بناءً على الأنماط ("...سجادة. الكلب..."). ترسل تخمينك إلى السحابة. السحابة تتحقق من تخمينك.
    • إذا كنت محقاً (وهذا يحدث كثيراً في الأكواد البرمجية أو النصوص المتكررة)، تقول السحابة: "نعم، لقد أصبت!" وتحصل أنت على 3 كلمات مقابل رحلة واحدة فقط.
    • إذا كنت مخطئاً، تقول السحابة: "لا"، وتحاول مرة أخرى.

السحر: حتى لو حصلت على 1.3 كلمة فقط في المتوسط لكل رحلة، فأنت الآن تتحرك أسرع بنسبة 40% من ذي قبل. أنت تقوم بـ "توزيع" (amortizing) تكلفة الساعي البطيء على كلمات متعددة.

4. "النفق السري" (الهندسة - Engineering)

وجد المؤلفون شيئاً مفاجئاً: لا يهم مدى بعد خادم السحابة عنك مادياً. ما يهم هو كيف يسلم الساعي الطرد.

  • بعض مزودي الخدمات السحابية يوجهون بياناتك عبر مجموعة من الوسطاء (مثل الوكيل - proxy)، مما يجعل الرحلة بطيئة ومتعرجة.
  • آخرون يسمحون لك بقيادة طريق سريع مباشر.
  • توضح الورقة البحثية أنه من خلال بناء "نفق خاص" (SSH tunneling) واختيار المزود المناسب، يمكنك جعل النظام يبدو سريعاً تقريباً كما لو كان العقل موجوداً على حاسوبك الخاص.

5. فحص الخصوصية (هل لا يزال بإمكانهم التخمين؟)

اختبر المؤلفون ما إذا كان بإمكان مخترق النظر إلى "الإشارات الزرق" وتخمين الكلمات الأصلية.

  • الانقسام الضحل (Shallow Split): إذا قمت بخطوتين فقط من العمليات الحسابية بنفسك، يمكن للمخترق تخمين حوالي 59% من كلماتك.
  • الانقسام العميق (Deep Split): إذا قمت بـ 8 خطوات من العمليات الحسابية بنفسك، تنخفض نسبة نجاح المخترق إلى 35%.
  • المقايضة: القيام بمزيد من العمليات الحسابية على حاسوبك الخاص يجعلك أكثر أماناً، ولكنه يبطئك قليلاً. وجد المؤلفون "نقطة مثالية" حيث تحصل على خصوصية جيدة دون خسارة الكثير من السرعة.

الملخص: لماذا هذا مهم؟

تثبت هذه الورقة البحثية أنه ليس عليك الاختيار بين الخصوصية والقوة.

  • قبل ذلك: كان عليك إرسال أسرارك إلى السحابة للحصول على إجابات ذكية، أو استخدام نموذج محلي "غبي".
  • الآن: يمكنك الاحتفاظ بأسرارك على جهازك الخاص، وإرسال "إشارات رياضية مجردة" فقط إلى السحابة، واستخدام خدعة "البلورة السحرية" للحصول على إجابات سريعة بما يكفي لإجراء محادثة حقيقية.

إنها تحول مشكلة "الساعي البطيء" إلى قضية غير ذات أهمية، مما يسمح للمؤسسات في مجالات الرعاية الصحية والقانون والتمويل باستخدام أذكى أنظمة الذكاء الاصطناي في العالم دون تسليم وثائقها السرية أبداً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →