GoldenRetriever: Non-Interactive Homomorphic Encrypted Retrieval for Privacy-Preserving RAG
تقترح الورقة البحثية إطار عمل "GoldenRetriever"، وهو إطار تشفير متماثل غير تفاعلي لعمليات التوليد المعزز بالاسترجاع (RAG) الحافظة للخصوصية، والذي يستبدل عملية ترتيب أعلى مكلفة ومُشفرة باختيار قائم على العتبة وطريقة استقطاب قناع مستقرة الدقة لتحقيق استرجاع وثائق آمن وقابل للتوسع مع تقليل زمن الاستج</strong>_**ـ**\_**بقاء.**
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك محقق يحاول حل لغز باستخدام مكتبة ضخمة من الملفات السرية. في العالم الرقمي، يشبه هذا طريقة عمل المساعدين الذكيين المعاصرين: فهم لا يعتمدون فقط على ما تعلموه في المدرسة؛ بل يذهبون ويستخرجون ("يسترجعون") معلومات محددة من قاعدة بيانات ضخمة للإجابة على أسئلتك بدقة. تسمى هذه العملية "التوليد المعزز بالاسترجاع"، أو RAG. ومع ذلك، هناك عقبة. عادةً، لكي يجد المحقق الملف الصحيح، يتعين عليه أن يُظهر لأمين المكتبة سؤاله بنص صريح، ويرى أمين المكتبة بالضبط ما يبحث عنه. وإذا كان السؤال يتعلق بسجل طبي سري أو حساب بنكي خاص، فإن هذا يبدو محفوفاً بالمخاطر.
لحل هذه المشكلة، حاول العلماء استخدام "أقفال سحرية" تسمى "التشفير المتماثل" (Homomorphic Encryption). فكر في هذا كصندوق زجاجي خاص يمكنك إجراء عمليات رياضية على محتوياته دون فتح الصندوق أبداً أو رؤية ما بداخله. يمكنك أن تطلب من أمين المكتبة العثور على ملفات تطابق سؤالك السري، ويمكنه إجراء العمليات الحسابية للعثور على المطابقات بينما يظل كل شيء مغلقاً داخل الصندوق. لكن هناك مشكلة: الطريقة القديمة للقيام بذلك كانت تشبه محاولة فرز مليون كتاب عن طريق قراءة كل واحد منها ومقارنته بسؤالك، واحداً تلو الآخر، داخل الصندوق الزجاجي. كان ذلك بطيئاً ومعقداً للغاية لدرجة أنه كان مستحيلاً عملياً في الحياة الواقعية.
هنا يأتي بحث جديد يقترح اختصاراً ذكياً يسمى "GoldenRetriever". فبدلاً من محاولة ترتيب كل وثيقة للعثور على أفضل عشر وثائق (وهو العمل الشاق والبطيء)، يقترح الباحثون قاعدة أبسط: "فقط خذ أي وثيقة جيدة بما يكفي". لقد وضعوا درجة محددة، مثل "عتبة الجودة"، وإذا كانت درجة تشابه الوثيقة أعلى من هذا الخط، يتم اختيارها. أما إذا كانت أقل، فيتم تجاهلها. هذا يغير المهمة من ماراثون من المقارنات إلى مسح خطي سريع. يوضح البحث أن هذه الطريقة تعمل بنفس كفاءة الطريقة البطيئة والمعقدة، ولكنها أسرع بشكل كبير، مما يجعل عمليات البحث في الذكاء الاصطناعي المشفرة والخاصة أمراً واقعياً للغاية في المستقبل.
المشكلة: الصندوق الزجاجي البطيء والثقيل
تخيل أن لديك مكتبة ضخمة حيث كل كتاب مغلق داخل صندوق زجاجي ثقيل وغير شفاف. تريد العثور على كتب تشبه ملاحظة سرية كتبتها. في الماضي، للقيام بذلك بأمان، كان على أمين المكتبة أن يأخذ كل كتاب، ويقارنه بملاحظتك، ويرتبه من "الأكثر تشابهاً" إلى "الأقل تشابهاً"، وكل ذلك بينما تظل الكتب داخل صناديقها الزجاجية.
هذا ما يسميه البحث "ترتيب top-k المتماثل". إنه يشبه محاولة فرز مجموعة من أوراق اللعب وأنت ترتدي قفازات فرن سميكة تجعل أصابعك خرقاء. يوضح البحث أن هذه العملية بطيئة للغاية. في اختباراتهم، حتى مع عدد متواضع من الوثائق، استغرقت العملية أكثر من 10,000 ثانية (أكثر من ساعتين ونصف) لاستعلام واحد فقط. وهذا بطيء جداً لأي شخص يريد إجابة سريعة. علاوة على ذلك، غالباً ما تتطلب الطرق القديمة أن يتحدث الأمين والمستخدم عدة مرات، وهو ما يشبه لعبة "ساخن وبارد" التي تسرب تلميحات عما تبحث عنه.
الحل: مرشح "جيد بما يكفي"
قرر مؤلفو هذا البحث، الذين أطلقوا على نظامهم اسم GoldenRetriever، التوقف عن محاولة ترتيب كل كتاب. بدلاً من ذلك، اقترحوا اختياراً قائماً على العتبة.
فكر في الأمر كحارس أمن عند ملهى ليلي. بدلاً من اصطفاف كل شخص لتحديد من هو "الأكثر" روعة، لدى الحارس قاعدة بسيطة: "إذا كان سجل روعتك فوق 0.6، يمكنك الدخول". يقوم GoldenRetriever بالشيء نفسه؛ فهو يحسب مدى تشابه كل وثيقة مع سؤالك، وإذا كان الرقم أعلى من رقم محدد مسبقاً (العتبة)، فإنه يحدد تلك الوثيقة كـ "مختارة". وإذا كان الرقم أقل، فإنه يحددها كـ "متجاهلة".
هذا التغيير البسيط يعد نقطة تحول. نظرًا لأن النظام لا يحتاج إلى مقارنة كل وثيقة بكل وثيقة أخرى للعثور على "الأفضل"، فإنه لا يحتاج للقيام بالرياضيات التربيعية الثقيلة. بدلاً من ذلك، ينظر إلى كل وثيقة مرة واحدة فقط. يوضح البحث أن هذا يقلل التعقيد الحسابي من فوضى تربيعية (تصبح أصعب بشكل أسي مع نمو المكتبة) إلى مسار خطي (ينمو بشكل ثابت ومتوقع).
الخدعة السحرية: استقطاب القناع
كانت هناك مشكلة واحدة صعبة في هذا النهج. نظرًا لأن الرياضيات تحدث داخل "الصندوق الزجاجي" (التشفير المتماثل)، فإن النتائج ليست أرقاماً مثالية، بل هي تقريبات ضبابية. فالوثيقة التي يجب أن تكون "1" مثالية (مختارة) قد تظهر كـ "0.98"، والوثيقة التي يجب أن تكون "0" (متجاهلة) قد تظهر كـ "0.02".
إذا حاول النظام استخدام هذه الأرقام الضبابية لجلب النص الفعلي للكتاب، فسيحصل على نصوص مشوهة وغير مفهومة. ولحل هذه المشكلة، ابتكر الباحثون طريقة "استقطاب القناع المستقر بدقة" (precision-stable mask polarization).
تخيل أن لديك ميزاناً متذبذباً قليلاً. إذا وضعت صخرة ثقيلة في جانب واحد، فسيميل الميزان قليلاً ولكن ليس بالكامل. طريقة الاستقطاب تشبه مغناطيساً فائق القوة يجذب الميزان تماماً نحو جانب "الصخرة" إذا كان ثقيلاً ولو قليلاً، ويجذبه تماماً نحو جانب "الفراغ" إذا كان خفيفاً ولو قليلاً. رياضياً، استخدموا دالة متعددة الحدود من الدرجة السابعة لإجبار هذه الأرقام الضبابية على التحول إلى أرقام 1 و 0 مثالية. يضمن هذا أنه عندما يتم فك تشفير النص النهائي، ستكون الكلمات صحيحة تماماً، دون أخطاء مطبعية أو حروف مفقودة.
ماذا وجدوا: السرعة دون تضحية
اختبر الفريق نظامهم الجديد على معايير استرجاع قياسية، بما في ذلك مجموعات بيانات مثل MS MARCO و Natural Questions. وقارنوا طريقة "العتبة" الخاصة بهم بطريقة "الترتيب" القديمة وبالنسخة "النصية الصريحة" (غير المشفرة).
كانت النتائج واضحة:
- الدقة: كان GoldenRetriever بجودة النسخة غير المشفرة تماماً. فقد وجد الوثائق الصحيحة وأعاد بناء النص بشكل مثالي.
- السرعة: هنا حدث السحر. مقارنة بطريقة الترتيب المشفرة القديمة، كانت طريقتهم الجديدة أسرع بشكل كبير. في أحد الاختبارات، استغرقت الطريقة القديمة 16,579.9 ثانية (حوالي 4.6 ساعة)، بينما استغرقت الطريقة الجديدة 1,051.8 ثانية (حوالي 17.5 دقيقة) فقط.
- القابلية للتوسع: مع زيادة عدد الوثائق من 100 إلى 1,000، ظل النظام مستقراً. نما الوقت الذي يستغرقه بشكل يمكن التنبؤ به، مما أثبت أن النظام يمكنه التعامل مع مكتبات أكبر دون الانهيار.
كما لاحظ البحث أيضاً أن إعداد "العتبة" هو بمثابة قرص تحكم يمكنك تدويره. إذا ضبطت العتبة منخفضة، فستحصل على المزيد من الوثائق (استدعاء أعلى)، ولكن إذا كانت عالية جداً، فقد تفقد بعض المعلومات ذات الصلة. ومع ذلك، حتى مع هذه المقايضة، أثبت النظام أنه يمكنك الحصول على بحث آمن وخاص لا يتطلب تواصلًا ذهابًا وإيابًا بين المستخدم والخادم، ولا يستغرق ساعات لإنجازه.
الخلاصة
يشير بحث GoldenRetriever إلى أننا لسنا بحاجة لحل المشكلة المستحيلة المتمثلة في "ترتيب كل شيء بدقة في الظلام" لامتلاك ذكاء اصطناعي خاص. بدلاً من ذلك، من خلال مجرد السؤال "هل هذا جيد بما يكفي؟" واستخدام خدعة رياضية ذكية لتنظيف النتائج الضبابية، يمكننا بناء أنظمة بحث آمنة وغير تفاعلية سريعة بما يكفي للاستخدام الفعلي. إنه يحول عملية بطيئة وخرقاء إلى مسار سلس وفعال، مما يقربنا خطوة من مساعدين ذكاء اصطناعي يحترمون خصوصيتك دون إبطاء سرعتك.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.