← أحدث الأبحاث
💬 NLP

Auditing Black-Box LLM APIs with a Rank-Based Uniformity Test

تقترح هذه الورقة اختبار تجانس قائم على الرتبة يُمكّن المستخدمين من تدقيق واجهات برمجة تطبيقات النماذج اللغوية الكبيرة (LLM) ذات الصندوق الأسود بدقة وكفاءة للكشف عن عمليات استبدال النماذج غير المصرح بها، مثل التكميم أو الضبط الدقيق الضار، وذلك عبر التحقق من الاتساق السلوكي مع نموذج محلي أصيل دون الكشف عن أنماط الكشف.

المؤلفون الأصليون: Xiaoyuan Zhu, Yaowen Ye, Tianyi Qiu, Hanlin Zhu, Sijun Tan, Ajraf Mannan, Jonathan Michala, Raluca Ada Popa, Willie Neiswanger

نُشر 2026-03-20
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Xiaoyuan Zhu, Yaowen Ye, Tianyi Qiu, Hanlin Zhu, Sijun Tan, Ajraf Mannan, Jonathan Michala, Raluca Ada Popa, Willie Neiswanger

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك طلبت "شريحة لحم فاخرة" (Premium Steak) من مطعم راقٍ. أنت تتوقع قطعة عالية الجودة وعصارية، لكن الطاهي، وبشكل سري، يستبدلها بقطعة لحم مجمدة رخيصة لتوفير المال. لا يمكنك رؤية المطبخ، ولا يمكنك طلب رؤية المكونات الخام (كود النموذج). كل ما تحصل عليه هو الطبق النهائي (النص المستلم). كيف ستعرف ما إذا كنت تحصل على ما دفعت ثمنه؟

هذه هي المشكلة التي تواجه مستخدمي واجهات برمجة تطبيقات النماذج اللغوية الكبيرة (LLM APIs) اليوم. توفر شركات مثل OpenAI أو Google أو Anthropic الوصول إلى نماذج قوية عبر الإنترنت، ولكن نظرًا لأن هذه النماذج "صناديق سوداء"، لا يملك المستخدمون وسيلة للتحقق مما إذا كان المزود يستخدم بالفعل النموذج الغالي عالي الجودة الذي وعد به، أم أنه استبدله بنسخة أرخص أو أقل جودة (مثل نموذج "مكمّم" Quantized أو "معدل بدقة fine-tuned") لتقليل التكاليف أو تمرير سلوكيات سيئة.

تقترح ورقة بحثية بعنوان "تدقيق واجهات برمجة تطبيقات النماذج اللغوية الكبيرة (LLM) ذات الصندوق الأسود باستخدام اختبار التجانس القائم على الرتبة" طريقة ذكية وغير مرئية لكشف هؤلاء المخادعين. إليك تفصيل ذلك بكلمات بسيطة:

المشكلة: خداع "الصندوق السحري"

تخيل أن لديك صندوقاً سحرياً (الـ API) يدعي أنه يضم طاهياً مشهوراً ومعروفاً (النموذج الأصلي).

  • العقبة: لا يمكنك إلا أن تطلب من الصندوق كتابة قصة أو حل مسألة رياضية. لا يمكنك فتح الصندوق لرؤية الطاهي بالداخل.
  • المخاطرة: قد يقوم مزود غير أمين باستبدال الطاهي الشهير بمتدرب رخيص (نموذج أصغر، أو مكمّم، أو معدل)، وقد يكتب المتدرب جملًا مختلفة قليلاً، أو يرتكب أخطاءً قواعدية صغيرة، أو يختار كلمات مختلفة.
  • الطريقة القديمة: حاولت الأساليب السابقة كشف ذلك عبر طرح أسئلة غريبة ومحددة جداً (مثل "اكتب قصيدة عن محمصة خبز بأسلوب شكسبير"). لكن المخادع الذكي يمكنه تمييز هذه "الأسئلة الاختبارية"، ويدرك أنه يخضع للتدقيق، فيقوم مؤقتاً بالعودة إلى الطاهي الحقيقي لهذه الأسئلة فقط. الأمر يشبه طالباً يحفظ إجابات الاختبار لكنه يفشل في الامتحان الحقيقي.

الحل: "اختبار التجانس القائم على الرتبة" (RUT)

يقترح المؤلفون طريقة جديدة تسمى RUT. بدلاً من طرح أسئلة غريبة، يستخدمون خدعة إحصائية تعمل مثل اختبار تذوق أعمى.

1. الإعداد: "الطاهي المرجعي"

يمتلك المدقق (الشخص الذي يفحص الـ API) نسخة من كتاب وصفات الطاهي الحقيقي تعمل على حاسوبه الخاص. هذا هو النموذج المرجعي. هو يعرف تماماً كيف يتصرف الطاهي الحقيقي.

2. الخدعة: لعبة "الرتبة"

إليك كيفية عمل الاختبار، خطوة بخطوة:

  • الخطوة أ: يطرح المدقق على الـ API المستهدف (الصندوق المشبوه) سؤالاً عادياً، مثل "ما هي عاصمة فرنسا؟"
    • النتيجة: يقول الـ API "باريس".
  • الخطوة ب: يطرح المدقق على الطاهي المرجعي نفس السؤال تماماً 100 مرة.
    • النتيجة: يقول الطاهي المرجعي "باريس" 90 مرة، و"ليون" 5 مرات، و"مارسيليا" 3 مرات، و"نيس" مرتين.
  • الخطوة ج: ينظر المدقق إلى إجابة الـ API المستهدف ("باريس") ويسأل: "أين تقع مرتبة 'باريس' في قائمة الطاهي المرجعي؟"
    • بما أن "باريس" هي الإجابة الأكثر شيوعاً للطاهي الحقيقي، فهي في أعلى القائمة (الرتبة رقم 1).
  • الخطوة د: يكرر هذا الإجراء لمئات الأسئلة المختلفة.

3. فحص "التجانس"

إذا كان الـ API المستهدف هو نفسه الطاهي المرجعي حقاً، فإن إجاباتهما يجب أن تتبع نفس التوزيع تماماً.

  • إذا كان الطاهي المرجعي يقول "باريس" بنسبة 90% من الوقت، فيجب أن يقول الـ API المستهدف أيضاً "باريس" بنسبة 90%.
  • إذا كان الـ API المستهدف "مخادعاً" (نموذج مختلف)، فستكون توزيعات إجاباته مختلفة. ربما يقول "باريس" بنسبة 99% من الوقت، أو ربما يقول "لندن" بنسبة 10%.

الرياضيات وراء RUT تتحقق مما إذا كانت "رتب" الإجابات موزعة بشكل منتظم (منتشرة بالتساوي مثل أوراق اللعب).

  • إذا كانت منتظمة: فإن الـ API صادق.
  • إذا كانت متكتلة أو غريبة: فإن الـ API يكذب.

لماذا هذه الطريقة أفضل؟ (القوى الخارقة)

  1. إنها غير مرئية (تخفي):
    يستخدم المدقق أسئلة عادية ويومية (مثل "كيف حال الطقس؟" أو "اكتب قصيدة"). لا يمكن للمخادع معرفة أنه تحت الاختبار لأن الأسئلة تبدو كحركة مرور طبيعية للمستخدمين. لا يمكنهم "التلاعب بالنظام" عبر التبديل بين الطهاة لأنهم لا يعرفون أي الأسئلة هي اختبارات.

  2. إنها فعالة (رخيصة):
    الأساليب السابقة كانت تتطلب طرح آلاف الأسئلة على الـ API للحصول على إجابة جيدة. أما RUT فيحتاج فقط إلى سؤال واحد لكل مطالبة (Prompt) من الـ API، بينما يتم تنفيذ العمل الثقيل على حاسوب المدقق الخاص. الأمر يشبه فحص حبة أرز واحدة لمعرفة ما إذا كان الكيس بأكمله مزيفاً، بدلاً من أكل الكيس بأكمله.

  3. إنها تكشف كل شيء:
    اختبرت الورقة البحثية RUT ضد أنواع كثيرة من الخداع:

    • التقليل (Quantization): استبدال صورة عالية الدقة بصورة ضبابية (تصغير حجم النموذج).
    • كسر الحماية (Jailbreaking): تسريب تعليمات مخفية لجعل النموذج يقول أشياء سيئة.
    • التعديل الدقيق (Fine-tuning): تعليم النموذج أن يكون فظاً أو يتبع قواعد مختلفة.
    • الاستبدال الكامل: استبدال النموذج بالكامل بنموذج آخر.

    في كل الحالات تقريباً، كشفت RUT المخادعين بشكل أسرع وأكثر دقة من الطرق السابقة.

التشبيه: اختبار "رمي العملة"

تخيل أنك تشك في أن كازينو يستخدم عملة متحيزة (عملة مزيفة) بدلاً من عملة عادلة.

  • الطريقة القديمة: تطلب من الكازينو رمي العملة 1,000 مرة متتالية وتعد النتائج التي تظهر "وجه العملة". إذا رأوك تعد، فقد يبدلونها بعملة عادلة في تلك اللحظة.
  • طريقة RUT: تحضر عملتك العادلة (النموذج المرجعي). ترمي عملتك العادلة 100 مرة وتدون النتائج. ثم تطلب من الكازينو رمي عملته مرة واحدة لنفس "السيناريو". تتحقق مما إذا كانت رميته الواحدة تطابق النمط الخاص بـ 100 رمية من عملتك. إذا كانت عملتهم متحيزة، فإن نمط رميتهم الوحيدة (عند تكراره عبر سيناريوهات مختلفة) سيبدو "غير طبيعي" إحصائياً مقارنة بنمط عملتك العادلة. هكذا تكشفهم دون أن يعرفوا أبداً أنك تختبرهم.

الخاتة

تمنحنا هذه الورقة البحثية أداة قوية لضمان أننا عندما ندفع مقابل "ذكاء اصطناعي متميز"، فإننا نحصل بالفعل على "ذكاء اصطناٍع متميز". إنه جهاز كشف كذب رقمي لا يحتاج لرؤية المحرك ليعرف ما إذا كانت السيارة تعمل بالوقود الصحيح. من خلال استخدام الإحصاء البسيط والمحادثة العادية، يكشف هذا الاختبار المزودين غير الأمناء الذين يحاولون التهرب من التكاليف، مما يضمن سلامة وموثوقية أدوات الذكاء الاصطناعي التي نستخدمها كل يوم.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →