← أحدث الأبحاث
🤖 AI

BEAVER: An Efficient Deterministic LLM Verifier

تقدم الورقة البحثية BEAVER، وهو إطار عمل مبتكر يستخدم هياكل بيانات Token trie وFrontier لحساب حدود احتمالية حتمية وسليمة لخصائص سلامة النماذج اللغوية الكبيرة بكفاءة، متفوقاً بذلك على النماذج المرجعية القائمة على أخذ العينات من خلال تحديد حالات أكثر خطورة بشكل ملحوظ باستخدام جزء ضئيل من ميزانية الحوسبة.

المؤلفون الأصليون: Tarun Suresh, Nalin Wadhwa, Debangshu Banerjee, Gagandeep Singh

نُشر 2026-05-11
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Tarun Suresh, Nalin Wadhwa, Debangshu Banerjee, Gagandeep Singh

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك روبوتًا ذكيًا ومبدعًا يكتب القصص أو الأكواد البرمجية أو رسائل البريد الإلكتروني. أنت تريد أن تعرف: "إذا سألت هذا الروبوت سؤالًا، فما هي احتمالية أن يقول شيئًا خطيرًا، مثل تسريب كلمة مرور سرية أو كتابة فيروس؟"

في الوقت الحالي، يحاول الناس الإجابة على ذلك عبر سؤال الروبوت نفس السؤال ألف مرة وعدّ عدد المرات التي يخطئ فيها. هذا يشبه محاولة العثور على إبرة في كومة قش عبر التقاط حفنات من القش بشكل عشوائي؛ قد تفقد الإبرة، أو قد تلتقط نفس الحفنة من القش مرارًا وتكرارًا. إنها عملية بطيئة، ومكلفة، ولا تمنحك ضمانًا بأن كومة القش آمنة.

BEAVER هو أداة جديدة تغير قواعد اللعبة. فبدلاً من التقاط الحفنات بشكل عشوائي، يعمل BEAVER كـ أمين مكتبة فائق التنظيم يقوم برسم خريطة لكامل مكتبة الإجابات المحتملة حتى قبل أن تطرح السؤال.

إليك كيف يعمل، باستخدام تشبيهات بسيطة:

١. "شجرة الاحتمالات" (Token Trie)

تخيل أن إجابة الروبوت تنمو مثل الشجرة.

  • الجذع هو سؤالك.
  • الأغصان هي الكلمات القليلة الأولى التي قد يقولها الروبوت.
  • الأوراق هي الجمل الكاملة والنهائية.

معظم الأدوات تختار غصنًا واحدًا فقط وتتبعه حتى النهاية. أما BEAVER، فهو ينظر إلى الشجرة بأكملها. إنه يبني خريطة لكل مسار محتمل يمكن للروبوت أن يسلكه.

٢. "حارس السلامة" (The Frontier)

يمتلك BEAVER قاعدة خاصة: "إذا بدأ غصن ما يبدو خطيرًا، اقطعه فورًا."

  • إذا بدأ الروبوت في كتابة كلمة قد تؤدي إلى تسريب معلومات أو إهانة سامة، فإن BEAVER يرصد ذلك في تلك اللحظة، عند بداية الجملة.
  • إنه لا يضيع الوقت في إكمال تلك الجملة، بل يقول: "توقف! هذا المسار سيء"، ويقوم بقطع ذلك الغصن من الشجرة.
  • هذا يشبه حارس الأمن في حفلة يمنع شخصًا من دخول غرفة كبار الشخصيات (VIP) بمجرد أن يبدو مريبًا، بدلاً من الانتظار حتى يدخل بالفعل ويبدأ في إثارة الفوضة.

٣. "المستكشف الذكي" (Branch and Bound)

لا يفحص BEAVER كل غصن بشكل عشوائي، بل يستخدم استراتيجية ذكية تسمى "Max-µ".

  • تخيل أن الأغصان لها "أوزان" مختلفة (احتمالات). بعض المسارات مرجحة جدًا للحدوث، بينما الأخرى نادرة.
  • يقوم BEAVER دائمًا بفحص المسارات الأثقل والأكثر احتمالًا أولاً.
  • بينما يفحص هذه المسارات، يحتفظ بسجل مستمر:
    • "درجة الأمان" (الحد الأدنى - Lower Bound): ما هو مقدار الشجرة الآمنة بالتأكيد؟
    • "درجة الحالة الأسوأ" (الحد الأعلى - Upper Bound): ما هو مقدار الشجرة الذي يمكن أن يكون خطيرًا، حتى لو لم نتحقق من كل ورقة بعد؟

٤. النتيجة: "شهادة سلامة"

بدلاً من إعطائك تخمينًا غامضًا مثل "من المحتمل أن يكون الأمر جيدًا"، يمنحك BEAVER ضمانًا رياضيًا.

  • قد يقول: "نحن متأكدون بنسبة 100% أن 90% على الأقل من الإجابات آمنة، وأن 10% كحد أقصى قد تكون خطيرة".
  • والأفضل من ذلك، أنه يفعل ذلك بسرعة أكبر بكثير من طريقة "التخمين الأعمى" القديمة. تُظهر الورقة البحثية أن BEAVER يجد أمثلة خطيرة أكثر بـ 2.5 إلى 3 مرات من الطرق القديمة، بينما يستخدم عُشر (1/10) قوة الكمبيوتر فقط.

لماذا هذا الأمر مهم؟

اختبرت الورقة البحثية أداة BEAVER على 12 نموذجًا مختلفًا للذكاء الاصطناٍعي (مثل Llama وQwen وGemma) وأربعة أنواع من اختبارات السلامة:

  1. الخصوصية: هل سيسرب عناوين البريد الإلكتروني؟
  2. الأمن: هل سيكتب كودًا برمجيًا غير آمن؟
  3. التحيز: هل سيستخدم الصور النمطية؟
  4. السمية: هل سيكون فظًا أو ضارًا؟

أظهرت النتائج أن النماذج المختلفة لها "شخصيات" مختلفة. فقد يكون أحد النماذج ممتازًا في الرياضيات ولكنه سيئ جدًا في الحفاظ على الأسرار. وقد يكون نموذج آخر مهذبًا ولكنه يكتب كودًا برمجيًا سيئًا. يمكن لـ BEAVER رصد نقاط الضعف المحددة هذه التي تغفل عنها الطرق الأخرى.

باختًا: BEAVER هو أداة تستكشف بشكل منهجي كل طريقة ممكنة لفشل الذكاء الاصطناعي، وتقطع المسارات الخطيرة مبكرًا، وتمنحك تقرير سلامة دقيقًا ومثبتًا رياضيًا، مما يوفر الوقت والمال بينما يكتشف المخاطر التي قد تفشل الطرق الأخرى في العثور عليها.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →