BARRED: Synthetic Training of Custom Policy Guardrails via Asymmetric Debate
يُعد BARRED إطار عمل يُنشئ بيانات تدريب اصطناعية عالية الدقة من خلال تفكيك أبعاد المجال والمناظرة بين الوكلاء المتعددين، مما يُمكّن النماذج اللغوية الصغيرة من التفوق على النماذج اللغوية الكبيرة المملوكة والأكثر تطوراً والأنظمة المخصصة للحماية في فرض السياسات المخصصة دون الحاجة إلى تعليق بشري مكثف.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك مدير لمركز خدمة عملاء مزدحم للغاية وذو مخاطر عالية. لديك كتاب قواعد محدد لوكلاء الخدمة لديك: "لا تكشف أبدًا عن إحداثيات نظام تحديد المواقع العالمي (GPS) للموظفين"، أو "لا تقدم نصائح طبية"، أو "لا تسمح للمستخدمين بإرسال الرسالة نفسها ثلاث مرات".
المشكلة هي أن "حراس الأمن" الحاليين لديك (نماذج الذكاء الاصطناعي) إما عامون جدًا (لا يفهمون قواعدك المحددة) أو مكلفون وبطيئون للغاية (يستغرقون وقتًا طويلاً لفحص كل رسالة). أنت بحاجة إلى حارس مخصص يعرف قواعدك المحددة تمامًا، لكن ليس لديك عدد كافٍ من المراجعين البشريين لتعليمه.
إليك BARRED. فكر في BARRED كأنه معسكر تدريب آلي ينشئ طلابه ومعلميه الخاصين لبناء حارس مخصص ومثالي، باستخدام بضعة أمثلة ووصف للقاعدة فقط.
إليك كيف يعمل، مقسمًا إلى خطوات بسيطة:
1. المخطط: تفكيك المشكلة إلى أبعاد
تخيل أنك تحاول تعليم شخص ما ماهية "خطاب الكراهية". إذا قلت فقط "خطاب الكراهة"، فسيكون الأمر غامضًا جدًا.
يقوم BARRED أولاً بأخذ قاعدتك وتفكيكها إلى أبعاد (مثل زوايا مختلفة من الماس).
- مثال: بالنسبة لقاعدة تتعلق بـ "تكرار الرسائل"، قد تكون الأبعاد هي: كم عدد المرات؟ هل هي نفس الكلمات تمامًا؟ هل هي إعادة صياغة طفيفة؟
هذا يضمن أن تغطي بيانات التدريب كل طريقة محتملة قد يحاول بها المستخدم كسر القاعدة، وليس الحالات الواضحة فحسب.
2. المصنع: صنع أمثلة "مراوغة"
بمجرد تحديد الأبعاد، يبدأ BARRED خط إنتاج المصنع. هو لا يصنع فقط أمثلة سهلة (مثل "مرحبًا، كيف حالك؟"). بل يبحث خصيصًا عن حالات الحدود — الأمثلة الماكرة والرمادية حيث قد يتردد حتى البشر الأذكياء.
- تشبيه: إذا كنت تعلم حارسًا كيفية اكتشاف ورقة نقدية مزيفة بقيمة 20 دولارًا، فأنت لا تظهر له ورقة حقيقية بقيمة 20 دولارًا وورقة بقيمة 5 دولارات. بل تظهر له ورقة بقيمة 20 دولارًا تبدو حقيقية تقريبًا، ولكن بها بقعة صغيرة. هذه هي "حالات الحدود" التي تجعل الحارس حاد الذكاء.
3. قاعة المحكمة: المناظرة غير المتماثلة
هذا هو السر الجوهري. عندما يصنع المصنع مثالًا مراوغًا، كيف نعرف ما إذا كان التصنيف (على سبيل المثال، "هذا انتهاك") صحيحًا؟ لا يمكننا سؤال إنسان في كل مرة.
لذلك، ينظم BARRED مناظرة في قاعة محكمة:
- المحامي (المحامي المتشدد): يتم تعيين هذا الوكيل من الذكاء الاصطناعي للدفاع عن التصنيف. هو يجادل قائلاً: "هذا هو انتهاك، وإليك السبب!" وهو لا يغير رأيه أبدًا.
- القضاة (اللجنة المتشككة): مجموعة من وكلاء الذكاء الاصطنا इतर يستمعون إلى المحامي. هم متشككون، ويبحثون عن الثغرات في الحجة.
- الحكم: إذا وافق القضاة المحامي بعد جولات قليلة من الجدال، يتم قبول المثال كـ "حقيقة". أما إذا اختلفوا معه، فيتم إرسال المثال مرة أخرى إلى المصنع لـ تحسينه (إعادة كتابته) حتى تصمد حُجته.
تضمن هذه العملية أن بيانات التدريب ليست مجرد "هلوسة" لا معنى لها؛ بل تم اختبارها بصرامة من قبل فريق من محامي الذكاء الاصطناعي.
4. النتيجة: حارس صغير وقوي للغاية
بمجرد أن يقوم BARBED بتوليد الآلاف من هذه الأمثلة عالية الجودة والمحققة عبر المناظرة، فإنه يستخدمها لتدريب نموذج ذكاء اصطناعي صغير وسريع.
- السحر: يزعم البحث أن هذا النموذج الصغير، المدرب على هذه البيانات الاصطناعية، يصبح أذكى في اتباع قواعدك المحددة من النماذج الضخمة والمكلفة (مثل GPT-4 أو نماذج السلامة المتخصصة) التي تمتلك مليارات المعلمات أكثر منه.
- لماذا؟ لأن النموذج الصغير تم تدريبه خصيصًا على الحالات الحدية الدقيقة التي يحتاج للتعامل معها، بينما تحاول النماذج الكبيرة أن تكون جيدة في كل شيء في آن واحد.
ملخص ادعاءات الورقة البحثية
- المشكلة: تنفيذ قواعد السلامة المخصصة أمر صعب لأن النماذج العامة قد تخطئ، والنماذج الكبيرة بطيئة ومكلفة.
- الحل: يقوم BARRED بإنشاء مجموعة بيانات تدريب مخصصة باستخدام وصف القاعدة وبعض الأمثلة فقط.
- المنهجية: يفكك القواعد إلى أبعاد، ويولد أمثلة مراوغة، ثم يستخدم "مناظرة" بين محامي عنيد وقضاة متشككين للتحقق من صحة البيانات.
- النتيجة: النماذج الصغيرة والسريعة المدربة على هذه البيانات تتفوق على أكبر وأغلى النماذج في دقة المهام المخصصة مثل التحقق من تسريبات الخصوصية، أو التكرار، أو النصائح الطبية.
ما لا تدعيه الورقة البحثية:
- هي لا تدعي أن هذا يعمل لكل المهام الممكنة (فقط تلك التي اختبروها: سياسات المحادثة، خطط الوكيل، والامتثال الصحي).
- هي لا تدعي استبدال الإشراف البشري تمامًا في العالم الحقيقي، رغم أنها تقلل الحاجة إلى فرق ضخمة من المراجعين البشريين.
- هي لا تعد بأن النماذج الصغيرة ستكون مثالية في جميع السيناريوهات المستقبلية، بل تقول فقط إنها تفوقت على النماذج المرجعية في تجاربها المحددة.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.