An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs
تقدم هذه الورقة البحثية INS-S1، وهي عائلة نماذج لغوية كبيرة متخصصة في مجال التأمين تحقق إتقانًا معرفيًا قابلًا للتحقق في هذا المجال ومعدل هلوسة منخفضًا قياسيًا دون التضحية بالذكاء العام، وذلك باستخدام نموذج محاذاة جديد شامل (end-to-end) يتميز بتوليف بيانات قابل للتحقق ومنهج تدريجي للضبط الدقيق والتعلم المعزز (SFT-RL)، إلى جانب إصدار معيار INSEva الشامل.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تخيل أنك توظف أمين مكتبة عبقرياً، كلي المعرفة (نموذج لغوي كبير)، للعمل في مكتب تأمين صارم وعالي المخاطر.
ما هي المشكلة؟ هذا الأمين بارع في كتابة الشعر، والبرمجة، والدردشة، لكن إذا سألته عن سياسات التأمين، فإنه يميل إلى "الهلوسة". قد يخترع قاعدة غير موجودة، أو يبتكر سيناريو مطالبة من خياله، أو يشرح لائحة تنظيمية بشكل خاطٍ تماماً وبكل ثقة. في عالم التأمين، يمكن لحقيقة واحدة مختلقة أن تؤدي إلى دعاوى قضائية، وخسائر مالية، وعملاء غاضبين.
عادةً ما تحاول الشركات معالجة هذا الأمر، فتواجه "مقايضة الكفاءة":
- الخيار (أ): تجعل أمين المكتبة خبيراً في التأمين، لكنه ينسى كيفية الكتابة أو إجراء العمليات الحسابية.
- الخيار (ب): تحافظ على ذكائه في كل شيء، لكنه لا يزال يرتكب أخطاءً خطيرة بشأن التأمين.
يقدم هذا البحث INS-S1، وهو نوع جديد من "أمين المكتبة الخارق للتأمين" الذي يحل هذه المشكلة. إنه خبير في التأمين دون أن يفقد ذكاءه العام، ويكاد لا يكذب أبداً.
إليك كيف قاموا ببنائه، باستخدام تشبيهات بسيطة:
1. "الكتاب المدرسي الصادق" (توليد البيانات القابلة للتحقق)
بدلاً من مجرد إلقاء ملايين ملفات الـ PDF الخاصة بقوانين التأمين في عقل النموذج (مما يؤدي غالباً إلى الارتباك)، بنى الفريق نظام تدريب متخصصاً.
- التشبيه: تخيل أنك تُعلم طالباً للاستعداد لامتحان طبي. أنت لا تعطيه مجرد كومة من الكتب، بل تعطيه مولداً للاختبارات ينشئ أسئلة، ويتحقق من الإجابات مقابل الكتاب المدرسي الرسمي، ولا يسمح للطالب بالانتقال إلا إذا حصل على درجة 100% صحيحة.
- ما فعلوه: أنشأوا نظاماً يولد آلاف الأسئلة المتعلقة بالتأمين ويقوم بالتحقق تلقائياً من الإجابات. إذا حاول الذكاء الاصطناعي التخمين أو اختلاق شيء ما، فإن النظام يكشفه فوراً. هذا يضمن أن النموذج يتعلم فقط الحقائق المثبتة، وليس التخمينات.
2. "معسكر التدريب التدريجي" (التعلم المنهجي)
لن تضع إطفائي مبتدئاً مباشرة في ناطحة سحاب تحترق. بل تبدأ معه بخرطوم مياه، ثم حريق صغير، ثم حريق كبير.
- التشبيه: استخدم الفريق "معسكراً تدريبياً خطوة بخطوة".
- المرحلة الأولى (الأساسيات): علموا النموذج المعرفة العامة ومفاهيم التأمين الأساسية حتى لا ينسى كيف يكون ذكاءً اصطناعياً ذكياً.
- المرحلة الثانية (الأمور الصعبة): رفعوا مستوى الصعوبة تدريجياً، مع التركيز على الرياضيات المعقدة (العلوم الاكتوارية) والمنطق القانوني الشائك.
- خدعة "التلدين" (Annealing): بينما أصبح النموذج أفضل في الأمور الصعبة، قللوا تدريجياً من كمية الممارسة "السهلة"، مما أجبره على التركيز تماماً على السيناريوهات الصعبة والواقعية. هذا منع النموذج من الشعور بالملل أو نسيان الأساسيات.
3. "المدرب الصارم" (RLVR & RLAIF)
بمجرد أن بدأ النموذج في التعلم، احتاجوا إلى طريقة لمعاقبته على الكذب ومكافأته على الدقة.
- التشبيه: تخيل مدرباً لديه صافرتان مختلفتان.
- الصافرة الأولى (صافرة الرياضيات): بالنسبة للمسائل الرياضية، يتحقق المدرب من الإجابة مقابل آلة حاسبة. إذا كانت خاطئة، يحصل النموذج على "وقت مستقطع". هذا يسمى الاستنتاج المتحقق منه.
- الصافرة الثانية (صافرة الأخلاقيات): بالنسبة للأسئلة المفتوحة (مثل "كيف أقدم مطالبة؟")، يتحقق المدرب مما إذا كانت الإجابة مهذبة، ومنطقية، ولا تخترع قواعد وهمية. هذا يسمى التغذية الراجعة من الذكاء الاصطناعي.
- النتيجة: تعلم النموذج أن "اختلاق الأشياء" يؤدي إلى العقوبة، بينما "الالتزام بالحقائق" يمنحه درجة عالية.
4. "الامتحان النهائي" (معيار INSEva)
لإثبات أن نموذجهم كان جيداً حقاً، لم يستخدموا اختباراً عادياً. بل بنوا أشمل امتحان تأمين تم إنشاؤه على الإطلاق (يسمى INSEva).
- التشبيه: يشبه اختبار القيادة الذي لا يكتفي بسؤالك عن كيفية ركن السيارة بالتوازي، بل يضعك في وسط عاصفة ثلجية، ومنطقة بناء، وتقاطع مزدحم في آن واحد.
- النتيجة: سجل INS-S1 درجة 90.14 في هذا الامتحان، متفوقاً على أفضل النماذج السابقة (مثل DeepSeek-R1 و Gemini) التي سجلت حوالي 82-84 فقط.
الفوز الكبير: لا يوجد "فقدان ذاكرة"
الجزء الأكثر إثارة للإعجاب؟ عادةً، عندما تدرب نموذجاً ليكون متخصصاً، فإنه ينسى كيف يكون عاماً (مثل حل الألغاز الرياضية أو كتابة الأكواد).
- التشبيه: عادةً، إذا دربت طباخاً ليكون خبيراً في صنع السوشي، فقد ينسى كيفية طهي شريحة لحم.
- الواقع: أصبح INS-S1 خبيراً في السوشي لكنه لا يزال قادراً على طهي شريحة اللحم المثالية. لقد أصبح في الواقع أفضل في الاستنتاج العام لأن المنطق الصارم للتأمين أجبره على التفكير بوضوح أكبر.
معجزة "صفر هلوسة"
في عالم التأمين، نسبة خطأ 1% تعتبر كارثة.
- النتيجة: حقق INS-S1 معدل هلوسة قدره 0.6%. هذا يعني أنه من بين كل 1,000 إجابة، اختلق حقيقة واحدة 6 مرات فقط. هذا رقم قياسي منخفض للغاية، مما يجعله آمناً للاستخدام في الأعمال التجارية الحقيقية عالية المخاطر.
الملخص
لم يقم الفريق في Ant Group بمجرد "تعديل" ذكاء اصطناعي. بل بنوا نظاماً بيئياً تدريبياً متخصصاً يقوم بـ:
- التحقق من صحة بيانات التدريب الخاصة به.
- تدريب النموذج من السهل إلى الصعب، خطوة بخطوة.
- مكافأة الصدق ومعاقبة الكذب.
- إثبات نجاح ذلك من خلال أصعب امتحان تم إعداده.
النتيجة هي ذكاء اصطناعي آمن، وذكي، وجاهز للتعامل مع مطالبات التأمين الخاصة بك دون اختلاق أي شيء.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.