← أحدث الأبحاث
🤖 AI

Rethinking LLMOps for Fraud and AML: Building a Compliance-Grade LLM Serving Stack

تقدم هذه الورقة بنية تحتية لعمليات النماذج اللغوية الكبيرة (LLMOps) مدركة لحجم عبء العمل ومصممة خصيصاً للامتثال لمكافحة الاحتيال ومكافحة غسل الأموال، والتي تستفيد من النماذج ذات الأوزان المفتوحة، وتحسينات الخدمة المتقدمة مثل PagedAttention وتخزين البادئة المؤقت (prefix caching)، وبوابات جودة صارمة لتحقيق تحسينات كبيرة في معدل الإنتاجية، وزمن الاستجابة، واستغلال وحدة معالجة الرسومات مقارنة بنهج خدمة النماذج اللغوية الكبيرة العامة.

المؤلفون الأصليون: Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang

نُشر 2026-05-13
📖 5 دقيقة قراءة🧠 قراءة متعمّقة

المؤلفون الأصليون: Prathamesh Vasudeo Naik, Naresh Dintakurthi, Yue Wang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تدير مكتبة ضخمة وعالية السرعة، حيث لا يقتل الهدف مجرد قراءة الكتب، بل العثور على أنماط محددة وخطيرة في ملايين الصفحات من المعاملات المالية للإيقاع بغاسلي الأموال. هذا هو عالم الاحتيال ومكافحة غسل الأموال (AML).

يجادل مؤلفو هذه الورقة بأن "المكتبة" (نظام الذكاء الاصطناعي) التي نبنيها عادةً للدردشة مع الأصدقاء سيئة للغاية في هذه المهمة المحددة. الأمر يشبه محاولة استخدام شاحنة توصيل عامة لنقل صناديق مجهزة مسبقاً، ثقيلة وهشة. أنت بحاجة إلى مركبة متخصصة.

إليك تفصيل حلهم، باستخدام تشبيهات بسيطة:

1. المشكلة: الشاحنة "ذات الحجم الواحد للجميع"

معظم أنظمة الذكاء الاصطناعي مصممة للدردشة. في الدردشة، كل محادثة فريدة، طويلة، وغير متوقعة.

  • واقع الاحتيال: كشف الاحتيال مختلف تماماً. كل طلب يُرسل إلى الذكال الاصطناعي يبدو تقريباً متشابهاً. الأمر يشبه إرسال نموذج حيث يكون 80% من الجزء العلوي من الصفحة دائماً عبارة عن قواعد وتعليمات قانونية ثابتة ("البادئة" أو prefix)، بينما الـ 20% السفلية فقط هي التي تتغير (تفاصيل المعاملة المحددة).
  • النتيجة: أنظمة الذكاء الاصطناعي القياسية تضيع وقتاً هائلاً في إعادة قراءة نفس القواعد القانونية مراراً وتكراراً، مثل طالب يعيد قراءة نفس الفصل من الكتاب المدرسي قبل كل سؤال واجب منزلي. هذا يجعلها بطيئة ومكلفة.

2. الحل: "مكدس خدمة" ذكي

قام المؤلفون ببناء "مكدس خدمة" (serving stack) متخصص (المحرك الذي يشغل الذكاء الاصطناعي) مصمم خصيصاً لهذه المهام المتكررة والقائمة على القواعد. فكر في الأمر كترقية من شاحنة توصيل عادية إلى منشأة فرز عالية السرعة وآلية.

إليك التحديثات الرئيسية التي أجروا بها:

  • "ورقة الغش" (تخزين البادئة - Prefix Caching):
    بدلاً من إعادة قراءة 2,000 كلمة من التعليمات القانونية في كل مرة، يتذكرها النظام. الأمر يشبه امتلاك ورقة غش ملصقة على الحائط. عندما تأتي حالة جديدة، يلقي الذكاء الاصطناعي نظرة خاطفة فقط على ورقة الغش (المحملة بالفعل في الذاكرة) ويركز فقط على تفاصيل المعاملة الجديدة. هذا يوفر كميات هائلة من الوقت.

  • "خزانة الملفات الذكية" (PagedAttention):
    ذاكرة الذكاء الاصطناعي القياسية تشبه مكتباً فوضوياً حيث لا يمكنك وضع أوراق جديدة دون إعادة ترتيب كل شيء. استخدم المؤلفون نظاماً "مجزأً" (Paged)، وهو يشبه خزانة ملفات منظمة بدقة. يقوم النظام بتفكيك الذاكرة إلى كتل صغيرة يمكن إدارتها بحيث يمكن للذكاء الاصطناعي استيعاب آلاف الحالات في مساحة عمله دون حدوث فوضى أو انهيار.

  • "استراتيجية التجميع" (التجميع متعدد المهايئات - Multi-Adapter Batching):
    تخيل مكتب بريد يتعين عليه فرز البريد لـ 10 مدن مختلفة. النظام البدائي يقوم بفرز رسالة واحدة لمدينة (أ)، ثم رسالة واحدة لمدينة (ب)، ثم يعود لمدينة (أ).
    نظام المؤلفين يقوم بتجميع جميع رسائل المدينة (أ) معاً، ثم جميع رسائل المدينة (ب). في مصطلحات الذكاء الاصطناعي، هم يجمعون الطلبات التي تحتاج إلى نفس "المهايئ" (أداة متخصصة لمهمة محددة) ويعالجونها في دفعة واحدة. هذا أسرع بـ 3.9 مرة من الطريقة القديمة.

  • "وضع النوم" (إدارة دورة الحياة - Lifecycle Management):
    أحياناً، تحتاج عملية تحقيق في الاحتيال إلى ثلاثة نماذج مختلفة من الذكاء الاصطناعي تعمل بالتتابع: واحد لإيجاد الأدلة، وآخر لتصنيفها، وثالث لكتابة التقرير. إبقاء الثلاثة يعملون بكامل سرعتهم على مدار الساعة طوال أيام الأسبوع هو هدر للكهرباء (والمال).
    نظام المؤلفين يضع النماذج غير المستخدمة في وضع النوم (لتفريغ الذاكرة) ويوقظها فوراً عند الحاجة. هذا يشبه السيارة الهجينة التي تطفئ المحرك عند إشارات التوقف ولكنها تتسارع فوراً عندما تصبح الإشارة خضراء. لقد قللوا وقت "الاستيقاظ" من دقيقة تقريباً إلى بضع ثوانٍ فقط.

  • "تعزيز السرعة" (الترميز التخميني - Speculative Decoding):
    بالنسبة للإجابات القصيرة (مثل "نعم/لا" أو كود JSON)، يستغرق الذكاء الاصطنانا أحياناً وقتاً طويلاً في التفكير. أضاف المؤلفون خطوة "مسودة" حيث يقوم ذكاء اصطناعي أصغر وأسرع بتخمين الإجابة، ثم يقوم الذكاء الاصطناعي الكبير بمجرد التحقق منها. إنه يشبه وجود قارئ سريع يمر بسرعة على النص ويحدد الإجابة ليقوم الأستاذ بالتحقق منها.

3. "بوابة الجودة" (القاضي)

السرعة لا قيمة لها إذا كان الذكاء الاصطناعي يرتكب أخطاء. في كشف الاحتيال، قد تعني الإجابة الخاطئة تفويت مجرم أو اتهام شخص بريء.

  • أنشأ المؤلفون نظام "قاضٍ". قبل أن يتم نشر أي تحديث للذكاء الاصطناعي، تقوم لجنة من قضاة الذكاء الاصطناعي (وخبراء بشريين) بفحص العمل.
  • هم لا يتحققون فقط مما إذا كان الذكاء الاصطناعي سريعاً؛ بل يتحققون مما إذا كانت المخرجات صحيحة (على سبيل المثال، هل هي بتنسيق JSON سليم؟ هل اتبعت القواعد؟).
  • إنه يشبه مفتش السلامة في المصنع. إذا كان المنتج سريعاً ولكنه معيب، فإنه لا يخرج من المبنى.

4. النتائج: "الأرقام السحرية"

باستخدام بيانات عامة وهمية (حتى لا يسربوا أسراراً مصرفية حقيقية)، اختبروا هذا النظام الجديد. كانت النتائج دراماتيكية:

  • السرعة: انتقلوا من معالجة حوالي 600 طلب في الساعة إلى 3,600 طلب في الساعة (تحسن بمقدار 5.5 إلى 6 أضعاف).
  • وقت الانتظار: انخفض الوقت المستغرق للحصول على إجابة من 31-38 ثانية إلى 6-8 ثوانٍ.
  • الكفاءة: تحولت أجهزة الكمبيوتر (GPUs) من كونها خاملة بنسبة 88% من الوقت إلى كونها مشغولة بنسبة 78% من الوقت.
  • التكلفة: نظرًا لأنهم أنجزوا الكثير من العمل بنفس الأجهزة، فقد احتاجوا إلى أقل من نصف عدد أجهزة الكمبيوتر للقيام بنفس المهمة.

الخلاصة

تخلص الورقة إلى أنه بالنسبة للوظائف عالية المخاطر مثل ضبط غاسلي الأموال، لا يمكنك مجرد استخدام أفضل نموذج ذكاء اصطناعي. يجب عليك بناء نظام توصيل متخصص يفهم أن المهمة متكررة، وتعتمد على القواعد، وتتطلب دقة صارمة. من خلال التعامل مع "البادئة" (القواعد) كعنصر قابل لإعادة الاستخدام وتنظيم سير العمل مثل مصنع ذكي، يمكنك جعل النظام أسرع، وأرخص، وأكثر موثوقية دون تغيير "عقل" الذكاء الاصطناعي الأساسي.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →