A Multistage Extraction Pipeline for Long Scanned Financial Documents: An Empirical Study in Industrial KYC Workflows
تقدم هذه الورقة خط معالجة متعدد المراحل يعمل على فصل تحديد موقع الصفحة عن الاستدلال متعدد الوسائط لتحسين دقة استخراج المعلومات الهيكلية بشكل كبير في مستندات "اعرف عميلك" (KYC) الصناعية الصاخبة ومتعددة اللغات والطويلة، متفوقاً على النماذج المرجعية لنماذج الرؤية واللغة المباشرة من طرف إلى طرف بما يصل إلى 31.9 نقطة مئوية.
تخيل أنك موظف في بنك تحاول قراءة كومة ضخمة وفوضوية من التقارير المالية القديمة للتحقق مما إذا كان العميل جديراً بالثقة. هذه ليست وثائق مرتبة ومطبوعة؛ بل هي نسخ ضوئية ممسوحة ضوئياً، بعضها مائل، وبعضها غير واضح، ومكتوبة بلغات مختلفة. والأسوأ من ذلك، قد يكون التقرير الواحد مكوناً من 80 صفحة، لكن الرقم الوحيد الذي تحتاجه (مثل "صافي الربح") مخفي في الصفحة 42 فقط.
تصف هذه الورقة طريقة جديدة وأكثر ذكاءً للتعامل مع هذه الكومة من الأوراق. فبدلاً من محاولة قراءة الكومة بأكملها دفعة واحدة، قام المؤلفون ببناء خط تجميع متعدد المراحل يعمل كفريق من العمال المتخصصين.
إليك كيف يعمل نظامهم، باستخدام تشبيهات بسيطة:
1. المشكلة: "العملاق الأعمى"
حاول المؤلفون استخدام أحدث نماذج الذكاء الاصطناعي الأكثر قوة (تسمى نماذج الرؤية واللغة أو VLMs) لقراءة هذه الوثائق. لقد عاملوا الذكاء الاصطناعي كأنه عملاق يحاول ابتلاع كتاب من 80 صفحة في قضمة واحدة.
النتيجة: يصاب العملاق بالارتباك. يختنق بالضجيج، ويفقد التفاصيل الصغيرة، وغالباً ما يعطي إجابة خاطئة. كما أنه بطيء جداً ومكلف لإطعام العملاق هذا القدر الهائل من الطعام دفعة واحدة.
2. الحل: "الفريق المتخصص"
بدلاً من وجود عملاق واحد، أنشأ المؤلفون خط إنتاج يتكون من أربع خطوات متميزة، مثل مصنع منظم جيداً:
الخطوة 1: "عامل النظافة" (المعالجة المسبقة للصور) قبل أن يقرأ أي شخص الوثيقة، يقوم "عامل النظافة" بتنظيفها. تقوم هذه الخطوة بتعديل الصفحات المائلة، وإزالة بقع القهوة والظلال، وجعل النص حاداً وواضحاً. الأمر يشبه كيّ قميص مجعد قبل محاولة قراءة الملصق الموجود عليه.
الخطوة 2: "المترجم" (التعرف الضوئي على الحروف متعدد اللغات - OCR) يتم تمرير الصفحات المنظفة إلى مترجم (OCR) يحول صور النصوص إلى كلمات رقمية فعلية. وبما أن هذه الوثائق بالإنجليزية والصينية والإندونيسية وغيرها، فإن هذا المترجم يجيد لغات عديدة ويمكنه حتى قراءة الكتابة اليدوية الفوضوية.
الخطوة 3: "أمين المكتبة" (استرجاع مستوى الصفحة) هذه هي الخطوة الأهم. تخيل أنك بحاجة للعثور على حقيقة محددة في كتاب من 100 صفحة. بدلاً من قراءة كل صفحة، تقوم باستئجار أمين مكتبة. يقوم أمين المكتبة بمسح سريع لجدول المحتويات والنصوص ليقول لك: "مهلاً، الإجابة موجودة في الصفحات 12 و15 و42. تجاهل الصفحات الـ 95 الأخرى".
لماذا هذا مهم: وجدت الورقة أن هذه الخطوة هي "السر الخفي". فمن خلال تصفية الصفحات غير ذات الصلة، يوفر النظام كميات هائلة من الوقت والمال، ويمنع الذكاء الاصطناعي من التشتت بمعلومات غير مفيدة.
الخطوة 4: "الخبير" (استخراج البيانات بواسطة نموذج VLM مدمج) الآن، يرسل النظام تلك الصفحات القليلة ذات الصلة فقط إلى "الخبير" (الذكاء الاصطناعي). ولأن الخبير ليس مثقلاً بـ 80 صفحة من الهراء، يمكنه التركيز تماماً على الأرقام المحددة التي تحتاجها. تستخدم الورقة ذكاءً اصطناعياً "مدمجاً" (أصغر وأسرع) لهذا العمل، والذي يعمل بشكل جيد بشكل مدهش عندما يُعطى بيانات نظيفة ومركزة.
الخطوة 5: "المراجعة البشرية" (الإنسان في الحلقة - Human-in-the-Loop) أخيراً، يقوم محلل بشري بمراجعة عمل الذكاء الاصطناعي لفترة وجيزة. يشير المؤلفون إلى أن البشر في القطاع المصرفي يضطرون بالفعل للتحقق من هذه الوثائق للامتثال للوائح السلامة. هذا النظام يجعل مهمة الإنسان أسهل عبر تسليط الضوء على الأجزاء ذات الصلة وتنبيهه لأي شيء لم يكن الذكاء الاصطناعي متأكداً منه.
النتائج: فوز كبير
اختبر الفريق هذا النظام على 120 وثيقة مالية حقيقية (حوالي 3,000 صفحة إجمالاً).
الدقة: كان خط الإنتاج الجديد الخاص بهم أكثر دقة بنسبة 31.9% من مجرد تغذية الذكاء الاصطناعي بالوثيقة كاملة مباشرة. حقق أفضل إعداد الإجابة الصحيحة حوالي 87% من الوقت.
السرعة: على الرغم من إضافة خطوات إضافية، إلا أن النظام لم يكن أبطأ. لأن "أمين المكتبة" قام بتصفية الكثير من الهراء، أصبح لدى "الخبير" عمل أقل للقيام به، مما حافظ على إجمالي الوقت كما هو.
"السبب": أظهرت الدراسة أنه بالنسبة للتقارير المالية الطويلة والفوضوية، فإن إيجاد الصفحة الصحيحة (خطوة أمين المكتبة) كان العامل الأكثر حسمًا. إذا تخطيت هذه الخطوة، سيفشل النظام، بغض النظر عن مدى ذكاء الذكاء الاصطناعي.
باختاًصار
تجادل الورقة بأنه بالنسبة للوثائق المالية الطويلة والفوضوية، لا ينبغي عليك فقط إلقاء ذكاء اصطناعي قوي على المشكلة بأكملها. بدلاً من ذلك، يجب عليك تنظيف البيانات، وترجمتها، وتصفية الضجيج، ثم ترك ذكاء اصطناعي مركز يقوم بعملية الاستخراج النهائية. إنه الفرق بين طلب حفظ مكتبة كاملة من طالب وبين إعطائه كتاباً محدداً وقلم تحديد (Highlighter).
إليك ملخص تقني مفصل للورقة البحثية بعنوان: "خط معالجة متعدد المراحل لاستخراج البيانات من المستندات المالية الممسوحة ضوئياً الطويلة: دراسة تجريبية في تدفقات عمل 'اعرف عميلك' (KYC) الصناعية."
1. بيان المشكلة
تتناول الورقة تحدي استخراج المعلومات المهيكلة من المستندات المالية الممسوحة ضوئياً، الطويلة ومتعددة اللغات، ضمن تدفقات عمل الامتثال و"اعرف عميلك" (KYC) الصناعية.
خصائص المدخلات: المستندات غير قابلة للقراءة آلياً، مشوبة بالضجيج (دقة منخفضة، ميل في الزوايا، عيوب الضغط)، متباينة بصرياً (تمزج بين النصوص، الجداول، الرسوم البيانية، والأختام)، وتمتد لعشرات الصفحات (تصل إلى أكثر من 80 صفحة).
التحدي الجوهري: بينما تؤدي نماذج الرؤية واللغة (VLMs) أداءً جيداً في الاختبارات المعيارية، فإن تطبيقها بشكل مباشر (End-to-End) على التقارير المالية الكاملة يعد أمراً غير عملي بسبب:
التكلفة الحسابية: معالجة المستندات الطويلة بالكامل مكلفة وبطيئة.
الموثوقية: تعاني طرق التحويل المباشر من PDF إلى VLM من مشكلات "الإبرة في كومة القش"، حيث تكون الحقول ذات الصلة نادرة عبر صفحات كثيرة غير ذات ص relevance، مما يؤدي إلى الهلوسة أو فقدان البيانات.
الضجيج: تؤدي عمليات المسح الضوئي الخام إلى تدهور قدرات التعرف الضوئي على الحروف (OCR) والقدرة على الاستنتاج.
2. المنهجية: خط المعالجة متعدد المراحل
يقترح المؤلفون إطار عمل نموذجياً متعدد المراحل يفصل بين تحديد مواقع الصفحات وبين الاستنتاج متعدد الوسائط. يتكون خط المعالجة من أربع مراحل رئيسية:
أ. المعالجة المسبقة للصور
للتخفيف من الضجيج وتحسين موثوقية الـ OCR، يطبق النظام ما يلي:
التجزئة (Segmentation): يستخدم OpenCV لإزالة المساحات الفارغة والحواف الزائدة، مع التركيز على المناطق الحاملة للمحتوى.
تصحيح الميل (Skew Correction): نهج ذو مرحلتين باستخدام مصنف الاتجاه الخاص بـ PaddleOCR لتدوير تقريبي، وتحويل هوف (Hough transform) للمحاذاة الدقيقة.
إعادة التطبيع (Re-normalization):est إعادة القياس عبر الاستيفاء ثنائي التكعيبي (Bicubic interpolation) وتعديل التباين المحدود بالتكيفي (CLAHE) لتعزيز التباين المحلي وكبح آثار الخلفية.
ب. التعرف الضوئي متعدد اللغات والاسترجاع الهجين للصفحات
التعرف الضوئي (OCR): يقوم بنسخ النصوص من الصفحات المعالجة مسبقاً باستخدام محركات متعددة اللغات (PaddleOCRv3 أو EasyOCR) قادرة على التعامل مع النصوص المطبوعة والمكتوبة بخط اليد بلغات متعددة (الإنجليزية، الصينية، الباهاسا).
الاسترجاع الهجين: بدلاً من تغذية جميع الصفحات إلى الـ VLM، يقوم النظام بترتيب الصفحات بناءً على صلتها بالحقول المستهدفة (مثل "الإيرادات"، "صافي الربح").
المطابقة المعجمية (Lexical Matching): يستخدم خوارزمية BM25 للمطابقة الدقيقة للكلمات المفتاحية (وهي مقاومة لضجيج الـ OCR).
المطابقة الدلالية (Semantic Matching): يستخدم تضمينات الجمل (Sentence Embeddings) للتعامل مع المرادفات والمصطلحات غير القياسية.
النتيجة: يتم تمرير الصفحات ذات الصلة العالية فقط إلى مرحلة الاستخراج، مما يقلل من حمل الرموز (Tokens) بنسبة ~70%.
ج. الاستخراج المدمج القائم على نماذج VLM
اختيار النموذج: يستخدم نماذج VLM مدمجة وفعالة (مثل MiniCPM-o-2.6، Gemma-3-27B، Qwen3-VL) بدلاً من النماذج الضخمة.
هندسة الأوامر (Prompt Engineering): يتم توجيه المدخلات عبر أوامر مهيكلة تحتوي على كلمات مفتاحية خاصة بالمجال، وإشارات لنوع المستند، وتعليمات صارمة لتنسيق المخرجات (JSON).
الإنسان في الحلقة (Human-in-the-Loop - HITL): تتضمن الحقول المستخرجة "ملاحظات" (remarks) للتعامل مع حالات الغموض. في تدفقات عمل KYC، تخضع هذه الملاحظات للمراجعة البشرية. يستخدم النظام تصحيحات المحللين لتطوير الأوامر واستعلامات الاسترجاع بشكل تكراري، مع اعتبار المراجعة اليدوية خطوة تشغيلية قياسية وليست تكلفة إضافية.
د. المخرجات المهيكلة
المخرج النهائي هو مخطط JSON يحتوي على سمات مالية محددة (مثل الإيرادات، التوزيعات، العملة).
3. المساهمات الرئيسية
الابتكار المعماري: خط معالجة مفكك يفصل بين الاسترجاع والاستنتاج، مما يثبت أن استرجاع مستوى الصفحة أكثر أهمية من حجم النموذج لمهام المستندات الطويلة.
دراسة تجريبية على بيانات حقيقية: التقييم على مجموعة بيانات مملوكة تتكون من 120 مستند KYC حقيقي (~3,000 صفحة)، تغطي لغات متنوعة (الإنجليزية، الصينية المبسطة والتقليدية، الباهاسا) وأنواع مستندات مختلفة (تقارير التدقيق، قسائم الرواتب).
كفاءة التكلفة: يوضح أن نماذج VLM المدمجة، عندما تُدعم بخط معالجة قوي، يمكنها التفوق على التطبيقات المباشرة للنماذج الأكبر مع الحفاظ على زمن استجابة مماثل للخدمة.
رؤى الاختبارات الاستبعادية (Ablation Insights): قياس تأثير كل مكون (المعالجة المسبقة، الاسترجاع، هندسة الأوامر) على الدقة بشكل منهجي.
4. النتائج التجريبية
قارنت الدراسة خط المعالجة المقترح مقابل خط أساس مباشر (Direct PDF-to-VLM) عبر مجموعات مختلفة من الـ OCR والـ VLM.
الدقة الإجمالية: حقق خط المعاللة الكامل ذروة دقة بلغت 87.27% باستخدام PaddleOCR + MiniCPM-o-2.6.
تحسن الأداء: تفوق خط المعالجة باستمرار على الخط المباشر، حيث حسن دقة الحقول بما يصل إلى 31.9 نقطة مئوية.
مثال: بالنسبة لنموذج MiniCPM-o.2.6 مع PaddleOCR، قفزت الدقة من 55.38% (المباشر) إلى 87.27% (خط المعالجة).
نتائج الاختبارات الاستبعادية:
استرجاع الصفحات: المكون الأكثر أهمية. إزالته تسببت في انخفاض الدقة بنسبة 16.8–24.0%.
المعالجة المسبحة للصور: العامل الثاني من حيث التأثير. إزالتها تسببت في انخفاض بنسبة 6.2–16.3%.
الأوامر المهيكلة (Structured Prompting): قدمت مكاسب متواضعة بشكل عام ولكنها كانت حاسمة في التعامل مع الحالات الحدية.
تباين أنواع المستندات:
البيانات المالية: أظهرت أكبر المكاسب (>40% تحسن) بسبب طولها وتعقيدها.
قسائم الرواتب: أظهرت مكاسب أقل (~8%) لأنها قصيرة ومعيارية، مما يجعل خط الأساس قوياً بالفعل.
زمن الاستجابة (Latency): حافظ خط المعالجة على زمن استجابة خدمة مماثل للخط المباشر لأن تقليل الصفحات المرسلة إلى الـ VLM عوض الوقت المستغرق في المعالجة المسبقة والاسترجاع.
5. الأهمية والخاتمة
تقدم هذه الورقة مخططاً عملياً لنشر الذكاء الاصطناعي في البيئات المالية المنظمة.
القابلية للتوسع: تحل مشكلة "المستندات الطويلة" عن طريق تصفية الضجيج قبل عملية الاستنتاج، مما يجعل معالجة الـ KYC عالية الحجم ممكناً دون تكاليف حوسبة باهظة.
المتانة: تضمن استراتيجية الاسترجاع الهجين الصمود أمام أخطاء الـ OCR والاختلافات متعددة اللغات.
توجيه عملي: تشير النتائج إلى أنه في معالجة المستندات الصناعية، غالباً ما يكون تصميم النظام (الاسترجاع + المعالجة المسبقة) أكثر تأثيراً من مجرد زيادة عدد بارامترات النموذج.
العمل المستقبلي: يحدد المؤلفون قيوداً في التعامل مع النصوص المختلطة (يدوي/مطبوع) وغموض وحدات العملة، مما يشير إلى اتجاهات مستقبلية لتطبيع المصطلحات والتمييز القائم على التعلم.
باختصار، تثبت الورقة أن خط المعالجة المعتمد على الاسترجاع والنمذجة (Modular, Retrieval-Augmented Pipeline) باستخدام نماذج VLM مدمجة هو النهج الأفضل لاستخراج البيانات المهيكلة من المستندات المالية المعقدة في العالم الحقيقي، مما يوفر دفعة كبيرة في الدقة مقارنة بالنماذج المباشرة دون التضحية بالكفاءة.