← أحدث الأبحاث
💻 computer science

A Multistage Extraction Pipeline for Long Scanned Financial Documents: An Empirical Study in Industrial KYC Workflows

تقدم هذه الورقة خط معالجة متعدد المراحل يعمل على فصل تحديد موقع الصفحة عن الاستدلال متعدد الوسائط لتحسين دقة استخراج المعلومات الهيكلية بشكل كبير في مستندات "اعرف عميلك" (KYC) الصناعية الصاخبة ومتعددة اللغات والطويلة، متفوقاً على النماذج المرجعية لنماذج الرؤية واللغة المباشرة من طرف إلى طرف بما يصل إلى 31.9 نقطة مئوية.

المؤلفون الأصليون: Yuxuan Han, Yuanxing Zhang, Yushuo Wang, Yichao Jin, Kenneth Zhu Ke, Jingyuan Zhao

نُشر 2026-04-30
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yuxuan Han, Yuanxing Zhang, Yushuo Wang, Yichao Jin, Kenneth Zhu Ke, Jingyuan Zhao

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك موظف في بنك تحاول قراءة كومة ضخمة وفوضوية من التقارير المالية القديمة للتحقق مما إذا كان العميل جديراً بالثقة. هذه ليست وثائق مرتبة ومطبوعة؛ بل هي نسخ ضوئية ممسوحة ضوئياً، بعضها مائل، وبعضها غير واضح، ومكتوبة بلغات مختلفة. والأسوأ من ذلك، قد يكون التقرير الواحد مكوناً من 80 صفحة، لكن الرقم الوحيد الذي تحتاجه (مثل "صافي الربح") مخفي في الصفحة 42 فقط.

تصف هذه الورقة طريقة جديدة وأكثر ذكاءً للتعامل مع هذه الكومة من الأوراق. فبدلاً من محاولة قراءة الكومة بأكملها دفعة واحدة، قام المؤلفون ببناء خط تجميع متعدد المراحل يعمل كفريق من العمال المتخصصين.

إليك كيف يعمل نظامهم، باستخدام تشبيهات بسيطة:

1. المشكلة: "العملاق الأعمى"

حاول المؤلفون استخدام أحدث نماذج الذكاء الاصطناعي الأكثر قوة (تسمى نماذج الرؤية واللغة أو VLMs) لقراءة هذه الوثائق. لقد عاملوا الذكاء الاصطناعي كأنه عملاق يحاول ابتلاع كتاب من 80 صفحة في قضمة واحدة.

  • النتيجة: يصاب العملاق بالارتباك. يختنق بالضجيج، ويفقد التفاصيل الصغيرة، وغالباً ما يعطي إجابة خاطئة. كما أنه بطيء جداً ومكلف لإطعام العملاق هذا القدر الهائل من الطعام دفعة واحدة.

2. الحل: "الفريق المتخصص"

بدلاً من وجود عملاق واحد، أنشأ المؤلفون خط إنتاج يتكون من أربع خطوات متميزة، مثل مصنع منظم جيداً:

  • الخطوة 1: "عامل النظافة" (المعالجة المسبقة للصور)
    قبل أن يقرأ أي شخص الوثيقة، يقوم "عامل النظافة" بتنظيفها. تقوم هذه الخطوة بتعديل الصفحات المائلة، وإزالة بقع القهوة والظلال، وجعل النص حاداً وواضحاً. الأمر يشبه كيّ قميص مجعد قبل محاولة قراءة الملصق الموجود عليه.

  • الخطوة 2: "المترجم" (التعرف الضوئي على الحروف متعدد اللغات - OCR)
    يتم تمرير الصفحات المنظفة إلى مترجم (OCR) يحول صور النصوص إلى كلمات رقمية فعلية. وبما أن هذه الوثائق بالإنجليزية والصينية والإندونيسية وغيرها، فإن هذا المترجم يجيد لغات عديدة ويمكنه حتى قراءة الكتابة اليدوية الفوضوية.

  • الخطوة 3: "أمين المكتبة" (استرجاع مستوى الصفحة)
    هذه هي الخطوة الأهم. تخيل أنك بحاجة للعثور على حقيقة محددة في كتاب من 100 صفحة. بدلاً من قراءة كل صفحة، تقوم باستئجار أمين مكتبة. يقوم أمين المكتبة بمسح سريع لجدول المحتويات والنصوص ليقول لك: "مهلاً، الإجابة موجودة في الصفحات 12 و15 و42. تجاهل الصفحات الـ 95 الأخرى".

    • لماذا هذا مهم: وجدت الورقة أن هذه الخطوة هي "السر الخفي". فمن خلال تصفية الصفحات غير ذات الصلة، يوفر النظام كميات هائلة من الوقت والمال، ويمنع الذكاء الاصطناعي من التشتت بمعلومات غير مفيدة.
  • الخطوة 4: "الخبير" (استخراج البيانات بواسطة نموذج VLM مدمج)
    الآن، يرسل النظام تلك الصفحات القليلة ذات الصلة فقط إلى "الخبير" (الذكاء الاصطناعي). ولأن الخبير ليس مثقلاً بـ 80 صفحة من الهراء، يمكنه التركيز تماماً على الأرقام المحددة التي تحتاجها. تستخدم الورقة ذكاءً اصطناعياً "مدمجاً" (أصغر وأسرع) لهذا العمل، والذي يعمل بشكل جيد بشكل مدهش عندما يُعطى بيانات نظيفة ومركزة.

  • الخطوة 5: "المراجعة البشرية" (الإنسان في الحلقة - Human-in-the-Loop)
    أخيراً، يقوم محلل بشري بمراجعة عمل الذكاء الاصطناعي لفترة وجيزة. يشير المؤلفون إلى أن البشر في القطاع المصرفي يضطرون بالفعل للتحقق من هذه الوثائق للامتثال للوائح السلامة. هذا النظام يجعل مهمة الإنسان أسهل عبر تسليط الضوء على الأجزاء ذات الصلة وتنبيهه لأي شيء لم يكن الذكاء الاصطناعي متأكداً منه.

النتائج: فوز كبير

اختبر الفريق هذا النظام على 120 وثيقة مالية حقيقية (حوالي 3,000 صفحة إجمالاً).

  • الدقة: كان خط الإنتاج الجديد الخاص بهم أكثر دقة بنسبة 31.9% من مجرد تغذية الذكاء الاصطناعي بالوثيقة كاملة مباشرة. حقق أفضل إعداد الإجابة الصحيحة حوالي 87% من الوقت.
  • السرعة: على الرغم من إضافة خطوات إضافية، إلا أن النظام لم يكن أبطأ. لأن "أمين المكتبة" قام بتصفية الكثير من الهراء، أصبح لدى "الخبير" عمل أقل للقيام به، مما حافظ على إجمالي الوقت كما هو.
  • "السبب": أظهرت الدراسة أنه بالنسبة للتقارير المالية الطويلة والفوضوية، فإن إيجاد الصفحة الصحيحة (خطوة أمين المكتبة) كان العامل الأكثر حسمًا. إذا تخطيت هذه الخطوة، سيفشل النظام، بغض النظر عن مدى ذكاء الذكاء الاصطناعي.

باختاًصار

تجادل الورقة بأنه بالنسبة للوثائق المالية الطويلة والفوضوية، لا ينبغي عليك فقط إلقاء ذكاء اصطناعي قوي على المشكلة بأكملها. بدلاً من ذلك، يجب عليك تنظيف البيانات، وترجمتها، وتصفية الضجيج، ثم ترك ذكاء اصطناعي مركز يقوم بعملية الاستخراج النهائية. إنه الفرق بين طلب حفظ مكتبة كاملة من طالب وبين إعطائه كتاباً محدداً وقلم تحديد (Highlighter).

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →