← أحدث الأبحاث
💻 computer science

Boosting Document Parsing Efficiency and Performance with Coarse-to-Fine Visual Processing

تقدم الورقة البحثية PaddleOCR-VL، وهو نموذج لغوي بصري جديد بـ 0.9 مليار معلمة يعمل بآلية من الخشن إلى الناعم، يستخدم وحدة تركيز المنطقة الصالحة خفيفة الوزن لتحديد ومعالجة المناطق الوثائقية ذات الصلة دلاليًا فقط، مما يحقق أداء تحليل هو الأفضل في فئته مع تقليل التكاليف الحسابية ورموز الرؤية بشكل كبير مقارنة بالنهج عالية الدقة الحالية.

المؤلفون الأصليون: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Jing Zhang, Jun Zhang, Xing Wei, Yi Liu, Dianhai Yu
نُشر 2026-03-26
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Jing Zhang, Jun Zhang, Xing Wei, Yi Liu, Dianhai Yu, Yanjun Ma

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة وفوضوية حيث كل كتاب فيها ذو حجم مختلف، بعضها مكتوب بخط اليد، وبعضها يحتوي على رسوم بيانية معقدة، وأخرى مغطاة بورق حائط مزخرف. هدفك هو قراءة كل كلمة، وفهم المعادلات الرياضية، ومعرفة الترتيب الصحيح لقراءة الصفحات.

القيام بذلك يدويًا أمر بطيء ومرهق. أما القيام به باستخدام الكمبيوتر فهو عادةً أكثر صعوبة لأن الكمبيوتر يحاول النظر إلى كل بكسل بمفرده في كل صفحة. إذا كانت الصفحة عالية الدقة (واضحة تمامًا)، فسيشعر الكمبيوتر بالإرهاق، مثل شخص يحاول الشرب من خرطوم إطفاء الحريق. إنه يهدر الطاقة في النظر إلى الهوامش الفارغة، والحدود المزخرفة، والمساحات البيضاء، وهي أشياء لا تحتوي في الواقع على أي معلومات مفيدة.

إليك PaddleOCR-VL: "المكتبي الذكي"

قام الباحثون وراء هذه الورقة البحثية (من فريق PaddlePaddle التابع لشركة Baidu) ببناء نظام جديد يسمى PaddleOCR-VL. بدلاً من محاولة ابتلاع المكتبة بأكملها دفعة واحدة، ابتكروا استراتيجية "من العام إلى الخاص" (Coarse-to-Fine). فكر في الأمر كأنك توظف مكتبيًا ذكيًا يعمل مع قارئ متخصص.

الخطوة 1: المكتبي الذكي (المرحلة "العامة")

تخيل مكتبيًا يدخل غرفة مليئة بالأوراق الفوضوية. بدلاً من قراءة كل كلمة فورًا، لديه نظارات خاصة (تسمى وحدة التركيز على المنطقة الصالحة أو VRFM).

  • ماذا يفعل: يقوم بمسح الغرفة بسرعة ويشير فقط إلى الأجزات التي تهم: كتل النصوص، والمعادلات الرياضية، والرسوم البيانية.
  • ما يتجاهله: يتجاهل تمامًا المساحات البيضاء الفارغة، والحدود المزخرفة، والضجيج في الخلفية.
  • السحر الكامن فيه: كما أنه يحدد ترتيب القراءة. إذا كانت الصفحة تحتوي على نص في أعلى اليسار، ورسم بياني في المنتصف، وشريط جانبي على اليمين، فإن المكتبي يعرف أن يقرأ أعلى اليسار أولاً، ثم المنتصف، ثم اليمين.

من خلال القيام بذلك، يستبعد المكتبي حوالي 60% من النفايات قبل أن تبدأ عملية العمل الشاق. ثم يسلم فقط "الأشياء الجيدة" إلى الشخص التالي.

الخطوة 2: القارئ المتخصص (المرحلة "الدقيقة")

الآن، يتم تسليم "الأشياء الجيدة" (النصوص والرسوم البيانية المقصوصة) إلى قارئ ذكي جدًا، ولكنه صغير وسريع (نموذج PaddleOCR-VL-0.9B).

  • لماذا هو أفضل: لأن القارئ لا يضيع وقته في النظر إلى الهوامش الفارغة، يمكنه تركيز 100% من طاقته الذهنية على فهم التفاصيل المعقدة. يمكنه قراءة الخط اليدوي الصغير، وحل المسائل الرياضية الصعبة، وتفسير الجداول الفوضوية بدقة مذهلة.
  • النتيجة: ينتج نسخة رقمية نظيفة ومنظمة من المستند (مثل ملف Markdown) يمكن للكمبيوتر استخدامها بسهولة.

لماذا يعد هذا أمرًا بالغ الأهمية؟

1. إنه "خبير الكفاءة"
الأنظمة القديمة كانت مثل شخص يحاول قراءة جريدة كاملة من خلال التحديق في كل نقطة حبر، حتى المساحات البيضاء بين الأعمدة. جعل هذا الأمر بطيئًا ومكلفًا (يتطلب أجهزة كمبيوتر ضخمة وغالية الثمن).
أما PaddleOCR-VL فهو مثل شخص يمسح الصفحة بسرعة، ويقص المقالات التي يحتاجها، ويقرأ فقط تلك الأجزاء. إنه يستخدم عددًا أقل من "الرموز" (Tokens) (وحدات المعلومات التي يعالجها الكمبيوتر) ويعمل بسرعة أكبر بكثير على الأجهزة القياسية.

2. إنه "ملك الدقة"
لأن النظام يركز فقط على ما يهم، فإنه يرتكب أخطاءً أقل. لا يرتبك بسبب التنسيق. يمكنه التعامل مع:

  • الخط اليدوي: حتى الملاحظات الفوضوية.
  • المعادلات الرياضية: المعادلات المعقدة التي تبدو كأنها رموز فضائية.
  • الجداول: الجداول الفوضوية ذات الخلايا المدمجة.
  • الرسوم البيانية: تحويل صورة رسم بياني إلى جدول بيانات.
  • 109 لغات: من الإنجليزية والصينية إلى الهندية والروسية.

3. "النظام الغذائي للبيانات"
لم يكتفِ الفريق ببناء عقل ذكي فحسب؛ بل أطعموه نظامًا غذائيًا هائلًا وعالي الجودة. لقد جمعوا أكثر من 30 مليون مثال للمستندات، بما في ذلك الأشياء التي قد تجدها في العالم الحقيقي (مثل الكتب القديمة، وأوراق الامتحانات، والتقارير المالية) وحتى أنشأوا أمثلة وهمية لتعليم النظام كيفية التعامل مع الحالات الصعبة (مثل النصوص الضبابية أو الخطوط الغريبة).

الخلاصة

فكر في PaddleOCR-VL كفرق بين محاولة العثور على إبرة في كومة قش عن طريق الحفر عبر الكومة بأكملها، مقابل استخدام مغناطيس لسحب الإبرة فورًا.

إنه يأخذ مستندًا فوضويًا ومعقدًا، يصفي الضجيج، يحدد الترتيب، ثم يقرأ الأجزاء المهمة بسرعة ودقة خارقتين. وهذا يعني أن الشركات يمكنها معالجة ملايين المستندات بسرعة لتدريب نماذج الذكاء الاصطناعي، أو بناء محركات البحث، أو تنظيم الأرشيفات، وكل ذلك دون الحاجة إلى حاسوب فائق لكل صفحة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →