← أحدث الأبحاث
💻 computer science

PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing

يُعد PaddleOCR-VL-1.5 نموذجاً لغوياً بصرياً مطوراً فائق الصغر بحجم 0.9 مليار معلمة، يحقق أداءً هو الأفضل في مجاله في مهام تحليل المستندات، بما في ذلك المتانة ضد التشوهات الفيزيائية الواقعية والقدرات الجديدة مثل التعرف على الأختام وتحديد مواقع النصوص.

المؤلفون الأصليون: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

نُشر 2026-04-07
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Cheng Cui, Ting Sun, Suyin Liang, Tingquan Gao, Zelun Zhang, Jiaxuan Liu, Xueqing Wang, Changda Zhou, Hongen Liu, Manhui Lin, Yue Zhang, Yubo Zhang, Yi Liu, Dianhai Yu, Yanjun Ma

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة من المستندات. بعضها عبارة عن ملفات PDF مثالية وواضحة مستخرجة من جهاز كمبيوتر، والبعض الآخر عبارة عن إيصالات مجعدة، أو صور لسبورات بيضاء ملتقطة في إضاءة خافتة، أو مسوحات مائلة لصحف قديمة، أو صفحات تبدو وكأنها طُبعت على طاولة مهتزة.

لفترة طويلة، كانت أجهزة الكمبيوتر بارعة في قراءة المستندات المثالية، لكنها كانت سيئة للغاية في التعامل مع المستندات الفوضوية والواقعية. كانت ترتبك أمام صورة مائلة أو ختم باهت.

PaddleOCR-VL-1.5 هو بمثابة أمين مكتبة جديد فائق الذكاء، تخرج للتو من معسكر تدريبي مكثف للغاية. إليك ما يجعل أمين المكتبة الجديد هذا مميزاً، مشروحاً ببساطة:

1. "العملاق الصغير" (الكفاءة)

معظم أمناء المكتبة من الذكاء الاصطناوي الفائق يشبهون الفيلة: ضخام، يتطلبون كميات هائلة من الطعام (قوة الحوسبة)، ويتحركون ببطء.

  • الطريقة القديمة: للحصول على درجة عالية، كنت بحاجة إلى ذكاء اصطناعي عملاق يمتلك مليارات "الخلايا الدماغية" (المعلمات/Parameters).
  • الطريقة الجديدة: نموذج PaddleOCR-VL-1.5 هو نموذج بـ 0.9 مليار معلمة. فكر فيه كأنه سيارة رياضية رشيقة وعالية الأداء. إنه صغير مقارنة بالفيلة (التي يصل بعضها إلى أكثر من 200 مليار معلمة)، لكنه يعمل بشكل أسرع، ويستهلك وقوداً أقل، ومع ذلك يمكنه هزيمة الفيلة في السباق. إنه يثبت أنك لست بحاجة لأن تكون ضخماً لتكون عبقرياً.

2. "النظارات السحرية" (التعامل مع التشوهات)

تخيل أنك تحاول قراءة قائمة طعام بينما يقوم شخص ما بهز الطاولة، والأضواء تومض، والورقة منحنية. القارئ العادي سيستسلم.

  • المشكلة: المستندات في العالم الحقيقي نادراً ما تكون مثالية. فهي تُمسح ضوئياً بشكل مائل، أو تتشوه بفعل الحرارة، أو تُصور بشاشة هاتف تسبب أنماطاً غريبة (Moiré).
  • الحل: هذا النموذج الجديد يرتدي "نظارات سحرية" خاصة (تسمى PP-DocLayoutV3).
    • بدلاً من رؤية مجرد مربع حول الفقرة، فإنه يرى الشكل الدقيق للنص، حتى لو كان ملتوياً مثل قطعة "البريتزل".
    • يمكنه تحديد ترتيب القراءة فوراً. إذا كانت الصفحة مائلة بزاوية 45 درجة، فهو يعرف أن يقرأ من أعلى اليسار إلى أسفل اليمين، وليس فقط من اليسار إلى اليمين. إنه يصلح "الالتواء" في دماغه قبل أن يبدأ حتى في قراءة الكلمات.

3. "القوى الخارقة الجديدة" (الأختام والرصد)

كان أمين المكتبة القديم يستطيع قراءة النصوص والجداول، لكن كانت لديه نقاط عمياء.

  • التعرف على الأختام: تخيل مستنداً عليه ختم دائري أحمر فوق النص. قد يكون الختم باهتاً أو منحنياً. يمكن لأمين المكتبة الجديد أن "يقشر" هذا الختم ذهنياً ويقرأ النص تحته، أو يقرأ النص الموجود على الختم نفسه.
  • رصد النصوص (Text Spotting): أحياناً لا يكون النص في فقرة مرتبة؛ بل يكون على لوحة إعلانية، أو جدار عليه رسومات "غرافيتي"، أو لافتة دوارة. أمين المكتبة الجديد لا يكتفي بقراءة الكلمات فحسب؛ بل يمكنه الإشارة بدقة إلى مكان تلك الكلمات في الصورة، حتى لو كانت مبعثرة في كل مكان.

4. "الاختبار الصعب" (Real5-OmniDocBench)

لإثبات جاهزيتهم للعالم الحقيقي، لم يكتفِ المبدعون باختبارهم على مستندات نظيفة ومثالية. بل أنشأوا "دورة بقاء" تسمى Real5-OmniDocBench.

  • أخذوا المستندات وأخضعوها لخمسة اختبارات تعذيب: المسح الضوئي (جودة سيئة)، الالتواء (صفحات منحنية)، تصوير الشاشات (التقاط صورة لشاشة)، الإضاءة السيئة، والميلان (زوايا مائلة).
  • النتيجة: بينما تعثرت نماذج الذكاء الاصطنا الأخرى وفشلت في هذه الاختبارات الفوضوية، حقق PaddleOCR-VL-1.5 نسبة 92.05%. لم يكتفِ بالنجاح فح، بل سيطر تماماً، متفوقاً على نماذج الذكاء الاصطناعي الأكبر والأثقل بكثير.

5. "خط التجميع" (السرعة)

قراءة كتاب كامل تستغرق وقتاً. الطريقة القديمة كانت تشبه قراءة صفحة واحدة، ثم وضعها جانباً، ثم التفكير، ثم قراءة الصفحة التالية.

  • الطريقة الجديدة: بنى الفريق نظام حزام ناقل.
    • بينما يقوم "فريق التخطيط" بتحديد أماكن الفقرات في الصفحة رقم 1، يكون "فريق القراءة" قد بدأ بالفعل في قراءة الصفحة رقم 2.
    • هذه المعالجة المتوازية تجعل أمين المكتبة سريعاً للغاية، وقادراً على معالجة آلاف الصفحات في الساعة دون تعب.

الخلا الخلاصة

PaddleOCR-VL-1.5 هو طفرة لأنه يجمع بين الحجم الصغير والذكاء الهائل. إنه أول أداة يمكنها أخذ صورة فوضوية، مجعدة، ومائلة لمستند من جيبك، وفهم ماهيته بالضبط، وإصلاح التشوهات، وقراءة النص (حتى تحت الأختام)، وتنظيمه بشكل مثالي—كل ذلك أثناء العمل على جهاز كمبيوتر عادي دون الحاجة إلى كمبيوتر خارق.

إنه يحول عالم المستندات الفوضوي والمبعثر إلى بيانات نظيفة ومنظمة يمكن لأجهزة الكمبيوتر استخدامها فعلياً.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →