← أحدث الأبحاث
💬 NLP

Benchmarking Vision-Language Models for French PDF-to-Markdown Conversion

تقدم هذه الورقة معياراً يركز على اللغة الفرنسية لتقييم نماذج الرؤية واللغة في مهام تحويل ملفات PDF إلى Markdown الصعبة، وذلك باستخدام أخذ عينات عدم توافق النماذج ومقاييس تطبيع متخصصة لإثبات أنه بينما تتفوق النماذج المملوكة في المستندات المعقدة المكتوبة بخط اليد والمستندات القائمة على النماذج، تظل العديد من الأنظمة ذات الأوزان المفتوحة تنافسية في التخطيطات المطبوعة القياسية.

المؤلفون الأصليون: Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

نُشر 2026-02-13
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أن لديك مكتبة ضخمة من الوثائق الفرنسية القديمة. بعضها عبارة عن تقارير حديثة واضحة، والبعض الآخر ملاحظات مكتوبة بخط اليد من القرن التاسع عشر، أو نماذج مملوءة بخط يد متعرج، أو صفحات تحتوي على نصوص صغيرة ورسوم بيانية معقدة. هدفك؟ تحويل كل هذه الصور الفوضوية إلى نص رقمي نظيف ومنظم (بصيغة Markdown) يمكن للكمبيوتر قراءته واستخدامه بسهولة للإجابة على الأسئلة.

هذه الورقة البحثية هي في الأساس "تقرير درجات" لأذكى أجهزة الكمبيوتر التي تعمل بالذكاء الاصطناعي (التي تسمى نماذج الرؤية واللغة - Vision-Language Models) والتي تحاول القيام بهذه المهمة. أراد المؤلفون، الذين يعملون لصالح شركات بريدية وبيانات فرنسية، معرفة أي ذكاء اصطناعي هو الأفضل ليكون "أمين مكتبة رقمي".

إليك تفصيل دراستهم، مشروحة ببعض التشبيهات من الحياة اليومية:

1. المشكلة: فخ "الدرجة الكاملة"

تخيل أنك تصحح مقالاً لطالب. إذا استخدمت برنامج كمبيوتر صارم لمقارنة مقال الطالب كلمة بكلمة مع نموذج الإجابة الخاص بالمعلم، فقد ترسب الطالب لمجرد أنه استخدم فاصلة بدلاً من الفاصلة المنقوطة، أو لأنه كسر السطر في مكان مختلف قليلاً.

أدرك المؤلفون أن الاختبارات الحالية للذكاء الاصطناعي كانت تفعل ذلك بالضبط. لقد كانت مهووسة للغاية بـ دقة الإملاء والتنسيق بدلاً من المعنى.

  • الطريقة القديمة: "لقد نسيت فاصلة هنا، ووضعت الجدول بترتيب مختلف. تحصل على صفر."
  • الطريقة الجديدة (هذه الورقة): "هل حصلت على الأفكار الرئيسية بشكل صحيح؟ هل الجدول قابل للقراءة؟ هل فاتتك أي حقائق مهمة؟ إذا كانت الإجابة بنعم، فأنت ناجح، حتى لو كان التنسيق مختلفاً قليلاً."

لقد بنوا اختباراً جديداً يهتم بـ الحقيقة الدلالية (هل فهمت المعنى؟) بدلاً من مثالية السلسلة النصية (هل كتبت كل حرف بدقة؟).

2. الاختبار: التحدي "الخصمي"

للتأكد من اختبار حدود قدرات الذكاء الاصطناعي، لم يكتفوا باختيار صفحات عشوائية. بل استخدموا حيلة ذكية:

  • طلبوا من اثنين من نماذج الذكاء الاصطناعي المختلفة نسخ نفس الصفحة.
  • إذا اختلف النموذجان بشكل جذري، تُصنف تلك الصفحة على أنها "صعبة".
  • جمعوا 60,000 وثيقة واختاروا بعناً أكثر الصفحات فوضوية: نصوص صغيرة، نماذج مكتوبة بخط اليد، جداول كثيفة، وصفحات تحتوي على الكثير من الرسومات.

فكر في الأمر كاختبار قيادة حيث لا يكتفون باختبارك في موقف سيارات فارغ؛ بل يرسلونك في عاصفة ثلجية مع زجاج أمامي مكسور ليروا ما إذا كنت تستطيع القيادة فعلياً.

3. المتسابقون: "عمالقة التكنولوجيا" مقابل "المصدر المفتوح"

وضعوا 15 نموذجاً مختلفاً للذكاء الاصطناعي في هذا الاختبار الصعب.

  • عمالقة التكنولوجيا (النماذج المملوكة): وهي النماذج باهظة الثمن والمغلقة المصدر من شركات مثل Google (Gemini) وOpenAI.
  • أبطال المجتمع (النماذج مفتوحة الأوزان): وهي نماذج مجانية بناها الباحثون والمطورون وشاركوها مع الجميع.

النتائج:

  • تحدي خط اليد والنماذج: كان هذا الجزء الأصعب. كان Google Gemini 3 Pro هو الفائز الواضح، مثل محقق متمرس يمكنه قراءة رسالة قديمة مكتوبة بخط اليد منذ 100 عام. فشلت العديد من النماذج المجانية تماماً هنا، حيث ارتبكت بسبب الخط المتعرج.
  • تحدي النصوص القياسية: بالنسبة للوثائق المطبوعة الواضحة، كان أداء العديد من النماذج المجانية يقارب أداء النماذج المكلفة. إنها رائعة للمهام اليومية.
  • تحدي الرسومات: عانى معظم أجهزة الذكاء الاصطناعي في وصف المخططات والأشكال العلمية. غالباً ما تجاهلوها أو أخطأوا في البيانات. برز نموذج واحد، وهو Chandra، في التعامل مع هذه الرسومات بشكل أفضل، لكنه كان أيضاً الأبطأ.

4. المقايضة بين السرعة والدقة

هناك قاعدة كلاسيكية في عالم التكنولوجيا: سريع ورخيص، أو جيد وبطيء.

  • النماذج السريعة: كانت بعض النماذج (مثل Docing و MinerU) سريعة للغاية، حيث تعالج الصفحة في أقل من ثانية. لكنها غالباً ما تغفل عن التفاصيل أو ترتبك بسبب التنسيقات المعقدة.
  • النماذج المتأنية: كانت أفضل النماذج (مثل Gemini 3 Pro و Chandra) تستغر وقتاً أطول (بضع ثوانٍ لكل صفحة) لكنها تنتج نتائج ذات جودة أعلى بكثير.
  • عامل "الخلل": لاحظ المؤلفون أنه عندما تكون جودة الصورة منخفضة (نصوص صغيرة)، فإن بعض النماذج الأصغر قد "تتعثر" في حلقة مفرغة، فتكرر نفس الجملة مراراً وتكراراً، أو تتخطى أقساماً كاملة من الصفحة.

5. الخلاصة

تخلص الورقة إلى ما يلي:

  1. إذا كنت بحاجة لقراءة خط يد فوضوي أو نماذج معقدة: فأنت حالياً بحاجة إلى النماذج الرائدة والمكلفة (مثل Gemini). النماذج المجانية ليست في هذا المستوى بعد.
  2. إذا كنت تتعامل مع نصوص مطبوعة نظيفة: يمكنك استخدام النماذج المجانية مفتوحة المصدر لتوفير المال.
  3. الاختبار كيان حي: المؤلفون لا ينشرون مجرد نتيجة؛ بل يدعون المجتمع بأكمله للمساعدة في تحسين الاختبار، وإضافة أنواع جديدة من الوثائق، والحفاظ على تحديث قائمة المتصدرين.

باخت-القول: هذه الورقة هي دليل لأي شخص يحاول تحويل ملفات PDF الفرنسية إلى بيانات. إنها تخبرك أنه بينما أصبح الذكاء الاصطناعي مذهلاً في قراءة الوثائق، فإنه لا يزال يعاني مع "الفوضى البشرية" المتمثلة في خط اليد والتنسيقات المعقدة، وعليك اختيار أداتك بناءً على ما إذا كنت تحتاج إلى السرعة أم المثالية.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →