← أحدث الأبحاث
💻 computer science

ParseBench: A Document Parsing Benchmark for AI Agents

تقدم هذه الورقة ParseBench، وهو معيار مرجعي جديد يضم حوالي 2,000 وثيقة مؤسسية تم التحقق منها بشرياً، صُممت لتقييم وكلاء الذكاء الاصطناعي بناءً على خمسة أبعاد حرجة للصحة الدلالية — الجداول، والرسوم البيانية، وأمانة المحتوى، والتنسيق الدلالي، والتأسيس البصري — مما يكشف أن طرق التحليل الحالية تفتقر إلى الأداء المتسق عبر جميع القدرات.

المؤلفون الأصليون: Boyang Zhang, Sebastián G. Acosta, Preston Carlson, Sacha Bron, Pierre-Loïc Doulcet, Simon Suo

نُشر 2026-04-10
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Boyang Zhang, Sebastián G. Acosta, Preston Carlson, Sacha Bron, Pierre-Loïc Doulcet, Simon Suo

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك وظفت مساعداً آلياً (روبوت) فائق الذكاء لمساعدتك في إدارة الأعمال اليومية لشركتك. يحتاج هذا الروبوت إلى قراءة آلاف الوثائق يومياً: مطالبات التأمين، كشوف الحسابات البنكية، اللوائح الحكومية، والعقود المعقدة.

في الماضي، كنا نسأل الروبوت ببساطة: "هل يمكنك قراءة هذا؟" وإذا استطاع الروبوت تحويل ملف الـ PDF إلى نص يشبه الأصل تقريباً، كنا نعتبر ذلك إنجازاً.

لكن الآن، نحتاج من الروبوت أن يتصرف بناءً على تلك المعلومات. يجب عليه الموافقة على قرض، أو تقديم إقرار ضريبي، أو رفض مطالبة تأمين. إذا أخطأ الروبوت في قراءة رقم، أو بدل بين عمودين في جدول، أو أغفل سطراً مكتوباً عليه "ملغي" مع خط مشطوب، فقد يرتكب خطأً كارثياً. الأمر لم يعد يتعلق بـ "القراءة" فحسب؛ بل يتعلق بـ الفهم والثقة.

تقدم هذه الورقة البحثية ParseBench، وهو "اختبار رخصة قيادة" جديد لهذه الروبوتات الذكية، لنرى ما إذا كانت مستعدة حقاً للقيادة على طريق السريع للأعمال الواقعية.

المشكلة: الاختبارات القديمة كانت سهلة للغاية

تخيل أنك تعلم طفلاً القيادة.

  • الاختبارات القديمة: تضعه في ساحة انتظار سيارات بها أقماع فارغة وتطلب منه القيادة في خط مستقيم. سينجح بسهولة.
  • الواقع: القيادة الحقيقية تتضمن الأمطار، وحركة المرور الكثيفة، وعلامات الطريق المربكة، والأشخاص الذين يعبرون الطريق بشكل مفاجئ.

كانت اختبارات الذكاء الاصطناعي الحالية تشبه ساحة انتظار السيارات. فقد استخدمت وثائق بسيطة (معظمها أوراق أكاديمية) وتحققت فقط مما إذا كان النص الناتج يشبه الأصل. لقد أغفلت التعقيدات والفوضى التي تحدث في الشركات الحقيقية.

الحل: ParseBench (اختبار الضغط)

إن ParseBench هو مسار عقبات ضخم تم التحقق منه بشرياً. يحتوي على حوالي 2,000 صفحة من وثائق حقيقية وفوضوية من شركات التأمين، والبنوك، والحكومات.

بدلاً من مجرد التحقق مما إذا كان النص يبدو صحيحاً، يختبر ParseBench الذكاء الاصطناعي في خمس مهارات محددة (الأبعاد الخمسة):

  1. سيد الجداول (الجداول):
    • التحدي: الجداول الحقيقية فوضوية. تحتوي على خلايا مدمجة (مثل رأس جدول كبير يمتد عبر ثلاثة أعمدة)، ورؤوس جداب تمتد عبر صفحات متعددة، وشبكات معقدة.
    • الاختبار: إذا بدل الذكاء الاصطناعي بين عمودين أو أغفل خلية مدمجة، فكأن الروبوت قرأ سعراً قدره 50 دولاراً على أنه 500 دولار. يتحقق ParseBench مما إذا كان الذكاء الاصطناعي يفهم البنية، وليس الكلمات فقط.
  2. محقق المخططات (الرسوم البيانية):
    • التحدي: تحويل صورة رسم بياني إلى جدول بيانات.
    • الاختبار: هل يمكن للذكاء الاصطناعي النظر إلى مخطط شريطي وقول: "هذا الشريط قيمته بالضبط 401,000 دولار"؟ العديد من نماذج الذكاء الاصطناعي تكتفي بوصف المخطط ("إنه شريط أزرق يتجه للأعلى") بدلاً من استخراج الأرقام الفعلية اللازمة للحسابات.
  3. قائل الحقيقة (أمانة المحتوى):
    • التحدي: عدم اختلاق معلومات أو ترك أشياء مهمة.
    • الاختبار: إذا كانت الوثيقة الأصلية تقول "الدفع ملغي" وقال الذكاء الاصطناعي "الدفع تمت الموافقة عليه"، فهذا "هلوسة". وإذا أغفل الذكاء الاصطناعي فقرة كاملة، فهذا "حذف". يجب أن يكون الروبوت أميناً بنسبة 100% للمصدر.
  4. المصمم (التنسيق الدلالي):
    • التحدي: فهم أن التنسيق له معنى.
    • الاختبار: في العقود، إذا كان السعر مكتوباً بخط عريض (Bold)، فقد يكون هو السعر النهائي. وإذا كان عليه خط مشطوب، فهو ملغى. وإذا كان بخط صغير مرتفع (Superscript) (مثل علامة الهامش)، فهو مرجع. الكثير من نماذج الذكاء الاصطناعي تجرد هذا التنسيق، محولةً وثيقة دقيقة إلى نص مسطح ومربك.
  5. نظام تحديد المواقع (التأسيس البصري):
    • التحدي: معرفة من أين جاءت المعلومة.
    • الاختبار: إذا قال الذكاء الاصطناعي "الإجمالي هو 100 دولار"، فهل يمكنه الإشارة بإصبعه إلى المكان المحدد في الصفحة الأصلية حيث كُتب مبلغ الـ 100 دولار؟ هذا أمر بالغ الأهمية لعمليات التدقيق. إذا سأل الإنسان: "أرني الدليل"، يجب أن يكون الروبوت قادراً على الإشارة إليه.

النتائج: من اجتاز الاختبار؟

اختبر المؤلفون 14 نظاماً مختلفاً للذكاء الاصطناعي، من عمالقة التكنولوجيا (مثل Google وOpenAI وAnthropic) إلى أدوات تحليل الوثائق المتخصصة.

  • الحكم النهائي: لا يوجد روبوت واحد مثالي في كل شيء.
    • بعضها بارع في قراءة النصوص لكنه سيء جداً في قراءة المخططات.
    • بعضها جيد في تحديد المكان الصحيح في الصفحة لكنه سيء في فهم بنية الجدول.
    • معظم نماذج الذكاء الاصطناعي "العامة" (التي تدردش معها) تعاني مع التفاصيل الدقيقة لأعمال الشركات.
  • الفائز: حقق النظام الخاص بالمؤلفين، LlamaParse Agentic، أعلى درجة إجمالية (84.9%). كان الوحيد الذي أظهر قوة متسقة عبر جميع المهارات الخمس الصعبة.

لماذا هذا مهم؟

فكر في هذا كفرق بين السائح والجراح.

  • السائح يمكنه النظر إلى خريطة وقول: "هذا يبدو كمستشفى".
  • أما الجراح، فعليه أن يعرف بالضبط مكان الشق، والعرق الذي يجب تجنبه، والجرعة الدقيقة للدواء.

لكي يكون الذكاء الاصطناعي مفيداً في الأعمال، يجب أن يكون هو "الجراح". لا يكفي أن "يرى" الوثيقة فحسب؛ بل يجب أن يحللها بدقة الجراح حتى عندما يتخذ قراراً، يكون هذا القرار آمناً، دقيقاً، وجديراً بالثقة.

ParseBench هو الأداة التي تسمت لنا أخيراً قياس ما إذا كانت روبوتات الذكاء الاصطناعي لدينا جاهزة لتكون جراحين، أم أنها لا تزال مجرد سياح ينظرون إلى الخريطة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →