Evaluating Vision-Language Models for Structured Information Extraction from Heterogeneous Multi-Page Laboratory Reports
تقيم هذه الدراسة نماذج الرؤية واللغة لاستخراج البيانات المهيكلة من التقارير المخبرية غير المتجانسة متعددة الصفحات، حيث وجدت أنه في حين توفر معالجة المستند بالكامل سرعة فائقة، فإن سير العمل صفحة بصفحة باستخدام نموذج Qwen2.5-VL يحقق أعلى مستويات الدقة والاستقرار عبر أطوال المستندات المتفاوتة.
البحث الأصلي مرخَّص بموجب CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل
تنتج المستشفيات محيطاً هائلاً من السجلات الورقية والرقمية كل يوم، بدءاً من الملاحظات السردية التي يكتبها الأطباء وصولاً إلى النتائج الجدولية الكثيفة للاختبارات المختبرية. ولكي تتمكن الحواسيب من مساعدة الأطباء في اتخاذ قرارات أفضل أو مساعدة الباحثين في إيجاد أنماط للأمراض، يجب تحويل هذه المعلومات من صور ونصوص إلى بيانات نظيفة ومنظمة يمكن للآلات قراءتها. هذه العملية، المعروفة باسم استخراج المعلومات، كانت لفترة طويلة عقبة أمام التقدم لأن الوثائق الطبية فوضوية؛ فهي تأتي بأشكال وأحجام وتنسيقات مختلفة؛ فبعضها ملفات رقمية واضحة، بينما البعض الآخر عبارة عن نسخ ضبابية لأوراق قديمة. علاوة على ذلك، غالباً ما تكون المعلومات مبعثرة عبر صفحات متعددة، حيث تترتب أسماء الاختبارات والأرقام والوحدات في جداول معقدة تبدو مختلفة من مستشفى لآخر.
في السنوات الأخيرة، ظهر نوع جديد من الذكاء الاصطناعي يسمى "نموذج الرؤية واللغة" لمعالجة هذا التحدي. وخلافاً للأنظمة القديمة التي كانت تستطيع فقط قراءة النصوص أو رؤية الصور، يمكن لهذه النماذج النظر إلى صورة وثيقة وفهم كل من التخطيط البصري والكلمات الموجودة بداخلها في آن واحد. يمكنها أن ترى أن رقماً ما ينتمي إلى اختبار معين بسبب موقعه على الصفحة، وليس فقط لأنه يتبع كلمة محددة. ومع ذلك، وبينما تعد هذه النماذج قوية، لم يكن العلماء يفهمون تماماً الطريقة المثلى لتغذيتها بهذه الوثائق المعقدة متعددة الصفحات. هل ينبغي للحاسوب أن ينظر إلى تقرير مكون من عشر صفحات دفعة واحدة، أم يجب عليه فحص الصفحات واحدة تلو الأخرى؟ الإجابة على هذا السؤال تحدد ما إذا كان الحاسوب سيفقد تفاصيل مهمة أو يهدر الوقت، وهو تمييز يكتسب أهمية بالغة عندما تُستخدم البيانات لتوجيه رعاية المرضى.
لقد شرع فريق من الباحثين في إيجاد الإجابة من خلال إجراء تجربة منضبطة باستخدام تقارير مختبرية من الواقع. جمعوا نتائج اختبارات مجهولة الهوية من مزودين رئيسيين، هما "لال باث لابس" (Lal PathLabs) و"ثايروكير" (Thyrocare)، وأعدوا نسخاً من هذه التقارير في كل من التنسيقات الرقمية والممسوحة ضوئياً. ولضمان عدالة الاختبار، أعدوا ثلاثة أطوال مختلفة من الوثائق: تقرير قصير من صفحة واحدة، وتقرير متوسط يتراوح بين خمس إلى ست صفحات، وتقرير طويل يمتد لعشر صفحات. ثم اختبروا ثلاث طرق مختلفة لمعالجة هذه الوثائق باستخدام نموذجين رائدين من الذكاء الاصطناعي، وهما Qwen2.5-VL وLlama 3.2 Vision. النهج الأول طلب من النموذج النظر إلى التقرير بالكامل كصورة واحدة. النهج الثاني طلب من النموذج النظر إلى كل صفحة على حدة ثم دمج النتائج. أما النهج الثالث فقد استخدم نموذجاً مختلفاً للنظر في الصفحات بشكل فردي.
كشفت النتائج أن الاستراتيجية المستخدمة لتقديم الوثيقة كانت لا تقل أهمية عن النموذج نفسه. فعندما طلب الباحثون من نموذج Qwen2.5-VL معالجة التقارير صفحة بصفحة، حقق أعلى مستوى من الدقة، حيث حدد وسجل بدقة ما يقرب من 99 بالمائة من نتائج الاختبارات المتوقعة. وقد أثبتت هذه الطريقة كفاءة عالية خاصة في الوثائق الأطول؛ فحتى مع وجود عشر صفحات من البيانات، حافظ نهج "صفحة بصفحة" على دقة تزيد عن 98 بالمائة. وفي المقابل، عندما طُلب من نفس النموذج عرض التقرير المكون من عشر صفحات بالكامل دفعة واحدة، انخفضت دقته بشكل ملحو lack، لتصل إلى حوالي 91 بالمائة. فقد مال النموذج إلى تفويت الاختبارات التي تظهر في الصفحات اللاحقة عندما يكون المستند طويلاً جداً بحيث لا يمكن عرضه دفعة واحدة.
كانت المقايضة مقابل هذه الدقة العالية هي الوقت. فقد استغرقت طريقة "صفحة بصفحة" ضعف الوقت الذي استغرقه أسلوب عرض الوثيقة بالكامل تقريباً. وبينما كان نهج "الوثيقة الكاملة" أسرع وأكثر دقة للغاية عندما يجد الاختبار بالفعل، إلا أنه ببساطة فشل في رؤية العديد من الاختبارات المخفية في التقارير الطويلة. أما سير العمل الثالث، الذي استخدم نموذج Llama 3.2 Vision للنظر في الصفحات واحدة تلو الأخرى، فقد كان الأسوأ على الإطلاق؛ إذ استغرق أطول وقت للإنجاز، بمتوسط يزيد عن 108 ثوانٍ لكل تقرير، وكثيراً ما أنتج سجلات غير صحيحة أو أفلتت منه البيانات، محققاً دقة إجمالية تقل عن 88 بالمائة. وقد أشار هذا إلى أن مجرد تقسيم الوثيقة إلى أجزاء لم يكن كافياً؛ بل إن الذكاء النوعي للنموذج كان لا يقل أهمية عن طريقة التقديم.
كما بحثت الدراسة كيف تؤثر جودة الوثيقة على النتائج. ولم يشكل ما إذا كان التقرير ملفاً رقمياً نظيفاً أو نسخة ممسوحة ضوئياً من وثيقة ورقية فرقاً يذكر في أداء أفضل سير عمل. فقد حافظ نهج "صفحة بصفحة" مع نموذج Qwen2.5-VL على دقة مثالية في ظل ظروف المسح الضوئي التي تم تقييمها، والتي شملت تقارير قصيرة ومتوسطة الطول. تشير هذه النتيجة إلى أن الجودة الفيزيائية للمسح الضوئي أقل أهمية من الاستراتيجية المستخدمة لتغذية المعلومات للحاسوب. كما لاحظ الباحثون أن التخطيط المحدد لتقرير المستشفى لعب دوراً أيضاً، حيث كانت تقارير أحد المزودين أسهل قليلاً في المعالجة من الآخر، لكن الاتجاه العام ظل ثابتاً عبر كلا المصدرين.
في الختام، يوضح البحث أنه لا توجد طريقة واحدة "مثلى" لاستخراج البيانات من التقارير الطبية. فالخيار يعتمد كلياً على ما يحتاجه المستخدم. فإذا كان نظام المستشفى بحاجة إلى معالجة آلاف التقاربات بسرعة ويمكنه التسامح مع فقدان بعض التفاصيل التي يمكن تداركها لاحقاً، فقد يكون نهج "الوثيقة الكاملة" الأسرع مناسباً. ومع ذلك، إذا كان الهدف هو بناء سجل كامل وموثوق لكل نتيجة اختبار منفردة، خاصة من الوثائق الطويلة والمعقدة، فإن طريقة "صفحة بصفحة" الأبطأ هي الخيار الأفضل. وتخلص الدراسة إلى أن الطريقة التي تُقدم بها الوثيقة لنظام الذكاء الاصطناعي هي قرار تصميمي حاسم يؤثر مباشرة على موثوقية البيانات الطبية التي ينتجها.
غارق في أبحاث مجالك؟
تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.