← أحدث الأبحاث
💬 NLP

CMRAG: Co-modality-based visual document retrieval and question answering

تقترح الورقة البحثية إطار عمل CMRAG، وهو إطار مبتكر يعزز استرجاع الوثائق المرئية والإجابة على الأسئلة من خلال توحيد الوسائط النصية والصورية عبر فضاء تضمين مشترك وطريقة استرجاع مشتركة الوسائط ومعيرة، مما يؤدي إلى التفوق على النهج الحالية أحادية الوسائط.

المؤلفون الأصليون: Wang Chen, Wenhan Yu, Guanqiang Qi, Weikang Li, Yang Li, Lei Sha, Deguo Xia, Jizhou Huang

نُشر 2026-03-09
📖 3 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Wang Chen, Wenhan Yu, Guanqiang Qi, Weikang Li, Yang Li, Lei Sha, Deguo Xia, Jizhou Huang

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تحاول العثور على حقيقة محددة داخل مكتبة ضخمة وفوضوية. هذه المكتبة لا تحتوي فقط على كتب بها كلمات، بل تضم كتباً مليئة بالرسوم البيانية، والصور، والملاحظات المكتوبة بخط اليد، والمخططات المعقدة.

هذه هي المشكلة التي يحاول بحث CMRAG حلها.

المشكلة: أمناء المكتبة "أحادو الرؤية"

حالياً، هناك نوعان رئيسيان من "أمناء المكتبات" (أنظمة الذكاء الاصطناي) الذين يحاولون مساعدتك في العثور على المعلومات في هذه المستندات:

  1. أمين المكتبة المتخصص في النصوص فقط: هذا الأمين سريع للغاية في قراءة الكلمات. إذا سألته: "ما هي الإيرادات في عام 2023؟"، فإنه يمسح النص ويجد الإجابة فوراً. ولكن، إذا كانت الإجابة داخل رسم بياني معقد أو صورة لرسم توضيحي، فإنه يكون أعمى. لا يمكنه رؤية الصورة، لذا سيفوت الإجابة.
  2. أمين المكتبة المتخصص في الصور فقط: هذا الأمين بارع في النظر إلى الصور. يمكنه "رؤية" الرسم البياني والمخطط. ولكن، هو سيئ جداً في قراءة النصوص الصغيرة والكثيفة داخل المستند. إذا كانت الإجابة مخفية في فقرة نصية، فقد يفوتها لأنه يركز بشدة على التنسيق البصري.

يحاول كلا الأُمناء حل اللغز بعين واحدة مفتوحة فقط، مما يؤدي إلى وقوع الأخطاء.

الحل: أمين المكتبة "متعدد اللغات" (CMRAG)

قام مؤلفو هذا البحث ببناء نوع جديد من أمناء المكتبات يسمى CMRAG (RAG متعدد الوسائط). فكر في هذا الأمين كخبير متعدد اللغات يمكنه قراءة النصوص ورؤية الصور ببراعة في نفس الوقت.

إليك كيف بنوا هذا "الأمين الخارق"، باستخدام تشبيه بسيط:

1. المترجم العالمي (نموذج الترميز الموحد)

تخيل أن لديك مستنداً نصياً وصورة لمستند. في الأيام الخوالي، كان الكمبيوتر يعامل هذه الأشياء كلغات مختلفة تماماً (مثل الإنجليزية والفرنسية) لا تختلط جيداً.

يقدم CMRAG مترجماً عالمياً. فهو يأخذ النص، والصورة، وسؤالك، ويترجمها جميعاً إلى "لغة سرية" مشتركة واحدة (فضاء رياضي).

  • التشبيه: تخيل أن لديك خريطة حيث يتم تحديد "المنزل الأحمر" (وصف نصي) و"صورة لمنزل أحمر" في نفس الموقع تماماً. الآن، يمكن للكمبيوتر أن يرى فوراً أنهما الشيء نفسه، رغم أن أحدهما كلمات والآخر صورة.

2. حَكَم النقاط العادل (الاسترجاع الموحد)

عندما يبحث أمين المكتبة عن إجابة، فإنه يحصل على درجتين:

  • الدرجة (أ): مدى مطابقة النص لسؤالك.
  • الدرجة (ب): مدى مطابقة الصورة لسؤالك.

المشكلة هي أن درجات النص ودرجات الصور تُقاس بمقاييس مختلفة (مثل مقارنة "الأميال" بـ "الكيلومترات"). إذا قمت بمجرد جمعهما، فقد يطغى أحدهما على الآخر عن طريق الخطأ.

يستخدم CMRAG حَكَم نقاط عادلاً. قبل جمع الدرجات، يقومون بتوحيدها (مثل تحويل كل من الأميال والكيلومترات إلى أمتار). هذا يضمن أن النص والصورة يحصلان على تصويت عادل. القرار النهائي هو مزيج متوازن بين ما يقوله النص وما تظهره الصورة.

لماذا يهم هذا الأمر؟

اختبر المؤلفون هذا الأمين الجديد في مهام صعبة، مثل قراءة التقارير المالية، والأوراق العلمية، والعروض التقديمية.

  • النتيجة: تفوق CMRAG باستمرار على "الأمناء أحادي الرؤية" القدامى.
  • لحظة الإدراك: في إحدى حالات الاختبار، نظر أمين المكتبة المتخصص في الصور فقط إلى رسم بياني وخمن رقماً خاطئاً لأنه لم يستطع قراءة الملصقات الصغيرة. أما أمين المكتبة المتخصص في النصوص فقد أغفل الرسم البياني تماماً. ومع ذلك، استطاع CMRAG قراءة النص ورؤية الرسم البياني، وجمع بينهما للحصول على الإجابة المثالية.

الخلاصة الكبرى

لقد أصدر المؤلفون أيضاً مجموعة بيانات ضخمة من الثلاثيات (سؤال + نص + صورة) لمساعدة الباحثين الآخرين على بناء أنظمة أفضل.

باخت-القول: إذا كنت تريد من الذكاء الاصطناعي أن يفهم المستندات المعقدة (مثل التقارير الطبية، أو العقود القانونية، أو الأوراق العلمية)، فلا يمكنك مجرد أن تطلب منه أن "يقرأ" أو فقط أن "ينظر". يجب أن يفعل كليهما في وقت واحد، مع معاملة النص والصور كشركاء وليس كمنافسين. CMRAG هو الإطار الذي يجعل هذه الشراكة ممكنة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →