← أحدث الأبحاث
💬 NLP

SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding

يحتوي النص المقدم على عدم تطابق بين العنوان ("SlideAgent") والملخص (الذي يصف إطار عمل باسم "SARA" للـ RAG الهجين)، ولكن بناءً على محتوى الملخص، تقترح الورقة البحثية SARA، وهو إطار عمل هجين لتوليد المخرقات المعززة بالاسترجاع يجمع بين مقتطفات اللغة الطبيعية ومتجهات الضغط الدلالي لتحسين صلة الإجابة وصحتها والتشابه الدلالي بشكل كبير عبر مجموعات بيانات متعددة ونماذج لغوية كبيرة مفتوحة المصدر تحت ميزانيات ثابتة لعدد الرموز (tokens).

المؤلفون الأصليون: Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar

نُشر 2026-04-24
📖 4 دقيقة قراءة☕ قراءة في استراحة قهوة

المؤلفون الأصليون: Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar

البحث الأصلي مرخَّص بموجب CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). هذا شرح مولَّده بالذكاء الاصطناعي للبحث أدناه. لم يكتبه المؤلفون ولم يصادقوا عليه. وللتحقق من الدقة التقنية، يرجى الرجوع إلى البحث الأصلي. اقرأ إخلاء المسؤولية الكامل

تخيل أنك تسلمت عرضاً تقديمياً ضخماً لعمل تجاري مكون من 100 صفحة. إنه مليء بالرسوم البيانية الملونة، والحواشي الصغيرة، والرسوم البيانية المعقدة، والنصوص المبعثرة في كل مكان. ثم طرحت سؤالاً محدداً: "كم عدد فئات المنتجات في مزيج الربع الثاني من عام 2015؟"

إذا سألت ذكاءً اصطناعياً عادياً (نموذج لغوي كبير متعدد الوسائط، أو MLLM) أن ينظر إلى الشريحة بأكملها دفعة واحدة، فقد يشعر بالارتباك. الأمر يشبه محاولة العثور على إبرة معينة في كومة قش عبر النظر إلى المستودع بأكمله بنظرة واحدة. قد يخمن الذكاء الاصطناعي أن العدد "سبعة" لأنه يرى الكثير من العناصر، لكنه يغفل عن حقيقة أن فئة واحدة مخفية في زاوية صغيرة من رسم بياني.

SlideAgent هو نظام جديد وأكثر ذكاءً صُمم لحل هذه المشكلة. لا تنظر إليه كعقل خارق واحد، بل كـ وكالة تحريات منظمة للغاية تضم فريقاً من الخبراء المتخصصين الذين يعملون معاً.

إليك كيف يعمل SlideAgent، باستخدام تشبيه بسيط:

فريق التحري الثلاثي المستويات

بدلاً من وجود ذكاء اصطناعي واحد يحاول القيام بكل شيء، يقوم SlideAgent بتقسيم المهمة إلى ثلاثة مستويات، مثل شركة تضم مديراً تنفيذياً، ومديراً للمشاريع، ومحللاً جنائياً.

1. المدير التنفيذي (الوكيل العالمي - Global Agent)

  • الدور: الصورة الكبيرة.
  • ماذا يفعل: قبل الغوص في التفاصيل، ينظر "المدير التنفيذي" إلى الصفحات الأولى من المستند لفهم الموضوع الرئيسي. هل هذا تقرير مالي؟ أم عرض تسويقي؟ أم محاضرة علمية؟
  • التشبيه: تخيل أنك تدخل مكتبة. المدير التنفيذي لا يقرأ كل الكتب؛ بل ينظر إلى فهرس المكتبة واللافتة الرئيسية ليعرف: "حسناً، هذا قسم التمويل". هذا يساعد الفريق على معرفة ما يجب توقعه.

2. مدير المشاريع (وكيل الصفحة - Page Agent)

  • الدور: حافظ السياق.
  • ماذا يفعل: يذهب هذا الوكيل صفحة بصفحة. يقرأ ملخص الشريحة الحالية ويتذكر ما حدث في الشريحة السابقة. إنه يربط النقاط بين الصفحات.
  • التشبيه: إذا قال المدير التنفيذي: "نحن نتحدث عن التمويل"، فإن مدير المشاريع يقول: "حسناً، الشريحة 1 كانت عن الميزانية، والشريحة 2 عن فريق المبيعات. الشريحة 3 لا بد أنها تربط بين هذين الأمرين". هذا يضمن عدم ضياع الذكاء الاصطناعي أو نسيانه لتسلسل القصة.

3. المحلل الجنائي (وكيل العناصر - Element Agent)

  • الدور: الكشاف الدقيق.
  • ماذا يفعل: هذا هو الجزء الأهم للأسئلة الصعبة. عندما يحتاج الفريق إلى رقم محدد أو تفصيل صغير، يقوم المحلل بالتقريب (Zoom in). هو لا ينظر فقط إلى الشريحة بأكملها؛ بل يعزل عناصر محددة مثل رسم بياني واحد، أو مربع نص معين، أو أيقونة.
  • التشبيه: إذا سألت: "كم عدد التفاحات الحمراء في السلة؟" فإن المحلل لا ينظر إلى طاولة النزهة بأكملها. بل يضع عدسة مكبرة، ويجد السلة، ويعد التفاحات الحمراء واحدة تلو الأخرى، ويتجاهل السندوتشات أو التوت الأزرق. هذا يمنع الذكاء الاصطناعي من الخطأ في العد بسبب الخلفية المزدحمة.

كيف يعملون معاً: "المنسق" (The Orchestrator)

عندما تطرح سؤالاً، يقرر المنسق أي من المحققين يجب أن يستيقظ.

  • السؤال: "ما هو الهدف الرئيسي لهذا العرض التقديمي؟"
    • المنسق: "أيقظ المدير التنفيذي فقط". (لا حاجة لعد التفاح).
  • السؤال: "ما هي الإيرادات في الشريحة رقم 5؟"
    • المنسق: "أيقظ مدير المشاريع للعثور على الشريحة 5، والمحلل لقراءة الرقم المحدد".
  • السؤال: "قارن بين المبيعات في الشريحة 2 والشريحة 10."
    • المنسق: "أيقظ الجميع. نحن بحاجة إلى الصورة الكبيرة، وسياق كلتا الصفحتين، والأرقام المحددة من كلا الرسمين البيانيين".

لماذا يعد هذا أفضل؟

النماذج الحالية للذكاء الاصطناعي تشبه طالباً يحاول حفظ كتاب مدرسي كامل عن طريق قراءة صفحة واحدة في كل مرة دون تدوين ملاحظات. غالباً ما يفوتون التفاصيل الصغيرة أو يرتبكون بسبب التنسيق.

SlideAgent يشبه فريقاً من الخبراء مع نظام أرشفة:

  1. ينظمون أولاً: يبنون خريطة هيكلية للمستند (عالمي، صفحة، عنصر) قبل الإجابة.
  2. يقربون الرؤية عند الحاجة: هم لا يخمنون؛ بل يعزلون الرسم البياني أو مربع النص المطلوب بدقة.
  3. يراجعون عملهم: الإجابة النهائية هي توليفة من المستويات الثلاثة، مما يضمن اتفاق "المدير التنفيذي" مع "المحلل".

النتيجة

في الاختبارات، جعل هذا النهج القائم على الفريق الذكاء الاصطناعي أكثر ذكاءً بشكل ملحوظ. لقد حسّن الدقة بنسبة تقارب 8% إلى 10% مقارنة بأفضل نماذج الذكاء الاصطناعي الموجودة. إنه الفرق بين نموذج يخمن الإجابة بناءً على صورة ضبابية، ونموذج يقرأ الخطوط الدقيقة، ويفهم السياق، ويعطيك الرقم الدقيق.

باخت_صار: يتوقف SlideAgent عن محاولة أن يكون "روبوتاً خارقاً" يفعل كل شيء في وقت واحد. بدلاً من ذلك، يبني فريقاً هرمياً يعرف متى ينظر إلى الغابة، ومتى ينظر إلى الأشجار، ومتى ينظر إلى ورقة شجر واحدة.

غارق في أبحاث مجالك؟

تصلك نشرة يومية بأحدث الأبحاث المطابقة لكلماتك البحثية المفتاحية — مع ملخصات تقنية، بلغتك.

جرّب Digest →